# Tencent AI 開放 WorkBuddy Bench，以 260 項任務評估模型與 Agent harness

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Tencent AI (@TencentAI_News) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥 · 日期：2026-08-12

> 原始來源：https://x.com/TencentAI_News/status/2087060813970616614

## 證據與延伸閱讀

- [Tencent AI 開放 WorkBuddy Bench，以 260 項任務評估模型與 Agent harness](http://github.com/Tencent/workbuddy-bench) — 官方 Repository
- [重點非單一模型勝出](https://x.com/TencentAI_News/status/2087060813970616614)
- [WorkBuddy Bench 資料集](https://huggingface.co/datasets/tencent/workbuddy-bench) — 官方文件

## 中文摘要

Tencent AI 開放 WorkBuddy Bench，以 260 項任務評估模型與 Agent harness。

這項分享的重點不是宣布單一模型全面勝出，而是提醒團隊：真實工作中的工具配置與上下文，可能和模型選擇一樣關鍵。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/f2924d7711e2fcc5.png)
> TENCENT WORKBUDDY BENCH 的標誌圖像，左側為綠色帶白色貓咪剪影的圖示與黑色的「TENCENT WORKBUDDY.」字樣，右側則有青綠色底色框著黑色的「BENCH」字樣。

**分享動機** Tencent AI 表示，他們原本想用一套評測回答「哪個模型適合哪種工作」，但現有 benchmark 沒有涵蓋這個問題，因此自行建立 WorkBuddy Bench。該專案已開放原始碼，repo 位於 [Tencent/workbuddy-bench](http://github.com/Tencent/workbuddy-bench)；評測結果也不被定位為定論，因為 260 項任務仍無法完整捕捉實際工作的複雜性。

**三項觀察** Tencent AI 從實測中提出三個意外發現：

- 沒有任何模型在所有軌道都勝出，各類任務的領先者不同；在兩套測試配置中，GLM-5.2 都拿下 Security 軌道第一。
- 模型外部的 scaffolding——包括執行模型的 client 與 harness——會大幅影響分數。同一模型、同一批任務，只要更換 client，Security 排名就可能重新洗牌。
- Code 任務的困難不只在於撰寫程式碼，更在於理解上下文；其中 bug 修復與 API contract 是最棘手的類別。

**評測內容** WorkBuddy Bench 將真實開發者、產品經理、演算法、QA、維運與安全工作反向整理成四個子集。Agent 會在 Docker 沙盒 workspace 中完成修改、產出 asset 或報告，再由測試套件評分：

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/898734512e05c290.png)
> 綠色標誌與白色字樣組成的 BENCH 標題橫幅，左側帶有一個綠底白圖的貓咪形狀圖示。

- Code：80 項 repo-level Python 軟體工程任務，要求 Agent 從基準 commit 找出問題、跨模組修改程式碼並通過測試。
- Web：70 項 HTML、CSS、JavaScript 前端與 GUI 任務，涵蓋互動、資料視覺化、視覺設計、專案分析、測試、頁面實作與文件轉換。
- Office：50 項混合格式檔案工作流程，處理 `xlsx`、`csv`、`pdf`、`docx`，產出完全正確的結果；難度來自結構、關聯、狀態與證據鏈，而非資料列數。
- Security：60 項紅隊與藍隊安全任務，涵蓋漏洞發現與安全重現、惡意軟體分析、資安作業，以及 Agent 攻擊面探測等六個領域。

**執行方式** 這個 repo 是評測框架，會把 Agent CLI，也就是 harness，放進本機 Docker 沙盒，批次執行任務，記錄 patch、執行軌跡、測試結果與效率，再計算分數。官方提供 `wbbench-run-setup` skill，可在 Claude Code、CodeBuddy Code 等支援 skill 的 Agent 中，從環境設定、資料集與模型配置一路引導到分析報告；也能手動操作。基本安裝步驟如下：

```bash
uv sync            # install dependencies
cp .env.example .env
```

資料集不包含在 repo 內，需從 [Hugging Face 的 tencent/workbuddy-bench](https://huggingface.co/datasets/tencent/workbuddy-bench) 下載到 `datasets/`：

```bash
./scripts/dataset/fetch-dataset.sh code   # or: web / office / sec / all
```

接著複製模型模板並填入設定；實際 URL 與 API key 應放在 `.env`，避免秘密進入版本控制：

```bash
cp configs/models/_template.model.yaml configs/models/<provider>/<slug>.yaml
```

```yaml
model:
  name: Hy3                         # the model id your backend expects
  protocols: [openai]               # openai or anthropic
  backend_url_env: MODEL_BASE_URL   # the .env var holding the base URL
  backend_key_env: MODEL_API_KEY    # the .env var holding the API key
```

**建立與執行 job** 一次評測由模型、harness 與資料集組成。先建立 job 設定：

```bash
cp configs/jobs/_template.job.yaml configs/jobs/<slug>.yaml
```

```yaml
model: <provider>/<slug>                  # a model under configs/models/
harness: codebuddy-code/<version>         # the agent CLI to evaluate
dataset: datasets/wb-bench-code-v1.0/tasks
```

最後依序檢查、預覽並執行：

```bash
uv run ./scripts/run.sh --help                  # list available jobs
uv run ./scripts/run.sh --job <slug> --dry-run  # preview what will run, then exit
uv run ./scripts/run.sh --job <slug>            # run it
```

結果會寫入 `results/`。Tencent AI 強調，WorkBuddy Bench 更像持續研究工作的起點：它揭示模型、client、harness 與上下文彼此牽動，但不宣稱現有分數足以代表所有真實工作場景。

## 標籤

Benchmark, Agent, 研究論文, Tencent, WorkBuddy Bench
