# Agent 排行榜改進：分類與任務成本

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Arena.ai (@arena) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥 · 日期：2026-08-18

> 原始來源：https://x.com/arena/status/2089463489274466396

## 證據與延伸閱讀

- [# Agent 排行榜改進：分類與任務成本](https://x.com/i/article/2089454679130578944)
- [Claude Sonnet 5 成本變化](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/b11de33f92d359df.jpg)
- [Work、Chat與Code任務佔比](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/72772a49304d7d82.jpg)
- [Claude Opus 5 與 GPT 5.6 排名](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/89182f99a498b329.jpg)

## 中文摘要

# Agent 排行榜改進：分類與任務成本

Agent 被要求執行的工作種類越來越多。這表示，單一、只看效能的 Agentic 排行榜已經不夠用了。要決定該使用哪個模型，關鍵在於兩個問題：哪個模型最適合我的特定任務類型？完成這項任務需要花多少成本？我們希望透過 Agent Arena 的最新更新，協助回答這些問題。

我們分析了 Agent Mode 中超過 170 萬個使用者工作階段，找出使用者最常交由 Agent 處理的任務類別，並測量完成這些任務的實際成本。今天，我們在 Agent Arena 中推出兩項互補功能，協助使用者更細緻地了解各模型之間的表現差異：

- Agent 成本：查看每個模型完成一項任務所需的成本，並透過 Pareto Frontier 檢視在各種效能水準下，成本效益最高的模型

- Agent 分類：依照三種類別篩選排行榜，了解模型在 Code、Chat 與 Work 中的排名

這兩項功能讓 Agent Arena 從單一排名轉變為更個人化的指南，協助你針對自己的使用情境，在合適的價格點找到合適的模型。以下就讓我們深入看看這兩項功能：

# 一項任務的成本

由於人們使用 Agent 來完成任務，因此在 Agent Arena 中呈現成本時，需要更細緻地考量。我們選擇以每項任務的價格作為 Agent 成本的主要衡量方式，以反映 Agent 的實際使用方式。我們透過真實 Agent Mode 工作階段中由使用者完成的任務來進行測量。這次更新也將每項任務的輸出 token 數量，以及每百萬 token 的成本加入 Agent 排行榜。

## 任務邊界

為了公平衡量成本，我們需要一個能在不同模型之間比較的共同工作單位。我們選擇將單項任務作為成本的主要單位。接著，我們把 Agent Mode 工作階段切分成離散的任務邊界，以計算每項任務的成本。

例如，單項任務可能是使用者要求 Agent 將一段樂譜重新編排成適合小提琴演奏的版本。這項任務歷經四輪互動：使用者與 Agent 來回確認細節，直到 Agent 產生最終編曲；此時任務完成，使用者接著進入另一項任務。

這種任務切分方式也讓我們能測量每項任務所需的輸出 token 數量，進而協助衡量模型的 token 效率，因為不同模型為了完成相同任務，往往會使用不同數量的 token。

## 衡量任務成本

定義好「任務」的邊界後，接著就是實際計算成本。若直接計算一個工作階段中所有任務的平均成本，會讓那些在長時間工作階段中被抽樣到的模型看起來較為昂貴。這是因為長時間工作階段可能透過 context 延續效應，將成本拉高。較長的工作階段會累積更多 context，而這些 context 會在每一輪互動中被處理；因此，工作階段後段的任務成本會變高，無論模型本身的成本效率如何。

使用者與某些模型互動得更頻繁，導致這些模型的工作階段較長，也產生較高的 context 延續效應。我們不希望較具黏著力、因此表現較強的模型被誇大其測得成本，也不希望成本指標反過來獎勵黏著力較低的弱模型。

為了以具代表性的方式衡量成本，我們決定最多只追蹤 Agent Arena 工作階段中的前三項任務。這有助於降低延續成本的影響，建立公平的比較標準。

![Claude Sonnet 5 在 15 項任務與 340 個 turn 的測試中，每 turn 成本隨脈絡累積在第 185 turn 前最高達 $3.10 美元（主要由 Cache write 佔據），並在經過 Compaction boundary 壓縮後成本顯著降低。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/b11de33f92d359df.jpg)
> Claude Sonnet 5 在 340 輪對話與 15 項任務的執行過程中，每輪成本隨著快取累積上升，並在第 185 輪觸發 Compaction 後大幅降低每輪成本。

<details class="chart-data"><summary>展開數據表</summary><table><thead><tr><th>項目</th><th>數值</th></tr></thead><tbody><tr><td>Claude Sonnet 5 340 turns · 15 tasks</td><td></td></tr><tr><td>Uncached input priced at $2.00/M tokens; other components use recorded provider cost.</td><td></td></tr><tr><td>類別 · Cache read (藍) · Cache write (橘) · Uncached input (綠) · Output (粉) · Other (紫) · Task boundary (虛線) · Compaction boundary (黑實線標菱形)</td><td></td></tr><tr><td>T4</td><td>15-52</td></tr><tr><td>T6</td><td>53-114</td></tr><tr><td>T7</td><td>115-148</td></tr><tr><td>T8</td><td>Assistant turn 149-185 · 最高成本 ~$3.10</td></tr><tr><td>Compaction boundary</td><td>185</td></tr><tr><td>T9</td><td>186-263</td></tr><tr><td>T10</td><td>264-325</td></tr><tr><td>Turn 97 標註</td><td>Cost $1.092 total · Cache reads 0.0%</td></tr></tbody></table></details>

## Pareto Frontier

有了淨改善分數與成本這兩項資料，我們就具備了視覺化呈現模型價格與效能取捨關係的必要要素。新的 Agent Pareto 檢視會繪製 Agent Arena 中的每個模型，以 y 軸表示淨改善分數，以 x 軸表示每項任務的成本。這條 frontier 代表各個價格點上最高淨改善程度的邊界，凸顯出那些若不支付更多費用，就無法取得更佳效能的模型。

你可以檢視成本與效能之間的 Pareto Frontier，並選擇依照每項任務的 p25、p50 或 p95 成本查看 frontier。為了用真實的 Agent Arena 範例具體說明：短任務可能是使用者要求產生一張單一插圖，只需一輪互動，幾秒內即可完成。中位數任務則可能是為網站建立一個簡單的前端，需要來回互動數次，並持續幾分鐘。長任務則可能是將網頁工具製作成行動應用程式版本，使用者在數小時內持續使用的過程中，還需要一併處理錯誤與建置問題。

你也可以根據模型每項任務的輸出 token 效率，查看模型的 Pareto Frontier。這些數字是在 Agent Arena 中測量模型執行真實工作的實際結果，而不是受控的靜態基準測試。

![Claude Opus 5、GPT 5.6 Sol、DeepSeek V4 Flash 等模型在每任務中位數成本（Median cost per task）與相對表現上的比較。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/b8ca15a4d3d6905b.jpg)
> Claude Opus 5、GPT 5.6 Sol、DeepSeek V4 Flash 等模型在每項任務中位數成本（Median cost per task）與相對表現上的 Pareto Frontier 比較。

# Agent Arena 中的分類

分類是我們整理 Agent Arena 追蹤記錄的主要方式。每筆追蹤記錄都可以標記一個或多個分類，因為真實的 Agentic 任務往往同時應用於多個領域。

我們定義分類時，考量了以下幾點：

- 容易理解

- 涵蓋 Agent Arena 中很大一部分的使用者行為

- 不同分類之間的任務意圖具有實質差異

- 代表與經濟相關的 Agentic 任務區隔

- 具備統計穩健性，有足夠樣本支援可靠的排行榜表現

當你查看分類排行榜時，看到的是與主要 Agent Arena 相同的評估方法，只是篩選到特定的追蹤記錄領域。這讓分類成為比較模型在不同類型 Agentic 任務上表現的強大工具。

根據我們分析的追蹤記錄，我們推出三種類別。這些分類涵蓋 Agent Arena 中使用者的三種核心意圖：Code、Chat 與 Work。

- Code：使用者要求 Agent 撰寫程式碼、除錯程式碼、自動化工作流程或分析資料的工作階段。

- Chat：一般 Agentic 聊天使用情境，例如創意寫作、學習、個人生活相關問題、日常研究，以及媒體生成。

- Work：通常會在辦公室工作情境中看到的任務，例如建立文件、專業研究、規劃與專業寫作。

在超過 170 萬個工作階段中，Work 是最常見的分類。原文正文寫 69.1%，附圖則標示 69.2%；Chat 與 Code 分別為 39.0% 與 38.8%。這些分類加總超過 100%，是因為同一項任務可能同時屬於多個分類。

![Work 類別以 69.2% 的占比領先 Chat（39.0%）與 Code（38.8%）。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/72772a49304d7d82.jpg)
> Work 類別以 69.2% 的任務佔比領先 Chat（39.0%）與 Code（38.8%）。

<details class="chart-data"><summary>展開數據表</summary><table><thead><tr><th>項目</th><th>數值</th></tr></thead><tbody><tr><td>Work</td><td class="rank-bar num bar-w-100"><span class="bar-val">69.2%</span></td></tr><tr><td>Chat</td><td class="rank-bar num bar-w-60"><span class="bar-val">39.0%</span></td></tr><tr><td>Code</td><td class="rank-bar num bar-w-60"><span class="bar-val">38.8%</span></td></tr></tbody></table></details>

# 模型在不同分類中的表現

單一的整體排名，可能會掩蓋每個模型最擅長之處的實質差異。分類排行榜展示了頂尖 Agentic 模型在各自特定優勢上的不同。

原文文字與附圖快照的名次不同：文字段落稱 Claude Opus 5 (High) 在 Overall 與 Work 排名第一，Claude Opus 4.7 (High) 為 Overall 第 8、Chat 第 3；附圖則顯示 Claude Opus 5 (Max) 在 Overall、Work 與 Chat 均排名第一，Claude Opus 5 (High) 排名第二，Claude Opus 4.7 (High) 為 Overall 第 3、Chat 第 4。GPT 5.6 Sol (xHigh) 在兩者的 Code 排名都是第一。下方圖說與資料表依附圖轉錄，不混用兩組名次。

若想更完整地了解這些模型及其他模型在不同分類中的比較結果，歡迎探索完整的分類排行榜。

![Claude Opus 5 (Max) 在 Overall、Work 與 Chat 項目排名第一，GPT 5.6 Sol (xHigh) 則在 Code 項目位居第一。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/89182f99a498b329.jpg)
> Claude Opus 5 (Max) 在 Overall、Work 與 Chat 類別中均位居第 1 名，而 GPT 5.6 Sol (xHigh) 則在 Code 類別中排名第 1。

<details class="chart-data"><summary>展開數據表</summary><table><thead><tr><th></th><th>Overall</th><th>Work</th><th>Code</th><th>Chat</th></tr></thead><tbody><tr><td>Claude Opus 5 (Max)</td><td class="rank-bar num bar-w-0"><span class="bar-val">1</span></td><td class="rank-bar num bar-w-0"><span class="bar-val">1</span></td><td class="rank-bar num bar-w-10"><span class="bar-val">2</span></td><td class="rank-bar num bar-w-0"><span class="bar-val">1</span></td></tr><tr><td>Claude Opus 5 (High)</td><td class="rank-bar num bar-w-10"><span class="bar-val">2</span></td><td class="rank-bar num bar-w-10"><span class="bar-val">2</span></td><td class="rank-bar num bar-w-10"><span class="bar-val">3</span></td><td class="rank-bar num bar-w-10"><span class="bar-val">2</span></td></tr><tr><td>Claude Opus 4.7 (High)</td><td class="rank-bar num bar-w-10"><span class="bar-val">3</span></td><td class="rank-bar num bar-w-10"><span class="bar-val">4</span></td><td class="rank-bar num bar-w-10"><span class="bar-val">4</span></td><td class="rank-bar num bar-w-10"><span class="bar-val">4</span></td></tr><tr><td>GPT 5.6 Sol (xHigh)</td><td class="rank-bar num bar-w-10"><span class="bar-val">4</span></td><td class="rank-bar num bar-w-10"><span class="bar-val">3</span></td><td class="rank-bar num bar-w-0"><span class="bar-val">1</span></td><td class="rank-bar num bar-w-20"><span class="bar-val">5</span></td></tr><tr><td>Kimi K3 (Max)</td><td class="rank-bar num bar-w-20"><span class="bar-val">5</span></td><td class="rank-bar num bar-w-20"><span class="bar-val">5</span></td><td class="rank-bar num bar-w-20"><span class="bar-val">5</span></td><td class="rank-bar num bar-w-20"><span class="bar-val">6</span></td></tr><tr><td>Claude Fable 5 (High)</td><td class="rank-bar num bar-w-20"><span class="bar-val">6</span></td><td class="rank-bar num bar-w-20"><span class="bar-val">6</span></td><td class="rank-bar num bar-w-20"><span class="bar-val">6</span></td><td class="rank-bar num bar-w-20"><span class="bar-val">7</span></td></tr><tr><td>GPT 5.5 (xHigh)</td><td class="rank-bar num bar-w-20"><span class="bar-val">7</span></td><td class="rank-bar num bar-w-20"><span class="bar-val">7</span></td><td class="rank-bar num bar-w-30"><span class="bar-val">10</span></td><td class="rank-bar num bar-w-30"><span class="bar-val">9</span></td></tr><tr><td>Claude Opus 4.8 (High)</td><td class="rank-bar num bar-w-30"><span class="bar-val">8</span></td><td class="rank-bar num bar-w-30"><span class="bar-val">9</span></td><td class="rank-bar num bar-w-30"><span class="bar-val">9</span></td><td class="rank-bar num bar-w-20"><span class="bar-val">8</span></td></tr><tr><td>GLM 5.2 (Max)</td><td class="rank-bar num bar-w-50"><span class="bar-val">14</span></td><td class="rank-bar num bar-w-50"><span class="bar-val">14</span></td><td class="rank-bar num bar-w-30"><span class="bar-val">11</span></td><td class="rank-bar num bar-w-40"><span class="bar-val">13</span></td></tr><tr><td>Grok 4.5</td><td class="rank-bar num bar-w-60"><span class="bar-val">16</span></td><td class="rank-bar num bar-w-50"><span class="bar-val">15</span></td><td class="rank-bar num bar-w-50"><span class="bar-val">18</span></td><td class="rank-bar num bar-w-40"><span class="bar-val">14</span></td></tr><tr><td>GPT 5.6 Luna (xHigh)</td><td class="rank-bar num bar-w-60"><span class="bar-val">18</span></td><td class="rank-bar num bar-w-60"><span class="bar-val">19</span></td><td class="rank-bar num bar-w-50"><span class="bar-val">16</span></td><td class="rank-bar num bar-w-80"><span class="bar-val">25</span></td></tr><tr><td>DeepSeek V4 Flash (High)</td><td class="rank-bar num bar-w-70"><span class="bar-val">19</span></td><td class="rank-bar num bar-w-60"><span class="bar-val">18</span></td><td class="rank-bar num bar-w-50"><span class="bar-val">17</span></td><td class="rank-bar num bar-w-100"><span class="bar-val">33</span></td></tr><tr><td>Gemini 3.5 Flash (High)</td><td class="rank-bar num bar-w-100"><span class="bar-val">29</span></td><td class="rank-bar num bar-w-100"><span class="bar-val">31</span></td><td class="rank-bar num bar-w-100"><span class="bar-val">33</span></td><td class="rank-bar num bar-w-80"><span class="bar-val">26</span></td></tr></tbody></table></details>

## Prompt 範例

若想更清楚了解哪些類型的 Prompt 會歸入各個分類，請參考以下範例 Prompt。

![包含 Code、Chat 與 Work 三個分類的 prompt 範例列表畫面](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/74251a34b010e525.jpg)
> 顯示三個不同類別提示內容的介面，分別標註為 Code、Chat 與 Work，各區塊內包含一段針對遊戲開發、健康研究搜尋與絕熱性能測試報告的詳細說明文字。

<details class="chart-data"><summary>展開畫面重點</summary><div class="me-note">畫面分為三個區塊，分別標示為 Code、Chat 與 Work，每個區塊下方各有一個深色文字方塊，內容如下：

Code:
Build a polished, playable browser game: open world realistic, no blocky characters, ray tracing. Make the core loop fun within the first ten seconds, with tight controls for both keyboard and touch, and juicy feedback – screen shake, particle effects, and satisfying animations. Include a start screen, a score system, pause and game-over states with instant restart, and a local high-score table. Style it with a cohesive visual theme and make sure it runs smoothly at 60fps on desktop and mobile.

Chat:
Search the world for what's happening in the field of CFS/ME. Do a deep search of f news, studies and even social media. Find out if there are any new and promising approaches. Also find out about ways to enhance energy mental and physical.

Work:
Create a report on thermal insulation performance testing system including case studies of HVAC, green houses, commercial energy plants along with their origins along with the working principles with classification of the TIPS with their cost and purpose</div></details>

# 探索 Agent Arena

現在就可以在 Agent Arena 上探索分類排行榜、成本欄位與 Pareto 檢視，也可以閱讀我們部落格文章中介紹 Agent Arena 排名背後方法論的內容。使用 Agent Mode 並投下你的票，協助我們塑造未來的評估方式。

## 媒體內容

**Claude Sonnet 5 在 340 輪對話與 15 項任務的執行過程中，每輪成本隨著快取累積上升，並在第 185 輪觸發 Compaction 後大幅降低每輪成本。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| other components use recorded provider cost. |  |
| 任務區段 · T4, T6, T7, T8, T9, T10 |  |
| Compaction boundary · Assistant turn 185 |  |
| 標註點 · Turn 97：$1.092 total |  |
| 0.0% of input tokens were cache reads |  |
| task 6, turn 37 of 54 |  |
| 關鍵輪數成本摘要 | Turn 1 $0.20 · Turn 155 Peak $3.10 · Turn 185 Compaction前 $2.50 · Turn 186 Compaction後 $0.10 · Turn 340 $0.85 |

**Claude Opus 5、GPT 5.6 Sol、DeepSeek V4 Flash 等模型在每項任務中位數成本（Median cost per task）與相對表現上的 Pareto Frontier 比較。**

**數據表**

|   |
| --- |
| 圖表 · 各模型的相對表現與每項任務中位數成本（最近 7 天）Pareto Frontier |
| X 軸（由左至右成本下降） · $2 · $1 · $0.50 · $0.20 · $0.10 · $0.05 |
| Y 軸 · +10.00% · +5.00% · +0.00% · -5.00% · -10.00% · -15.00% |
| Frontier 標示模型 · Claude Opus 5 (High) · Claude Opus 4.8 (High) · GPT 5.6 Sol (xHigh) · Qwen3.8 Max · GLM 5.2 (Max) · Deepseek V4 Flash (High) (20260731) · GPT 5.6 Luna (xHigh) |
| 其他標示模型 · GPT 5.5 (High) |

**Work 類別以 69.2% 的任務佔比領先 Chat（39.0%）與 Code（38.8%）。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Work | 69.2% |
| Chat | 39.0% |
| Code | 38.8% |

**Claude Opus 5 (Max) 在 Overall、Work 與 Chat 類別中均位居第 1 名，而 GPT 5.6 Sol (xHigh) 則在 Code 類別中排名第 1。**

**數據表**

|   | Overall | Work | Code | Chat |
| --- | --- | --- | --- | --- |
| Claude Opus 5 (Max) | 1 | 1 | 2 | 1 |
| Claude Opus 5 (High) | 2 | 2 | 3 | 2 |
| Claude Opus 4.7 (High) | 3 | 4 | 4 | 4 |
| GPT 5.6 Sol (xHigh) | 4 | 3 | 1 | 5 |
| Kimi K3 (Max) | 5 | 5 | 5 | 6 |
| Claude Fable 5 (High) | 6 | 6 | 6 | 7 |
| GPT 5.5 (xHigh) | 7 | 7 | 10 | 9 |
| Claude Opus 4.8 (High) | 8 | 9 | 9 | 8 |
| GLM 5.2 (Max) | 14 | 14 | 11 | 13 |
| Grok 4.5 | 16 | 15 | 18 | 14 |
| GPT 5.6 Luna (xHigh) | 18 | 19 | 16 | 25 |
| DeepSeek V4 Flash (High) | 19 | 18 | 17 | 33 |
| Gemini 3.5 Flash (High) | 29 | 31 | 33 | 26 |

## 標籤

Agent, 功能更新
