# Agent Arena 比較 Agent 模型成本與排名：Kimi K3 (Max) 排名第 4，且每次 $0.62 為前八名最低

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Arena.ai (@arena) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥 · 日期：2026-08-19

> 原始來源：https://x.com/arena/status/2090147328619692153

## 證據與延伸閱讀

- [Agent Arena 比較 Agent 模型成本與排名：Kimi K3 (Max) 排名第 4，且每次 $0.62 為前八名最低。](https://pbs.twimg.com/media/HQGxYkpbMAAb3ay.jpg?name=orig)
- [涵蓋網頁搜尋、檔案系統與終端機指令](https://x.com/arena/status/2090147328619692153)

## 中文摘要

Agent Arena 比較 Agent 模型成本與排名：Kimi K3 (Max) 排名第 4，且每次 $0.62 為前八名最低。

**成本與排名**  
Agent Arena 以全球使用者完成的數百萬個長流程 Agent 任務評測模型，涵蓋網頁搜尋、檔案系統與終端機指令。前五名的單次任務中位數成本，從 Kimi K3 (Max) 的 $0.62 到 Claude Opus 5 (Max) 的 $3.37。

**價格比較**  
- Claude Opus 5 (Max)：淨改善 +12.0%，成本 $3.37  
- Opus 5 (High)：淨改善 +12.3%，成本 $1.78  
前者成本接近後者兩倍，表現卻略低。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/f969bd2313dfadbb.jpg)
> Claude Opus 5 (High) 在 Agent Arena 以 +12.3% 的淨改善度位居第一，每項任務中位數成本為 $1.78，表現略高於成本達 $3.37 的 Claude Opus 5 (Max)。

**性價比亮點**  
Kimi K3 (Max) 排名第 4，淨改善 +10.5%，且 $0.62 是前八名最低。GPT-5.6 Sol (xHigh) 排名第 5，成本 $1.39 低於前三個 Anthropic 模型，但得分為 +9.8%。

**低成本選項**  
Grok 4.5 以 $0.22 達成 +6.1%，Qwen-3.8 Max 以 $0.33 達成 +6.3%。評測以 causal tracing 估算模型相對平均模型的成果改善，再與每項任務成本比較。

## 媒體內容

**Claude Opus 5 (High) 在 Agent Arena 以 +12.3% 的淨改善度位居第一，每項任務中位數成本為 $1.78，表現略高於成本達 $3.37 的 Claude Opus 5 (Max)。**

**數據表**

|   | NET IMPROVEMENT | MEDIAN COST PER TASK (USD) |
| --- | --- | --- |
| Claude Opus 5 (High) | +12.3% | $1.78 |
| Claude Opus 5 (Max) | +12.0% | $3.37 |
| Claude Fable 5 (High) | +11.6% | $2.21 |
| Kimi K3 (Max) | +10.5% | $0.62 |
| GPT-5.6 Sol (xHigh) | +9.8% | $1.39 |
| Claude Opus 4.8 (High) | +9.6% | $1.31 |
| GPT-5.5 (xHigh) | +8.6% | $0.77 |
| Claude Opus 4.7 (High) | +8.1% | $0.82 |
| GPT-5.5 (High) | +7.8% | $0.44 |
| Claude Opus 4.7 | +7.5% | $0.80 |
| Claude Sonnet 5 (High) | +6.6% | $0.52 |
| Claude Opus 4.6 | +6.6% | $0.93 |
| GPT-5.5 | +6.4% | $0.28 |
| Qwen-3.8 Max | +6.3% | $0.33 |
| Grok 4.5 | +6.1% | $0.22 |

## 標籤

Agent, Benchmark, LLM, Kimi, Anthropic
