# DeepSeek-V4-Pro (High) 登上 Agent Arena 開放模型第 2名，每項任務中位成本僅 0.21 美元

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Arena.ai (@arena) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥 · 日期：2026-08-20

> 原始來源：https://x.com/arena/status/2090240605561778637

## 證據與延伸閱讀

- [DeepSeek-V4-Pro (High) 登上 Agent Arena 開放模型第 2名，每項任務中位成本僅 0.21 美元。](https://pbs.twimg.com/media/HQIGPKqa0AAMMly.jpg?name=orig) — 一手來源
- [Arena.ai 公布排名、成本與各項評測訊號](https://x.com/arena/status/2090240605561778637) — 官方文件

## 中文摘要

DeepSeek-V4-Pro (High) 登上 Agent Arena 開放模型第 2名，每項任務中位成本僅 0.21 美元。

**成本與排名** Arena.ai 表示，與 DeepSeek-V4-Flash (High) 相比，DeepSeek-V4-Pro (High) 不僅效能更高，每項任務的中位成本也更低。在開放模型中，它領先 DeepSeek-V4-Flash (High) 兩個名次；分類排名則為：

- Code：第 2 名
- Work：第 2 名
- Chat：第 5 名

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/07d25142a843fa78.jpg)
> DeepSeek-V4-Pro (High) 在 Agent Arena 前 15 大開放模型排行榜中，以 +6.3% 的淨改善幅度位居第 2 名。

**評測訊號** 這款模型在使用者確認「是的，這成功了」的 Confirmed Success 表現突出，提升 13.1%；在命令列錯誤復原的 Bash Recovery 也提升 10.9%。各項排名如下：

- Bash Recovery：開放模型第 1、整體第 13，提升 10.9%
- Confirmed Success：開放模型第 2、整體第 4，提升 13.1%
- Praise vs Complaint：開放模型第 3、整體第 19，提升 3.8%
- Steerability：開放模型第 4、整體第 23，提升 2.4%
- Tool Hallucination：沒有明顯問題，提升 1.1%

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1d0455bb36541bbc.jpg)
> DeepSeek-V4-Pro (High) 在 Agent Arena 開放模型中排名第 2（整體排名第 14），整體淨改善幅度為 +6.3%，並在 Confirmed Success（+13.1%）與 Bash Recovery（+10.9%）取得顯著提升。

**Arena.ai 的立場** Arena.ai 以「令人振奮的更新」肯定這次發布，並再次向 @deepseek_ai 團隊致賀；不過上述數據是 Agent Arena 的排名與訊號結果，並不等同於所有使用情境下的全面優勢。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/6230de5f4933c7d1.jpg)
> DeepSeek-V4-Pro (High) 與各模型在 Agent Arena 之每任務成本與淨提升幅度的比較

## 媒體內容

**DeepSeek-V4-Pro (High) 在 Agent Arena 前 15 大開放模型排行榜中，以 +6.3% 的淨改善幅度位居第 2 名。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| 1. Kimi K3 (Max) | +10.4% |
| 2. DeepSeek-V4-Pro (High) | +6.3% |
| 3. GLM-5.2 (Max) | +5.8% |
| 4. DeepSeek-V4-Flash (High) | +4.0% |
| 5. Kimi-K2.7 Code | +0.4% |
| 6. DeepSeek-V4 Pro | +0.1% |
| 7. GLM-5.1 | 0.0% |
| 8. Kimi-K2.6 Code | -1.1% |
| 9. MiMo-V2.5 Pro | -2.3% |
| 10. HY3 | -2.4% |
| 11. MiniMax-M3 | -3.1% |
| 12. Inkling Small | -6.8% |
| 13. Inkling | -7.2% |
| 14. Mistral Medium 3.5 | -7.6% |
| 15. MiniMax-M2.7 | -11.9% |

**DeepSeek-V4-Pro (High) 在 Agent Arena 開放模型中排名第 2（整體排名第 14），整體淨改善幅度為 +6.3%，並在 Confirmed Success（+13.1%）與 Bash Recovery（+10.9%）取得顯著提升。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| OVERALL RANK | #14 |
| OPEN RANK | #2 |
| NET IMPROVEMENT | +6.3% |
| Overall (Rank #14) | +6.3% |
| Confirmed Success (Rank #4) | +13.1% |
| Praise vs Complaint (Rank #19) | +3.8% |
| Steerability (Rank #23) | +2.4% |
| Bash Recovery (Rank #13) | +10.9% |
| Tool Hallucination (Rank #7) | +1.1% |

## 標籤

Agent, LLM, Benchmark, DeepSeek-V4-Pro, DeepSeek-V4-Flash
