# Claude Opus 5 在 DeepSWE 評測奪得最高分

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Datacurve (@datacurve) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥🔥 · 日期：2026-07-29

> 原始來源：https://x.com/datacurve/status/2082180488559759680

## 中文摘要

Claude Opus 5 在 DeepSWE 評測奪得最高分。

**評測表現與排名**
Datacurve 發布的 DeepSWE 評測結果顯示，Claude Opus 5 獲得 74% 的分數，是目前所見表現最好的長跨度程式開發模型。此外，畫面顯示的 DeepSWE v1.1 評測圖表也納入了多款模型的平均每個任務成本與效能表現，包含 `claude-opus-5`、`claude-fable-5`、`kimi-k3`、`gpt-5.6-sol`、`claude-sonnet-5`、`grok-4.5`、`muse-spark-1.1`、`claude-opus-4.8`、`gemini-3.6-flash` 與 `glm-5.2` 等。完整評測結果可參閱 [DeepSWE 評測網站](https://deepswe.datacurve.ai)。

**互動風格與行為差異**
在運作機制上，Opus 5 傾向安靜作業，而 Fable 5 則會隨時旁白說明其正在執行的動作：
- Opus 5 只為 11% 的工具呼叫加上說明，相較之下 Fable 5 的比例高達 65%。
- 在工作結束後，Opus 5 總是會提供總結，而 Fable 5 則完全不會提供。

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1785284964013-vkcq8qmk.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/52867c9ebf5a1307.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> DeepSWE v1.1 評測圖表展示多個模型的平均每個任務成本與效能表現

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1785284975974-eexc2sxn.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/a333181b489f2229.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> Opus 5 與 Fable 5 的工具呼叫旁白比例對照：Opus 5 僅 11%、Fable 5 達 65%

**成本效益比較**
在執行成本方面，Opus 5 展現出顯著的經濟效益：
- Opus 5 平均每個任務的成本比 Fable 5 減少了 45%。
- 根據測試數據，Opus 5（共 449 次試驗）的平均成本為 $11.84、中位數為 $10.51；而 Fable 5（共 432 次試驗）的平均成本則為 $21.63、中位數為 $19.23，兩者平均成本差距達到 $9.79。

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1785284991378-fnnoc8jw.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/869cf92977dfd9cf.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> Opus 5 與 Fable 5 每 task 成本比較長條圖

## 媒體內容

**Opus 5 與 Fable 5 的工具呼叫旁白比例對照：Opus 5 僅 11%、Fable 5 達 65%**

**影片中的 Prompt 與操作**

操作步驟：

1. NONE

## 標籤

Benchmark, LLM, 新產品, Anthropic, Claude, Kimi, OpenAI, SpaceXAI, Google
