# Anthropic 推出 Claude Opus 5 奪下雙料第一

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Arena.ai (@arena) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥🔥🔥 · 日期：2026-07-28

> 原始來源：https://x.com/arena/status/2081831019377004727

## 證據與延伸閱讀

- [Claude Opus 5 奪下雙料第一](https://arena.ai/blog/factuality-in-arena) — 官方文件
- [完整排行榜與背景可至網頁查閱](https://arena.ai/leaderboard/code/webdev) — 官方文件

## 中文摘要

Anthropic 推出 Claude Opus 5 奪下雙料第一。Arena.ai 近期發布最新評測數據，指出 Anthropic 最新推出的 Claude Opus 5 在真實世界的各項任務中表現亮眼，不僅在程式開發與文件推理等領域名列前茅，同時 Arena 也推出了結合人類偏好與事實準確度的全新評等機制。

**Claude Opus 5 的卓越表現與排名**
- 根據 Arena.ai 於 2026 年 7 月 28 日公布的即時資料，Claude Opus 5 搭配 Max 推理模式在 Frontend Code Arena、以及啟用事實查核（factuality on）的 Text Arena 中皆榮登榜首。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/5fddfb26a807e1c6.jpg)
> Claude Opus 5 (Max) 以 1,725 分在 Code Arena: Frontend 排行榜中奪得第 1 名，Claude Opus 5 (High) 則以 1,670 分位居第 3 名。

- Claude Opus 5 若使用預設的高強度推理模式，同樣展現強大實力，在 Frontend Code Arena 僅次於 Kimi K3 排名第三，在 Text Arena（啟用事實查核）則位居第二。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/d6c8d437547ea3ba.jpg)
> Claude Opus 5 (Max) 在開啟真實性（Factuality）評測的 Text Arena 排行榜中以 1,512 分取得第 1 名。

- 這些來自真實世界的評測資料顯示，Anthropic 的最新模型在 agentic 網頁程式開發、文件推理以及一般聊天等實際任務上站得住腳。Arena 同時註明，Claude Opus 5 Max 的分數仍屬初步值，後續會隨票數收斂再更新。

**結合人類偏好與事實查核的全新機制**
- Arena 官方推出了全新的事實查核排位機制，將人類偏好與回應的事實準確度加權結合；目前以非預設的開關形式上線，需在排行榜 UI 自行切換。

- 評測方法為隨機抽樣對戰記錄、萃取原子化主張（atomic claims）、利用搜尋 agents 系統進行網頁驗證，並透過 Bradley-Terry 綜合模型計算出兼顧使用者意圖與內容真實性的綜合排名。
- 預設的事實查核權重為 25%，藉此確保模型既不會流於事實性不足卻迎合人類偏好的回答，也不會因為過度保守或答非所問而失去實用性。

**各大模型在事實查核上的表現趨勢**
- 透過標註超過 200 萬筆來自真實世界對話的主張資料，Arena 發現不同模型的評分隨事實查核權重增加而有顯著差異。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/b10e16adff316a02.jpg)
> claude-opus-4-6-thinking 在開啟 Factuality 的 Text Arena 排行榜中以 1492 分高居第一，gpt-5.5-search 則在 Search Arena 中取得榜首。（此為 Arena factuality 說明文件的附圖，資料早於本次貼文。）

- OpenAI 的 GPT 模型與 SpaceXAI 的 Grok 模型在提高事實查核權重時，分數多數呈現上升或持平；相對地，Anthropic 的 Claude 與 Google 的 Gemini 模型則多數呈現下滑或持平。
- 整體而言，Anthropic 模型較受人類使用者喜愛，而 OpenAI 的最新模型在客觀事實準確度上整體表現更為突出。

- 完整排行榜與詳細資料可至 [Arena Leaderboard 程式碼網頁專區](https://arena.ai/leaderboard/code/webdev) 進行查閱。
- 關於全新事實查核機制的詳細方法與背景，可參考官方發布的 [Arena Factuality 說明文件](https://arena.ai/blog/factuality-in-arena)。

## 媒體內容

**Claude Opus 5 (Max) 以 1,725 分在 Code Arena: Frontend 排行榜中奪得第 1 名，Claude Opus 5 (High) 則以 1,670 分位居第 3 名。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Claude Opus 5 (Max) | 1,725 |
| Kimi K3 (Max) | 1,682 |
| Claude Opus 5 (High) | 1,670 |
| Claude Fable 5 | 1,629 |
| GPT-5.6 Sol (xHigh) | 1,623 |
| GLM-5.2 (Max) | 1,587 |
| Claude Opus 4.8 (Thinking) | 1,568 |
| Claude Opus 4.7 | 1,560 |
| Claude Opus 4.7 (Thinking) | 1,557 |
| Grok-4.5 | 1,550 |
| Claude Opus 4.6 (Thinking) | 1,546 |
| Claude Sonnet 5 (High) | 1,545 |
| Claude Opus 4.8 | 1,539 |
| Claude Opus 4.6 | 1,538 |
| Muse Spark 1.1 | 1,537 |
| Seed-2.1 Pro | 1,528 |
| Gemini-3.6 Flash | 1,527 |
| Claude Sonnet 4.6 | 1,523 |
| GLM-5.1 | 1,518 |
| Hy3 | 1,518 |

**Claude Opus 5 (Max) 在開啟真實性（Factuality）評測的 Text Arena 排行榜中以 1,512 分取得第 1 名。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Claude Opus 5 (Max) | 1,512 |
| Claude Opus 5 (High) | 1,505 |
| Claude Opus 4.6 (Thinking) | 1,503 |
| Claude Opus 4.6 | 1,497 |
| Claude Fable 5 (High) | 1,494 |
| Claude Opus 4.7 (Thinking) | 1,490 |
| Claude Opus 4.7 | 1,482 |
| Gemini-3.5 Flash (High) | 1,480 |
| Gemini-3 Pro | 1,479 |
| Gemini-3.1 Pro | 1,479 |
| Muse Spark 1.1 | 1,479 |
| Gemini-3.6 Flash | 1,477 |
| Qwen-3.7 Max | 1,475 |
| Kimi-K3 Max) | 1,473 |
| Muse Spark | 1,473 |
| Gemini-3.5 Flash (Medium) | 1,473 |
| Qwen-3.5 Max | 1,471 |
| GPT-5.4 (High) | 1,470 |
| GPT-5.5 (xHigh) | 1,469 |
| Ernie-5.1 | 1,468 |

**claude-opus-4-6-thinking 在開啟 Factuality 的 Text Arena 排行榜中以 1492 分高居第一，gpt-5.5-search 則在 Search Arena 中取得榜首。（此為 Arena factuality 說明文件的附圖，資料早於本次貼文。）**

**數據表（1）Text Arena**

|   | Rank | Rank Spread | Score |
| --- | --- | --- | --- |
| claude-opus-4-6-thinking | 1 | 1 - 3 | 1492 ±3 |
| claude-fable-5 | 2 | 1 - 10 | 1489 ±6 |
| claude-opus-4-6 | 3 | 1 - 8 | 1487 ±3 |
| gpt-5.4-high | 4 | 2 - 10 | 1484 ±3 |
| gpt-5.5-high | 5 | 2 - 11 | 1484 ±4 |
| gemini-3-pro | 6 | 2 - 15 | 1481 ±3 |
| gpt-5.5 | 7 | 3 - 15 | 1480 ±4 |
| qwen3.7-max-preview | 8 | 2 - 20 | 1479 ±9 |
| muse-spark-1.1 | 9 | 2 - 20 | 1478 ±8 |
| claude-opus-4-7-thinking | 10 | 5 - 17 | 1478 ±4 |

**數據表（2）Search Arena**

|   | Rank | Rank Spread | Score | Votes |
| --- | --- | --- | --- | --- |
| gpt-5.5-search | 1 | 1 - 1 | 1243 ±4 | 61,253 |
| claude-opus-4-6-search | 2 | 2 - 3 | 1229 ±3 | 105,728 |
| gpt-5.2-search | 3 | 2 - 5 | 1224 ±4 | 52,708 |
| ernie-5.1 | 4 | 3 - 9 | 1215 ±9 | 3,803 |
| claude-fable-5 | 5 | 3 - 8 | 1214 ±7 | 9,895 |
| claude-opus-4-7 | 6 | 4 - 7 | 1213 ±4 | 62,150 |
| gpt-5.4-search | 7 | 4 - 8 | 1211 ±4 | 80,894 |
| gpt-5.1-search | 8 | 5 - 13 | 1204 ±4 | 60,017 |
| claude-sonnet-4-6-search | 9 | 7 - 14 | 1202 ±4 | 105,370 |
| claude-opus-4-8 | 10 | 8 - 15 | 1200 ±5 | 42,248 |

## 標籤

Benchmark, 功能更新, LLM, Anthropic, Claude, Arena.ai
