# Arena.ai 排行榜納入 OpenAI 的 GPT-5.6 Terra 與 Luna，分居第 15 與第 17 名

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Arena.ai (@arena) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥 · 日期：2026-07-28

> 原始來源：https://x.com/arena/status/2081848778324320354

## 中文摘要

Arena.ai 排行榜納入 OpenAI 的 GPT-5.6 Terra 與 Luna，分居第 15 與第 17 名。

**效能表現與排名**
- 排名依據來自全球使用者社群的真實長週期 Agent 任務；GPT-5.6 Terra 與 Luna 的 xHigh 變體加入後分別排在第 15 與第 17 名。
- 在所有變體中，Sol 排在排行榜第 2 名，淨改善幅度 +10.1%。
- Terra（+4.0%）與 Luna（+3.3%）同樣拿到正的淨改善，與 Claude Opus 4.8 的 +3.5% 上下相鄰（Terra 第 15、Opus 4.8 第 16、Luna 第 17）。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/b52f8527eb2ed652.jpg)
> GPT-5.6 Sol (xHigh) 在 Agent Arena 以 +10.1% 淨改善度取得第 2 名，而 GPT-5.6 Terra (xHigh) 與 Luna (xHigh) 則分別以 +4.0% 及 +3.3% 登上第 15 與第 17 名。

**推理努力與成本效益**
- 所有變體的最大增幅都出現在推理努力從 Low 升到 Medium 這一段；在 Low 設定下，Terra 表現平平，Luna 甚至比基準低了 -5.1%（推文數字；同篇圖表標示為 -3.9%）。
- 撇開延遲不談，效率前緣相當明確：Luna xHigh（+3.3%）微幅超越 Terra Medium 與 Low（分別為 +3.1% 與 +1.2%）。
- 較便宜的模型只要投入更多推理努力，就有機會超越以輕量模式執行的昂貴模型。
- Luna 的曲線斜率相當陡峭，顯示測試期規模化（test-time scaling）在較小的模型上特別有效，這點與先前在其他評測中觀察到的 Grok 模式一致。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/8afbfb8902b29d92.jpg)
> GPT-5.6 各模型系列在 Agent Arena 隨 Reasoning Effort 提升均展現顯著的 Test-Time Scaling 效益，其中 GPT-5.6 Sol xHigh 以 +10.1% 淨提升領先，且較平價模型的 GPT-5.6 Luna xHigh（+3.3%）表現優於較貴模型的 Terra Medium（+3.1%）與 Low（+1.2%）。

**評測方法與應用**
- Agent Arena 透過全球使用者社群提供的數百萬筆真實世界長週期 Agent 任務來衡量模型表現。
- 測試過程中，模型可存取網頁搜尋、檔案系統與終端機工具，來完成複雜的工作流程。
- 排行榜採用因果追蹤方法論（causal tracing methodology），以平均模型為基準，衡量各模型在實際結果上的表現。
- 完整榜單見 [Agent Arena 排行榜](https://arena.ai/leaderboard/agent)（圖表下方標註的來源）。

## 媒體內容

**GPT-5.6 各模型系列在 Agent Arena 隨 Reasoning Effort 提升均展現顯著的 Test-Time Scaling 效益，其中 GPT-5.6 Sol xHigh 以 +10.1% 淨提升領先，且較平價模型的 GPT-5.6 Luna xHigh（+3.3%）表現優於較貴模型的 Terra Medium（+3.1%）與 Low（+1.2%）。**

**數據表**

|   | Low | Medium | xHigh | Low | Medium | xHigh | Low | Medium | xHigh |
| --- | --- | --- | --- | --- | --- | --- | --- | --- | --- |
| GPT-5.6 Sol | -3.9% | 0.0% | +3.3% | -3.9% | 0.0% | +3.3% | -3.9% | 0.0% | +3.3% |

**GPT-5.6 Sol (xHigh) 在 Agent Arena 以 +10.1% 淨改善度取得第 2 名，而 GPT-5.6 Terra (xHigh) 與 Luna (xHigh) 則分別以 +4.0% 及 +3.3% 登上第 15 與第 17 名。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| 1. Claude Fable 5 (High) | +12.6% |
| 2. GPT-5.6 Sol (xHigh) | +10.1% |
| 3. Kimi K3 (Max) | +9.8% |
| 4. Claude Opus 4.8 (High) | +9.5% |
| 5. Claude Sonnet 5 (High) | +8.6% |
| 6. GPT-5.5 (xHigh) | +8.6% |
| 7. Claude Opus 4.7 (High) | +8.1% |
| 8. GPT-5.5 (High) | +7.8% |
| 9. Claude Opus 4.7 | +7.4% |
| 10. GLM-5.2 (Max) | +7.1% |
| 11. Claude Opus 4.6 | +6.5% |
| 12. GPT-5.5 | +5.8% |
| 13. Grok 4.5 | +5.5% |
| 14. GPT-5.4 (High) | +5.4% |
| 15. GPT-5.6 Terra (xHigh) | +4.0% |
| 16. Claude Opus 4.8 | +3.5% |
| 17. GPT-5.6 Luna (xHigh) | +3.3% |
| 18. Claude Sonnet 4.6 | +3.1% |
| 19. Muse Spark 1.1 | +0.8% |
| 20. GLM-5.1 | +0.7% |
| 21. Kimi-K2.7 Code | +0.4% |
| 22. Qwen-3.7 Max | -0.2% |
| 23. Gemini-3.1 Pro | -0.3% |
| 24. Gemini-3.6 Flash | -0.6% |
| 25. DeepSeek-V4 Pro | -0.7% |
| 26. Gemini-3.5 Flash (High) | -0.9% |
| 27. Kimi-K2.6 Code | -1.0% |
| 28. Hy3 | -1.1% |
| 29. Qwen-3.7 Plus | -1.5% |
| 30. MiniMax-M3 | -2.5% |

## 標籤

Benchmark, 功能更新, LLM, OpenAI, GPT, Arena.ai
