# Arena.ai 上線 AutoEval：新模型上榜從數天縮到一小時內

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Arena.ai (@arena) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥 · 日期：2026-07-31

> 原始來源：https://x.com/arena/status/2082878509131907477

## 證據與延伸閱讀

- [Arena.ai 推出 AutoEval 縮短評估時間。](http://arena.ai/blog/autoeval-scores) — 官方文件

## 中文摘要

Arena.ai 上線 AutoEval：新模型上榜從數天縮到一小時內。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/31b6c0deb67ef5e6.png)
> Arena 的 AutoEval 標題與蕈傘狀輻射結構視覺圖

**核心功能與運作機制**
AutoEval 要解決的是真實世界評估訊號需要時間累積的問題：排名產出從數天縮到一小時內，模型發布第一天就能提供經過校準的評估評等。
- 運作原理：透過訓練能捕捉人類偏好的獎勵模型來自動進行投票。系統會從即時 Arena 評估中取樣提示詞，讓獎勵模型對每個回應進行評分，並將分數差異轉換為軟投票（soft votes）。
- 排序管線整合：將這些自動產生的代理投票與即時人類投票透過相同的 Arena 排序管線結合，計算出 Arena Score。
- 顯示方式：排行榜上的列會標上閃電圖示，代表該分數為預估值，在累積足夠的真實人類投票以進行驗證之前，不會獲得官方正式排名。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/c28b855e0ca0a073.jpg)
> Arena.ai 排行榜整合 AutoEval 估算機制，新模型 New Release Model 以 1503 ±9 分暫居 Claude Fable 5（1504 ±4 分）與 Claude Opus 4.6 Thinking（1502 ±4 分）之間。

**獎勵模型訓練與挑戰**
為了確保 AutoEval 的準確性，開發團隊使用數百萬筆來自即時投票的兩兩比較資料來訓練逐點式（pointwise）獎勵模型。
- 面對的挑戰：
  - 人類偏好會隨著預期、互動風格和應用案例的演進而改變。
  - 模型水準不斷提升，明顯的失敗案例減少，品質差異變得更加細微。
  - 標籤帶有真正的模糊性，必須明確對平手與校準進行建模。
  - 多輪互動回饋取決於上下文脈絡。
  - 複雜任務（如程式撰寫）需要混合訊號，無法單憑單一指標判斷。
- 效能表現：文字獎勵模型在預測人類偏好時，準確度比前沿 LLM 評審（如 Gemini-3-flash/pro、GPT-5）高出 8% 至 10%。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/359d5cd4e19a2b34.jpg)
> AutoEval 評估評分與 Live 人工評估評分高度一致，迴歸擬合公式為 y=0.96x+55.49。

**評估準確度與多模態支援**
透過時間保留測試（temporal holdout）驗證，AutoEval 的早期分數與隨後的即時分數達到超過 0.98 的排序相關性。
- 頭對頭比較：當兩個模型的差距超過 10 個 Arena 積分時，AutoEval 在超過 90% 的情況下能正確排列較高分數的模型；當差距超過 15 分時，所有測試對皆完全正確排序（不過同篇圖表的分箱數據與這句略有出入：15–20 分區間為 95%，要到 20 分以上才是 100%）。反過來說，兩個模型差距在 5 分以內時，因為信賴區間重疊，在真人評估下本來就統計上無法區分。
- 跨模態應用：這套方法不只適用於文字，還擴展至視覺、圖像生成和 Code Arena。
- 圖像生成實例：文字轉圖像獎勵模型在超過 300 萬筆偏好對上進行訓練，在公開的多模態獎勵基準 MMRB2 上達到領先同級的表現，領先次佳基準超過 9 分。
- 完整說明見 Arena 官方部落格：[AutoEval scores](http://arena.ai/blog/autoeval-scores)。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/56c1212f7cf80164.jpg)
> Arena-RM 在 MMRB2 基準測試中以 69.7% 的準確率領先 HPSv3 與 UnifiedReward 等 reward model。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/206fe02648627e13.jpg)
> AutoEval 對決排序正確率依真人評分差距分箱：0–2 為 62%、2–5 為 51%（貼近圖上的擲硬幣基準線）、5–10 為 78%、10–15 為 87%、15–20 為 95%、20 以上為 100%。

## 媒體內容

**AutoEval 評估評分與 Live 人工評估評分高度一致，迴歸擬合公式為 y=0.96x+55.49。**

**數據表**

|   | 圖例與擬合公式：autoeval fit: y | y | auto vs live rating：各模型數據點帶有誤差棒，集中分佈於 1300 至 1500 評分區間且緊密貼合 y |
| --- | --- | --- | --- |
| 圖表標題：Live vs Auto Ratings (2026-05-01 ~ 2026-06-02) · x軸：Autoeval rating (刻度 1300 至 1500) · y軸：Live rating (刻度 1300 至 1500) | 0.96x+55.49 | x (gold standard) | x 基準線與擬合線 |

**Arena.ai 排行榜整合 AutoEval 估算機制，新模型 New Release Model 以 1503 ±9 分暫居 Claude Fable 5（1504 ±4 分）與 Claude Opus 4.6 Thinking（1502 ±4 分）之間。**

**數據表**

|   |
| --- |
| 模型 · 排名 · 排名區間 · 分數 |
| Claude Fable 5 · 1 · 1 - 4 · 1504 ±4 |
| New Release Model · ⚡ (N/A) · N/A · 1503 ±9 (⚡ AutoEval) |
| Claude Opus 4.6 Thinking · 2 · 1 - 5 · 1502 ±4 |

**AutoEval 對決排序正確率依真人評分差距分箱：0–2 為 62%、2–5 為 51%（貼近圖上的擲硬幣基準線）、5–10 為 78%、10–15 為 87%、15–20 為 95%、20 以上為 100%。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| 0-2 | 62% |
| 2-5 | 51% |
| 5-10 | 78% |
| 10-15 | 87% |
| 15-20 | 95% |
| 20+ | 100% |

**Arena-RM 在 MMRB2 基準測試中以 69.7% 的準確率領先 HPSv3 與 UnifiedReward 等 reward model。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Arena-RM | 69.7% |
| HPSv3 | 60.2% |
| UnifiedReward | 59.8% |
| PickScore | 58.6% |
| VQAScore | 58.3% |
| HPSv2 | 54.7% |
| ImageReward | 54.0% |
| CLIPScore | 51.0% |

## 標籤

Benchmark, 功能更新, Arena.ai
