# Ryan Marten 團隊推出 Frontier-Bench v0.1 評測基準

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Ryan Marten (@ryanmart3n) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥 · 日期：2026-07-24

> 原始來源：https://x.com/ryanmart3n/status/2080322620248281252

## 證據與延伸閱讀

- [未來版本規劃與 GitHub 藍圖](https://github.com/harbor-framework/frontier-bench/issues/1422)

## 中文摘要

Ryan Marten 團隊推出 Frontier-Bench v0.1 評測基準。

**核心架構與設計理念**
由 Terminal-Bench 與 Harbor 幕後團隊共同打造的 Frontier-Bench 是一個持續性的社群專案，首發版本 v0.1 包含 74 項困難、多元且高品質的任務。針對歷史上評測基準容易隨著時間貶值的問題，團隊透過導入一批全新的 Harbor 功能，讓評測基準能夠隨著時間增值。
- 任務涵蓋軟體、機器學習、科學、維運、資安、硬體與媒體等領域。
- 採用隔離架構，將 Agent 容器與驗證器容器徹底分開。
- 試驗結束時會下載 Agent 容器的 asset、記錄並上傳至驗證器容器，藉此防止多種獎勵駭客（reward hacking）行為，並在任務驗證器更新時支援重新評分。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/e75e1ac372e3e4bb.png)
> Frontier-Bench v0.1 包含 74 個任務，涵蓋 Software（20 項）、Science（15 項）、ML（13 項）、Operations（10 項）、Security（7 項）、Hardware（5 項）與 Media（4 項）等領域。

**模型表現與鑑別度**
Frontier-Bench 在區分前沿與次前沿模型時，展現出比 Terminal-Bench 2.1 更高的鑑別度。舉例來說，Claude Code 中的 Fable 5 與 Claude Code 中的 Opus 4.8 在 Terminal-Bench v2.1 上的差距僅有 4.9%，但在 Frontier-Bench v0.1 上則拉開到 12.7%。目前在該基準上，最強的 Agent 分數約為 34%。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/57f0221a020c5152.jpg)
> GPT-5.6 Sol (Codex) 在 Frontier-Bench v0.1 基準測試中取得 34.4% 的最高通過率，稍高於 Fable 5 (Claude Code) 的 33.8%。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/9014882e0942531d.jpg)
> Frontier-Bench 相較於 Terminal-Bench 2.1 能更有效地區分前沿與非前沿模型，例如 Fable 5 與 Opus 4.8 的通過率差距在 Terminal-Bench v2.1 上僅為 4.9%，但在 Frontier-Bench v0.1 上擴大至 12.7%。

**不同模型的解題策略與成本差異**
在 Frontier-Bench 上，即便是 pass rate 相近的 Agent，其面對問題的解決策略也截然不同：
- Fable 5（33.8%）與 Opus 4.8（21.1%）會使用較多 token 並採取較少行動。
- GPT-5.6 Sol（34.4%）與 Terra（20.8%）則是使用較少 token 並採取較多行動。
- 整體而言，在 Frontier-Bench 上，GPT-5.6 Sol 的成本比 Fable 5 便宜約 40%，且使用的 token 數量少約 50%。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/56bfe0a21e1cf57f.jpg)
> Fable 5 與 Opus 4.8 在 Frontier-Bench 上傾向使用較多 token 並執行較少步驟，而 GPT-5.6 Sol 與 GPT-5.6 Terra 則使用較少 token 但執行較多步驟，其中 GPT-5.6 Sol 相比 Fable 5 減少約 50% 的 token 使用量且成本降低約 40%。

**未來規劃與社群參與**
Frontier-Bench 團隊已著手規劃未來的版本釋出，預計在下一個重大版本中加入衡量新能力的任務、提升任務多樣性並調整逾時設定。任務本身採用版本控制機制，讓相對應的試驗可以被重複使用、重新評分或重新執行，藉此降低更新排行榜結果的成本與複雜度。這些功能全數透過 Harbor 支援的簡單指令來完成，相關資訊可參閱公開規劃藍圖（`https://github.com/harbor-framework/frontier-bench/issues/1422`）。此專案凝聚了超過 100 位任務貢獻者與審查者的心血，並獲得 Modal、Anthropic、OpenAI、Google 等運算贊助商，以及 Scale AI、Snorkel AI Open Benchmarks、Turing、gNucleus AI、Boolean AI 與 Handshake 等資料夥伴的支援，由 Harbor 框架與 Laude Institute 共同主辦。完整貢獻者名單可見官方網站（`https://www.frontierbench.ai/contributors`），開發團隊也邀請大眾透過 Discord（`https://discord.com/invite/ZvcWupVXjz`）與 GitHub 共同參與社群協作。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/e4ddfbe0f7dcef21.jpg)
> 基準測試建構者與使用者如何透過儲存庫與版本管理工具進行互動，並透過問題回報機制形成反饋迴圈的系統架構圖。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/e177995ed04d4f90.png)
> harbor-framework/frontier-bench 的 GitHub 專案中，由 RyanMarten於 2026 年 7 月 23 日開啟標題為「[Roadmap] v0.2 and v1.0」的 #1422 號 Issue 頁面截圖。

## 媒體內容

**GPT-5.6 Sol (Codex) 在 Frontier-Bench v0.1 基準測試中取得 34.4% 的最高通過率，稍高於 Fable 5 (Claude Code) 的 33.8%。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| GPT-5.6 Sol (Codex) | 34.4% |
| Fable 5 (Claude Code) | 33.8% |
| Opus 4.8 (Claude Code) | 21.1% |
| GPT-5.6 Terra (Codex) | 20.8% |
| Grok 4.5 (Cursor CLI) | 17.8% |
| Sonnet 5 (Claude Code) | 14.6% |
| GPT-5.6 Luna (Codex) | 14.3% |
| GLM 5.2 (Claude Code) | 5.1% |

**Frontier-Bench v0.1 包含 74 個任務，涵蓋 Software（20 項）、Science（15 項）、ML（13 項）、Operations（10 項）、Security（7 項）、Hardware（5 項）與 Media（4 項）等領域。**

**數據表（1）SCIENCE (15)**

| 項目 | 數值 |
| --- | --- |
| Chemistry | 4 |
| Biology | 3 |
| Math | 3 |
| Physics | 2 |
| Earth | 1 |
| Linguistics | 1 |
| Robotics | 1 |

**數據表（2）SOFTWARE (20)**

| 項目 | 數值 |
| --- | --- |
| Systems | 5 |
| Algorithms | 4 |
| Frontend | 4 |
| Data engineering | 3 |
| Databases | 3 |
| Languages | 1 |

**數據表（3）ML (13)**

| 項目 | 數值 |
| --- | --- |
| Inference | 5 |
| Evaluation | 4 |
| Training | 3 |
| Kernels | 1 |

**數據表（4）OPERATIONS (10)**

| 項目 | 數值 |
| --- | --- |
| Claims | 3 |
| Logistics | 2 |
| Supply chain | 2 |
| Compliance | 1 |
| Finance | 1 |
| Marketing | 1 |

**數據表（5）SECURITY (7)**

| 項目 | 數值 |
| --- | --- |
| Cryptography | 2 |
| Forensics | 2 |
| Reverse engineering | 2 |
| AppSec | 1 |

**數據表（6）HARDWARE (5)**

| 項目 | 數值 |
| --- | --- |
| CAD | 4 |
| RTL | 1 |

**數據表（7）MEDIA (4)**

| 項目 | 數值 |
| --- | --- |
| Design | 2 |
| Music | 2 |

**Frontier-Bench 相較於 Terminal-Bench 2.1 能更有效地區分前沿與非前沿模型，例如 Fable 5 與 Opus 4.8 的通過率差距在 Terminal-Bench v2.1 上僅為 4.9%，但在 Frontier-Bench v0.1 上擴大至 12.7%。**

**數據表**

|   | Terminal-Bench 2.1 | Frontier-Bench |
| --- | --- | --- |
| Fable 5 | 83.8% | 33.8% |
| Grok 4.5 | 79.3% | 17.8% |
| Opus 4.8 | 78.9% | 21.1% |
| GPT-5.6 Terra | 78.4% | 20.8% |
| GPT-5.6 Luna | 75.7% | 14.3% |
| Sonnet 5 | 74.6% | 14.6% |

**Fable 5 與 Opus 4.8 在 Frontier-Bench 上傾向使用較多 token 並執行較少步驟，而 GPT-5.6 Sol 與 GPT-5.6 Terra 則使用較少 token 但執行較多步驟，其中 GPT-5.6 Sol 相比 Fable 5 減少約 50% 的 token 使用量且成本降低約 40%。**

**數據表（1）Fable 5**

| 項目 | 數值 |
| --- | --- |
| 通過率 | 33.8% |
| n | 265 |
| Steps 範圍 | 0 至 250 |
| Output Tokens 範圍 | 0 至 800k |

**數據表（2）GPT-5.6 Sol**

| 項目 | 數值 |
| --- | --- |
| 通過率 | 34.4% |
| n | 272 |
| Steps 範圍 | 0 至 1200 |
| Output Tokens 範圍 | 0 至 400k |

**數據表（3）Opus 4.8**

| 項目 | 數值 |
| --- | --- |
| 通過率 | 21.1% |
| n | 369 |
| Steps 範圍 | 0 至 250 |
| Output Tokens 範圍 | 0 至 650k |

**數據表（4）GPT-5.6 Terra**

| 項目 | 數值 |
| --- | --- |
| 通過率 | 20.8% |
| n | 370 |
| Steps 範圍 | 0 至 1250 |
| Output Tokens 範圍 | 0 至 650k |

## 標籤

Benchmark, 開源專案, 研究論文, Frontier-Bench
