# Matthew Lam 推出 OpenBench v1 評測框架

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Matthew Lam (@mattlam_) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥 · 日期：2026-07-22

> 原始來源：https://x.com/mattlam_/status/2079605387121049605

## 證據與延伸閱讀

- [Matthew Lam 推出 OpenBench v1](https://github.com/minghinmatthewlam/openbench)

## 中文摘要

Matthew Lam 推出 OpenBench v1 評測框架。

隨著業界逐漸意識到不能單純依賴擴大 token 規模（tokenmaxx），諸如 OpenRouter、Cloudflare、Databricks、Vercel 及 Ramp 等模型路由器（model routers）興起，反映出市場對 AI 使用與效率管理的需求孔急。Matthew Lam 指出，在不同的模型與 harness 組合下，開發者更需要評估 agent 在真實程式庫與 Pull Request 中的表現。為此，他開發了 OpenBench，並將其開源於 [GitHub 專頁](https://github.com/minghinmatthewlam/openbench)，聚焦於正確性與 token 消耗、延遲等效率指標之間的平衡，同時支援使用者自訂任務集與各種 harness 變體。

**核心功能與評測架構**
OpenBench 採用無頭（headless）模式，讓各種 harness 針對一組獨立的編寫任務進行測試，並透過確定性的檢查腳本（checker script）來判定是否解決問題，而非依賴 agent 自行宣告成功。
- 支援多種主流 harness 整合，包含 `codex`、`claude`、`cursor`、`devin`、`grok build` 與 `pi` 等。
- 評測範圍涵蓋核心合成任務（如 `make-ci-green`、`add-feature`、`misleading-error`）、Exercism 匯入任務，以及 Terminal-Bench 匯入前沿 tier。
- 採用 Track A 測試機制，將所有相容的 harness 鎖定在相同的基準模型（如 `gpt-5.5-medium`），藉此突顯 harness 本身（如鷹架 scaffolding、工具集、prompt、權限策略）帶來的效能差異。
- 評估指標包含正確率、各類 token 消耗（輸入、輸出、快取）以及延遲。

**初步觀察與效率趨勢**
根據專案目前的測試趨勢與成果，不同 harness 在正確性與資源消耗上展現出顯著差異：
- 在正確性表現上，前沿 harness 在專案自建任務上容易達到飽和，其中 `cursor` 在正確率表現優異（例如在測試影片中搭配 `gpt-5.6` 時達到 86.0% 的解決率），但相對消耗較多 token。
- 在效率與成本表現上，`pi` 與 `claude` 在 token 花費與延遲上展現出較高的效率。例如在影片展示的效率數據中，`pi` 在多個模型（如 `gpt-5.6`、`grok-4.5`、`kimi-k3`、`deepseek`）中皆為消耗最少 token 的選擇（例如搭配 `gpt-5.6` 時中位數為 35k tokens），而 `codex` 與 `cursor` 則相對消耗較多 token。
- 在開源模型相容性上，測試顯示開源模型在同等困難任務上的表現與前沿基準相當接近，且執行小規模評測矩陣的 API 成本相對低廉。

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1784699469764-3oebh4cb.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/53a9c52834cdfb64.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> 影片展示 OpenBench 評測結果，比較不同 harness 在各種模型（如 gpt-5.6、grok-4.5、kimi-k3、deepseek）下的解決率與效率。

**本機快速上手與指令**
專案可作為 Python 套件安裝，並提供完整的命令列工具進行驗證與執行：
1. 從本機檢出安裝或透過 git 安裝：
   ```bash
   pip install -e .
   # 或直接透過 git 安裝
   pip install "git+https://github.com/minghinmatthewlam/openbench.git"
   ```
2. 驗證任務檢查腳本是否正常運作：
   ```bash
   obench validate
   ```
3. 執行前置檢查（Preflight），確認各 harness 的 CLI 與憑證狀態：
   ```bash
   obench doctor
   ```
4. 執行評測（例如使用零成本的 `null` 控制項或指定的 harness）：
   ```bash
   obench run --harness codex --task fix-failing-test,build-a-cli,make-it-run --trials 3
   ```
5. 產出執行報告與效率摘要：
   ```bash
   obench report --efficiency
   ```
使用者亦可參考專案中的 [`SETUP.md`](https://github.com/minghinmatthewlam/openbench/blob/main/SETUP.md) 與 [`docs/private-evals.md`](https://github.com/minghinmatthewlam/openbench/blob/main/docs/private-evals.md) 來設定私人程式庫評測或 Docker 隔離執行環境。

## 標籤

Benchmark, 開源專案, Agent, OpenRouter, Cloudflare, Databricks, Vercel, Ramp
