# 大規模測試時運算（Test-Time Compute）的影響

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Noam Brown (@polynoamial) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥 · 日期：2026-06-10

> 原始來源：https://x.com/polynoamial/status/2064210146558136827

## 中文摘要

# 大規模測試時運算（Test-Time Compute）的影響

**tl;dr：** 隨著大型語言模型（LLM）能力日益增強，基準測試（benchmark）的效能表現越來越取決於「測試時運算」（test-time compute）。事實上，我們可能根本不知道現代大型語言模型的效能上限在哪裡，因為要測量它實在太昂貴了。我們應該改變大型語言模型的評估方式，透過測量效能與 token 數量、成本或時間的關係，將這些因素納入考量。

在 GPT-5.5 發布當天，最初的反應是質疑。基準測試數據確實有所提升，但幅度並不大：

![GPT-5.5 與 GPT-5.5 Pro 在多項基準測試中表現優異，其中 GPT-5.5 Pro 在 BrowseComp（90.1%）及 FrontierMath（Tier 1-3: 52.4%, Tier 4: 39.6%）中取得最高分，而 GPT-5.5 則在 Terminal-Bench 2.0（82.7%）等多項測試中領先其他模型。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/cca40bf74410eb4a.jpg)

<details class="chart-data"><summary>展開數據表</summary><table><thead><tr><th></th><th>GPT-5.5</th><th>GPT-5.4</th><th>GPT-5.5 Pro</th><th>GPT-5.4 Pro</th><th>Claude Opus 4.7</th><th>Gemini 3.1 Pro</th></tr></thead><tbody><tr><td>Terminal-Bench 2.0</td><td>82.7%</td><td>75.1%</td><td>-</td><td>-</td><td>69.4%</td><td>68.5%</td></tr><tr><td>Expert-SWE (Internal)</td><td>73.1%</td><td>68.5%</td><td>-</td><td>-</td><td>-</td><td>-</td></tr><tr><td>GDPval (wins or ties)</td><td>84.9%</td><td>83.0%</td><td>82.3%</td><td>82.0%</td><td>80.3%</td><td>67.3%</td></tr><tr><td>OSWorld-Verified</td><td>78.7%</td><td>75.0%</td><td>-</td><td>-</td><td>78.0%</td><td>-</td></tr><tr><td>Toolathlon</td><td>55.6%</td><td>54.6%</td><td>-</td><td>-</td><td>-</td><td>48.8%</td></tr><tr><td>BrowseComp</td><td>84.4%</td><td>82.7%</td><td>90.1%</td><td>89.3%</td><td>79.3%</td><td>85.9%</td></tr><tr><td>FrontierMath Tier 1-3</td><td>51.7%</td><td>47.6%</td><td>52.4%</td><td>50.0%</td><td>43.8%</td><td>36.9%</td></tr><tr><td>FrontierMath Tier 4</td><td>35.4%</td><td>27.1%</td><td>39.6%</td><td>38.0%</td><td>22.9%</td><td>16.7%</td></tr><tr><td>CyberGym</td><td>81.8%</td><td>79.0%</td><td>-</td><td>-</td><td>73.1%</td><td>-</td></tr></tbody></table></details>

然而，在短短幾個小時內，當人們有時間深入體驗該模型後，很明顯它與 GPT-5.4 相比有著跳躍式的進步。經典的「基準測試網格」顯然沒有反映出全貌。這是為什麼呢？

當我們將 GPT-5.5 與 5.4 進行比較，並以 token 數量作為橫軸時，原因就變得清晰了：

![在 CyberGym 評測中，GPT-5.5 以 81.8% 的得分超越 GPT-5.4 的 79.0%；而在 CTF 挑戰中，GPT-5.5 達到 88% 得分所需的輸出 token 數（約 50,000）遠少於 GPT-5.4 達到 84% 所需的 token 數（約 138,000），展現出更高的效率與性能。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/3bc5ae775e660711.jpg)

<details class="chart-data"><summary>展開數據表（1）CyberGym</summary><table><tbody><tr><td>模型 · Score</td></tr><tr><td>GPT-5.5 · 81.8%</td></tr><tr><td>GPT-5.4 · 79.0%</td></tr></tbody></table></details><details class="chart-data"><summary>展開數據表（2）Capture-the-Flags challenge tasks (Internal)</summary><table><thead><tr><th>項目</th><th>數值</th></tr></thead><tbody><tr><td>起始</td><td>(3600, 17%)</td></tr><tr><td>最佳</td><td>(50000, 88%)</td></tr><tr><td>結束</td><td>(50000, 88%)</td></tr><tr><td>起始</td><td>(6000, 10%)</td></tr><tr><td>最佳</td><td>(138000, 84%)</td></tr><tr><td>結束</td><td>(138000, 84%)</td></tr></tbody></table></details>

GPT-5.5 的評估基準並非與 5.4 使用相同的 token 預算（或美元預算）。一旦我們控制了測試時運算變數，5.5 看起來就比 5.4 強大得多。

我經常在討論這個議題時被問到：為什麼我們不直接使用一個能不斷增加測試時運算直到效能達到高原期（plateau）的 harness 來進行評估？問題在於，根據經驗，這個高原期非常遙遠。有時在實際的預算範圍內，我們甚至根本觀察不到高原期的出現。以下是 @karpathy 的自動化研究實驗，即便經過數百次實驗，效能仍在持續提升：

![自動調優過程經過多輪實驗，成功將驗證 BPB（越低越好）從基準值約 0.8624 降低至約 0.8534，共保留了 29 項改進。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/79d31ef75b57841e.jpg)

<details class="chart-data"><summary>展開數據表</summary><table><thead><tr><th></th><th>起始(Exp 0)</th><th>最佳(Exp 630)</th><th>結束(Exp 630)</th></tr></thead><tbody><tr><td>Running best</td><td>0.8624</td><td>0.8534</td><td>0.8534</td></tr></tbody></table></details>

這是 @AISecurityInst 的網路安全評估，Mythos 和 GPT-5.5 的效能即使在超過 1 億個 token 後，依然在快速提升：

![在「The Last Ones」網路安全基準測試中，Mythos Preview (new) 在最佳嘗試下成功完成了全部 32 個步驟（達到 Full network takeover），且不論是最佳嘗試或 10x100M 平均表現，均領先 GPT-5.5-Cyber 及其他受測模型。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/de76d022a3be01a5.jpg)

<details class="chart-data"><summary>展開數據表</summary><table><thead><tr><th></th><th>起始</th><th>結束</th></tr></thead><tbody><tr><td>Mythos Preview (new) (best attempt)</td><td>0</td><td>32</td></tr><tr><td>GPT-5.5-Cyber (best attempt)</td><td>0</td><td>27</td></tr><tr><td>Mythos Preview (new) 10x100M</td><td>0</td><td>25</td></tr><tr><td>GPT-5.5-Cyber 10x100M</td><td>0</td><td>23</td></tr><tr><td>GPT-5.5 10x100M</td><td>0</td><td>22</td></tr><tr><td>Mythos Preview (early) 10x100M</td><td>0</td><td>22</td></tr><tr><td>Claude Opus 4.6 10x100M</td><td>0</td><td>17</td></tr><tr><td>GPT-5.4 10x100M</td><td>0</td><td>14</td></tr><tr><td>Claude Opus 4.7 10x100M</td><td>0</td><td>13</td></tr><tr><td>Codex-5.3-Codex 5x100M</td><td>0</td><td>11</td></tr><tr><td>Claude Opus 4.5 5x100M</td><td>0</td><td>11</td></tr><tr><td>GPT-5.1-Codex 5x100M</td><td>0</td><td>9</td></tr><tr><td>Claude Sonnet 4.5 5x100M</td><td>0</td><td>9</td></tr><tr><td>Claude Sonnet 3.7 10x10M</td><td>0</td><td>6</td></tr><tr><td>GPT-4o 10x10M</td><td>0</td><td>2</td></tr></tbody></table></details>

請注意，對於更強大的模型，隨著時間推移，效能提升的幅度也更顯著。看起來，隨著模型變得更強，它們在處理更長遠目標時也變得更有效率。效能高原點被推得更遠，甚至可能完全消失。

基於這個原因，我認為評估模型的正確方式是繪製「效能 vs. 測試時運算」的圖表，並以 token 數量、成本或實際執行時間（wall-clock time）作為橫軸。一些基準測試已經朝這個方向發展。例如，ARC-AGI 就測量了分數與成本的關係。

![在 ARC-AGI-2 基準測試中，GPT-5.5 (xHigh) 與 GPT-5.4 Pro (xHigh) 均取得了約 85% 的最高得分，但 GPT-5.5 (xHigh) 的單次任務成本（約 $1.4）顯著低於 GPT-5.4 Pro (xHigh)（約 $6.0）。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/cbea591d4e8823f9.jpg)

<details class="chart-data"><summary>展開數據表</summary><table><thead><tr><th>項目</th><th>數值</th></tr></thead><tbody><tr><td>GPT-5.5 (xHigh)</td><td>($1.4, 85%)</td></tr><tr><td>GPT-5.4 Pro (xHigh)</td><td>($6.0, 85%)</td></tr><tr><td>Gemini 3.1 Pro (Preview)</td><td>($0.9, 77%)</td></tr><tr><td>Claude 4.7 (Max)</td><td>($5.0, 76%)</td></tr><tr><td>GPT-5.2 (Refine.)</td><td>($30.0, 73%)</td></tr><tr><td>GPT-5.5 (Medium)</td><td>($1.0, 71%),Claude Opus 4.6 (120K</td></tr><tr><td>Medium)</td><td>($2.0, 69%)</td></tr><tr><td>GPT-5.4 (Medium)</td><td>($0.7, 61%)</td></tr><tr><td>Claude Sonnet 4.6 (High)</td><td>($2.0, 61%)</td></tr><tr><td>GPT-5.2 Pro (High)</td><td>($15.0, 54%)</td></tr><tr><td>GPT-5.2 (High)</td><td>($1.5, 53%)</td></tr><tr><td>GPT-5.2 Pro (Medium)</td><td>($8.0, 39%)</td></tr><tr><td>GPT-5.5 (Low)</td><td>($0.4, 34%)</td></tr><tr><td>GPT-5.4 (Low)</td><td>($0.3, 29%)</td></tr><tr><td>Grok 4 (Refine.)</td><td>($30.0, 29%)</td></tr><tr><td>GPT-5.2 (Medium)</td><td>($1.0, 27%),Opus 4.5 (Thinking</td></tr><tr><td>16K)</td><td>($0.9, 23%)</td></tr><tr><td>GPT-5 Pro</td><td>($8.0, 19%)</td></tr><tr><td>Claude Sonnet 4.5 (Thinking 32K)</td><td>($0.9, 14%)</td></tr><tr><td>Claude Opus 4 (Thinking 16K)</td><td>($2.0, 9%)</td></tr><tr><td>o3 (High)</td><td>($1.0, 6%)</td></tr><tr><td>o3-Pro (Medium)</td><td>($5.0, 1%)</td></tr><tr><td>GPT-4.5</td><td>($2.0, 1%)</td></tr></tbody></table></details>

另一個合理的選擇是設定明確的 token/時間/成本預算，並將其告知模型。這就像人類在 SAT 或國際數學奧林匹亞競賽中受評估的方式一樣。

每個橫軸都有其權衡之處。不同模型之間的 token 並無法直接比較，因為分詞器（tokenizer）、速度和每個 token 的成本各不相同。美元成本取決於實作細節，例如批次處理（batching）和硬體利用率，因此成本與延遲（latency）之間可以進行權衡。最後，實際執行時間是一個不完美的測量指標，因為像 best-of-N 這種多 Agent 技術可以在不顯著增加延遲的情況下擴展測試時運算。儘管如此，這些曲線中的任何一條都比單一標量數值更能提供資訊。

---

## 對 AI 準備度（AI Preparedness）的影響

在發布前沿模型之前，實驗室通常會評估網路安全、生物安全以及其他濫用風險。如果模型跨越了能力門檻，發布可能會被推遲，直到緩解措施到位。但如果能力是推論運算的函數，那麼我們應該在什麼樣的推論預算下進行安全評估呢？

在實務上，大多數模型發布的安全評估並沒有考慮投入該模型的推論量。Gemini 3 Deep Think 的發布及其引發的強烈抗議就是一個很好的例子。

當 Gemini 3 Deep Think 發布時，其基準測試分數遠高於先前的模型。然而，隨之發布的卻沒有任何評估其風險的模型卡（model card）。

![Gemini 3 Deep Think 在 ARC-AGI-2 (84.6%)、Humanity's Last Exam (48.4%)、MMMU-Pro (81.5%) 以及 Codeforces (3455) 等各項基準測試中，表現均超越 Gemini 3 Pro Preview、Claude Opus 4.6 及 GPT-5.2。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/9ff346a8f32dbf66.jpg)

<details class="chart-data"><summary>展開數據表（1）ARC-AGI-2</summary><table><thead><tr><th></th><th>ARC-AGI-2</th></tr></thead><tbody><tr><td>Gemini 3 Deep Think (Feb 2026)</td><td>84.6%</td></tr><tr><td>Gemini 3 Pro Preview (Thinking High)</td><td>31.1%</td></tr><tr><td>Claude Opus 4.6 (Thinking Max)</td><td>68.8%</td></tr><tr><td>GPT-5.2 (Thinking xhigh)</td><td>52.9%</td></tr></tbody></table></details><details class="chart-data"><summary>展開數據表（2）Humanity's Last Exam</summary><table><thead><tr><th></th><th>Humanity's Last Exam</th></tr></thead><tbody><tr><td>Gemini 3 Deep Think (Feb 2026)</td><td>48.4%</td></tr><tr><td>Gemini 3 Pro Preview (Thinking High)</td><td>37.5%</td></tr><tr><td>Claude Opus 4.6 (Thinking Max)</td><td>40.0%</td></tr><tr><td>GPT-5.2 (Thinking xhigh)</td><td>34.5%</td></tr></tbody></table></details><details class="chart-data"><summary>展開數據表（3）MMMU-Pro</summary><table><thead><tr><th></th><th>MMMU-Pro</th></tr></thead><tbody><tr><td>Gemini 3 Deep Think (Feb 2026)</td><td>81.5%</td></tr><tr><td>Gemini 3 Pro Preview (Thinking High)</td><td>81.0%</td></tr><tr><td>Claude Opus 4.6 (Thinking Max)</td><td>73.9%</td></tr><tr><td>GPT-5.2 (Thinking xhigh)</td><td>79.5%</td></tr></tbody></table></details><details class="chart-data"><summary>展開數據表（4）Codeforces</summary><table><thead><tr><th></th><th>Codeforces</th></tr></thead><tbody><tr><td>Gemini 3 Deep Think (Feb 2026)</td><td>3455</td></tr><tr><td>Gemini 3 Pro Preview (Thinking High)</td><td>2512</td></tr><tr><td>Claude Opus 4.6 (Thinking Max)</td><td>2352</td></tr></tbody></table></details>

這引發了 AI 安全社群部分人士的憤怒。

![Zvi Mowshowitz 在社群媒體上批評 Google 對於 AI 模型效能提升與安全性評估的解釋。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/d6d8d60462d47bc9.jpg)

<details class="chart-data"><summary>展開畫面重點</summary><div class="me-note">圖片內容為 Zvi Mowshowitz (@TheZvi) 發布的一則推文，文字內容如下：
「I confirmed with a Google representative that since this was a runtime improvement and they do not believe these performance gains constitute any additional risk, they believe that no safety explanation is required of them.

I found that to be a pretty terrible answer.」

這段文字表達了作者與 Google 代表溝通後的結果：Google 認為由於這僅是「執行時間（runtime）的改進」，且不認為這些效能提升會帶來額外的風險，因此不需要提供相關的安全性說明。作者對此回應表示這是一個非常糟糕的答案。</div></details>

在我看來，對 DeepMind 發布的批評忽略了更深層的問題：AI 實驗室和安全組織在評估模型發布時，並沒有一致地將測試時運算納入考量。

Deep Think 看起來很可能是一個由其他擁有系統卡（system cards）的模型所組成的架構（scaffold）。任何外部人員很可能都能重現這樣的架構。換句話說，只要願意支付 Deep Think 所需的推論量，透過將一系列模型查詢串聯起來，任何人似乎都能獲得 Deep Think 的能力。Deep Think 只是讓一般使用者操作起來更方便而已。

在我看來，真正的憤怒點應該在於：當 Gemini 3 和其他模型發布時，它們的系統卡並沒有將基準測試效能測量為測試時運算的函數。在我理想的世界中，模型評估看起來會像這樣：

![隨著每項任務的推論預算呈對數級別增加，能力指數呈現線性增長趨勢，且預計在預算達到約 $10M（進入 actor budgets 區域）時，能力將突破 3.5 的關鍵能力閾值。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/d518269477162271.jpg)

<details class="chart-data"><summary>展開數據表</summary><table><thead><tr><th>項目</th><th>數值</th></tr></thead><tbody><tr><td>起始</td><td>($100, 0.8)</td></tr><tr><td>結束</td><td>($10K, 2.0)</td></tr><tr><td>起始</td><td>($10K, 2.0)</td></tr><tr><td>關鍵點</td><td>($10M, 3.7)</td></tr><tr><td>結束</td><td>($1B, 4.8)</td></tr><tr><td>y</td><td>3.5</td></tr></tbody></table></details>

一個專門的國家級行為者（state actor）可以在單一任務上投入超過 1,000 萬美元的推論資源。但評估一個模型通常涉及數千甚至數百萬次的執行（rollouts），因此對每次執行都進行如此高運算預算的評估是不切實際的。幸運的是，效能似乎會隨著投入的推論運算量以某種可預測的方式擴展。基於這個原因，我們可以在相對較低的推論預算下進行評估，然後（在存在不確定性的情況下）推算在更高預算下可能具備的能力。

長遠的評估可能會帶來一些複雜性，這些複雜性未必總能透過小預算的推論來解決。例如，最終可能會發現，要自信地評估 AI Agent 在一年期限內的失準（misalignment）風險，唯一的方法就是實際讓該 Agent 運行一年。AI 實驗室可能很快就會陷入一種尷尬的境地：其 Agent 的運行週期超過了新模型的開發週期。屆時，若不推遲模型發布，將不可能在發布前完成對模型最大運行壽命的評估。

---

## 具體建議

具體而言，我對 AI 社群提出以下建議：

1. AI 實驗室應發布新模型在不同 token 數量、成本或時間橫軸下的基準測試效能。至少，實驗室應報告達成該標量基準測試結果所使用的推論預算。

2. 基準測試應在排行榜上追蹤推論使用量，或設定明確的 token/成本/時間預算。許多基準測試已經朝此方向轉變，但這尚未成為標準做法。

3. 準備度框架（Preparedness Frameworks）和負責任擴展政策（Responsible Scaling Policies）在判定模型是否跨越安全門檻時，應明確將推論運算納入考量。此外，評估應估算模型在多種推論預算下的能力，包括從較低預算運行結果中進行的推算，並註明不確定性。

如果你追蹤我一段時間了，這整篇文章可能看起來沒什麼新意。自 2024 年 9 月 o1 發布以來，我們就已經知道推理模型的效能會隨著推論運算的增加而提升。

然而，近兩年過去了，前沿 AI 實驗室仍然習慣為其新模型發布報告單一數值的基準測試結果；當架構透過使用 100 倍的推論預算獲得更好的效能時，AI 安全組織仍然感到驚訝；而準備度框架和 RSP 在判定模型是否達到關鍵能力水準時，往往仍然忽略了推論運算的使用量。

最新的模型比以往任何時候都更能利用測試時運算，將效能高原期推得更遠。如果這種趨勢持續下去（我完全預期會如此），那麼不考慮推論運算使用量的基準測試分數，在每個模型發布週期中將變得越來越缺乏參考價值。基於這個原因，現在是將推論預算視為能力測量與安全政策中核心要素的時候了。

## 標籤

LLM, 研究論文, Benchmark, 產業趨勢, OpenAI, GPT
