# 充分發揮 GPT-5.6 的最大效能：Sol、Terra 與 Luna

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Cerebras (@cerebras) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥 · 日期：2026-07-28

> 原始來源：https://x.com/cerebras/status/2081828128952095022

## 證據與延伸閱讀

- [Terra 成本是 Sol 的一半，Luna 是五分之一](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/d00cce71a77f08a4.jpg)
- [在 Cerebras 上執行 Sol 速度達每秒 750 token](https://x.com/cerebras/status/2081828128952095022)

## 中文摘要

# 充分發揮 GPT-5.6 的最大效能：Sol、Terra 與 Luna

作者：@0xSero & Zhenwei Gao (@zhennydez)

---

你的 Codex 訂閱現在包含 3 個主要模型：Sol、Terra 和 Luna。它們各自獨立訓練與提供服務，並具備推理撥盤（reasoning dials）。結合在一起，能讓你在每個任務中自由選擇速度、成本與智慧程度的最佳平衡。

## 價格比較一覽（OpenAI 開發者定價，2026 年 7 月 21 日）

在價格方面，不論是短 context 還是長 context 的使用情境，Terra 的成本是 Sol 的一半，而 Luna 則是五分之一。

![OpenAI Developers 網站的 Flagship models 價格表介面](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/d00cce71a77f08a4.jpg)

<details class="chart-data"><summary>展開畫面重點</summary><div class="me-note">OpenAI Developers 網站的 Pricing 頁面，顯示 Flagship models（Our latest models）的 1M token 價格（Prices per 1M tokens）。頂部標籤有 Standard、Batch、Flex、Priority。表格欄位包含 Model、Short context（Input、Cached input、Cache writes、Output）、Long context（Input、Cached input、Cache writes、Output）。
表格內各 Model 資料如下：
- gpt-5.6-sol：Short context - Input $5.00、Cached input $0.50、Cache writes $6.25、Output $30.00；Long context - Input $10.00、Cached input $1.00、Cache writes $12.50、Output $45.00
- gpt-5.6-terra：Short context - Input $2.50、Cached input $0.25、Cache writes $3.125、Output $15.00；Long context - Input $5.00、Cached input $0.50、Cache writes $6.25、Output $22.50
- gpt-5.6-luna：Short context - Input $1.00、Cached input $0.10、Cache writes $1.25、Output $6.00；Long context - Input $2.00、Cached input $0.20、Cache writes $2.50、Output $9.00
- gpt-5.5：Short context - Input $5.00、Cached input $0.50、Cache writes -、Output $30.00；Long context - Input $10.00、Cached input $1.00、Cache writes -、Output $45.00
- gpt-5.5-pro：Short context - Input $30.00、Cached input -、Cache writes -、Output $180.00；Long context - Input $60.00、Cached input -、Cache writes -、Output $270.00
- gpt-5.4：Short context - Input $2.50、Cached input $0.25、Cache writes -、Output $15.00；Long context - Input $5.00、Cached input $0.50、Cache writes -、Output $22.50
- gpt-5.4-mini：Short context - Input $0.75、Cached input $0.075、Cache writes -、Output $4.50；Long context - 無資料
- gpt-5.4-nano：Short context - Input $0.20、Cached input $0.02、Cache writes -、Output $1.25；Long context - 無資料
- gpt-5.4-pro：Short context - Input $30.00、Cached input -、Cache writes -、Output $180.00；Long context - Input $60.00、Cached input -、Cache writes -、Output $270.00

頁面底部說明文字：Regional processing (data residency) endpoints are charged a 10% uplift for models released on or after March 5, 2026, that are eligible for data residency. See our Your data guide for supported regions and processing details. OpenAI models in Amazon Bedrock are billed through AWS and may differ from direct OpenAI pricing.</div></details>

這樣的定價與模型的智慧程度和速度相當吻合。在實際應用中，每個模型最適合不同的工作型態：

1. Sol 是這群模型中最聰明的。它最適合長時間執行的任務、複雜的技術挑戰以及個人助理工作。這種強大的能力伴隨著較高的延遲與成本，但 Sol 在協調子 Agent 以及在長時間的工作流程中處理大型專案時表現卓越。

2. Terra 則穩居中間，以 Sol 一半的價格提供絕大部分的智慧能力，且速度也稍微快一些。搭配 Sol 使用時，Terra 可以成為一個強大的子 Agent：由 Sol 評估選項並設定方向，接著將實作交給速度更快、成本更低的 Terra。

3. Luna 是三者中最快且最實惠的模型，不僅效能超越市面上大多數模型，成本更只有 Sol 的五分之一。對於多數日常的 AI 任務來說，Luna 絕對勝任有餘，能在極低的成本下提供可靠的效能。截至 2026 年 7 月 17 日，它在 Artificial Analysis 的模型智慧指數中，於全部 576 個模型裡排名第 16。

![GPT-5.6 Sol 在不同推理設定下，Artificial Analysis Intelligence Index 從 low 的 49.5 分（每任務約 $0.20）提升至 max 的 58.7 分（約 $1.04）。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/f61fdf8d70f40e0e.jpg)

<details class="chart-data"><summary>展開數據表</summary><table><thead><tr><th>項目</th><th>X</th><th>Y</th></tr></thead><tbody><tr><td>GPT-5.6 Sol (low)</td><td class="rank-bar num bar-w-20"><span class="bar-val">$0.20</span></td><td class="rank-bar num bar-w-80"><span class="bar-val">49.5</span></td></tr><tr><td>GPT-5.6 Sol (medium)</td><td class="rank-bar num bar-w-30"><span class="bar-val">$0.31</span></td><td class="rank-bar num bar-w-90"><span class="bar-val">53.5</span></td></tr><tr><td>GPT-5.6 Sol (high)</td><td class="rank-bar num bar-w-40"><span class="bar-val">$0.45</span></td><td class="rank-bar num bar-w-100"><span class="bar-val">56.0</span></td></tr><tr><td>GPT-5.6 Sol (xhigh)</td><td class="rank-bar num bar-w-70"><span class="bar-val">$0.68</span></td><td class="rank-bar num bar-w-100"><span class="bar-val">57.6</span></td></tr><tr><td>GPT-5.6 Sol (max)</td><td class="rank-bar num bar-w-100"><span class="bar-val">$1.04</span></td><td class="rank-bar num bar-w-100"><span class="bar-val">58.7</span></td></tr></tbody></table></details>

## 為任務挑選最佳模型

你該如何決定哪個模型應該處理請求，以及它應該套用多少推理能力？這個選擇必須在產生任何 token 之前做出。

## 從 Luna 開始，再逐步升級。

面對任何任務的一個簡單方法是：選擇在你能接受的價格下，提供最佳速度與智慧平衡的模型。在 GPT-5.6 家族中：

1. GPT-5.6-Sol：具備最高智慧的下限與上限

2. GPT-5.6-Luna：具備最高速度的下限與上限

一個良好的預設作法是從 Luna 開始處理多數任務，當進度停滯時（例如 Agent 卡住、修復無法生效，或模型開始失去上下文脈絡），再升級到 Terra 或 Sol。如果你願意為速度和智慧付出更多成本，可以在 Cerebras 上執行 Sol，速度可達每秒 750 個 token，比 Sol 的一般模式快上高達 10 倍。

![任務處理流程的決策樹圖，展示了從接收任務到利用 Luna 模型執行及後續升級處理的邏輯路徑。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/05332c22ccd9ccbf.jpg)

<details class="chart-data"><summary>展開畫面重點</summary><div class="me-note">流程圖從左側的「INCOMING TASK」（接收任務）開始，接著進入「TRY LUNA (CHEAP/FAST)」（嘗試使用 Luna，具備便宜／快速的特點），隨後到達判定點「MAKING PROGRESS?」（是否有進展？）。
若判定結果為「YES」（是），則直接導向右側的「DONE (CHEAP/WIN)」（完成，低成本獲勝）。
若判定結果為「NO / STALLED」（否／停滯），則走向「ESCALATE TO SOL」（升級至 Sol），接著再進行「SOLVED?」（是否已解決？）的判定：
- 若為「NO」（否），則進一步「ESCALATE TO MAX REASONING + TO」（升級至最大推理 + TO），隨後導向「DONE (CHEAP/WIN)」。
- 若為「YES」（是），則直接導向「DONE (CHEAP/WIN)」。</div></details>

## 推論期運算（Test-time Compute）／推理

調整模型處理任務方式的另一種方法是調整其推理層級。在 Codex 中，你可以從五個選項中進行選擇：「Light」、「Medium」、「High」、「Extra High」和「Ultra」。

透過消耗更多的電腦處理時間來提高輸出的準確性，模型會在給使用者答案之前，先產生自我辯論與質疑的 token。

- Light：非常適合快速完成基本任務，例如尋找檔案、複製（clone）與設定程式碼儲存庫、整理下載項目等。當模型清楚知道自己需要做什麼，且失敗機率很低時，這就是你應該選擇的推理層級。

- Medium：適合需要一些解讀、規劃或除錯，但不需要深度探索的日常任務。這可能包含跨檔案總結、實作小型功能，或是對熟悉的問題進行疑難排解。

- High 與 Extra-High：最適合困難的 STEM 與程式撰寫任務，例如複雜的除錯、架構決策、大型重構，或是存在多種合理方法的具體問題。多數常規的助理任務並不需要這麼高的推理層級（甚至不需要）。

- Ultra：如果你非常清楚自己想要什麼，且有詳細的限制條件，特別是涉及多個獨立系統的跨領域工作時，請使用最高推理模式。例如，以非常特定的方式建置介面與 API 來連接兩個 API。

我們通常將 Ultra 模式保留給最重大的研究問題和新穎的挑戰。Ultra 模式往往會非常快耗盡你的使用額度，但你可以放心，模型已經動用了所有可用的推理預算來探索、驗證並精進它的答案。

根據 Artificial Analysis 在 7 月 17 日的測試，GPT-5.6 Sol 的推理層級每提升一級，平均每個任務的成本就會增加大約 50%。以下的圖表顯示了額外的推理如何影響智慧程度與成本。

![GPT-5.6 Sol 每任務加權平均成本隨推理層級遞增：low $0.20、medium $0.31、high $0.45、xhigh $0.68、max $1.04（圖表副標註明數值越低越好）](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/c713ee0cf17f82db.jpg)

<details class="chart-data"><summary>展開數據表</summary><table><thead><tr><th>推理層級</th><th>每任務總成本</th><th>堆疊分項（由上而下）</th></tr></thead><tbody><tr><td>GPT-5.6 Sol (low)</td><td>$0.20</td><td>—</td></tr><tr><td>GPT-5.6 Sol (medium)</td><td>$0.31</td><td>$0.08, $0.09, $0.07</td></tr><tr><td>GPT-5.6 Sol (high)</td><td>$0.45</td><td>$0.11, $0.10, $0.09, $0.13</td></tr><tr><td>GPT-5.6 Sol (xhigh)</td><td>$0.68</td><td>$0.13, $0.17, $0.15, $0.20</td></tr><tr><td>GPT-5.6 Sol (max)</td><td>$1.04</td><td>$0.16, $0.30, $0.17, $0.38</td></tr></tbody></table></details>

## 善用快取讀取（Cache Reads）。

快取的輸入資料比全新的輸入便宜 90%。需要重複處理相同程式庫或上下文脈絡的 Codex 任務能從中獲得巨大收益。

每個 GPT-5.6 模型都有大約 30 分鐘的快取存留時間（TTL）。這意味著維持單一工作階段（session）來工作，會比為每個任務啟動新工作階段來得更好。

Codex 的壓縮（compaction）功能也已經足夠強大，你可以讓單一工作階段運行到數億個 token 也不會遇到任何問題。

如果你保持工作階段處於高溫（hot）狀態，就能享有便宜許多的 prompt 處理成本。你可以設定每 20 分鐘執行一次的 Codex 自動化排程來保持快取運作，並利用這些自動化來驅動長時間執行的程序。

![關於保持 session 與載入 context 成本差異的流程圖](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/7b5811d6247d617c.jpg)

<details class="chart-data"><summary>展開畫面重點</summary><div class="me-note">本流程圖展示不同 session 處理方式對成本的影響。
起始步驟為「LOAD CONTEXT ONCE」與「KEEP SESSION」，接著進入條件判斷「NEW SESSION EACH TASK?」。
- 若選「YES」：進入粉紅色標示的「FRESH INPUT AGAIN」，最終導致「HIGHER COST」。
- 若選「NO」：進入「REUSE CONTEXT」，接著透過青色標示的「CACHED INPUT 90% CHEAPER」，最終達成「LOWER COST」。</div></details>

## 有效運用多 Agent 工作流程。

不同的模型是基於不同的資料進行訓練，並針對不同的目標進行最佳化，這意味著它們在某些事情上會表現得稍微好一點或差一點。

「顧問」（Advisor）工作流程賦予一個 Agent 單一且狹窄的職責：閱讀完整的工作階段、追蹤目標與限制條件，並在工作 Agent 開始偏離軌道時隨時介入。這有助於自動導引工作 Agent，並在較長的任務中提升可靠性。

本機 Codex 也允許你將其他供應商的模型引入應用程式中。這意味著你可以在熟悉的 Codex 體驗中，實驗成本較低、開放權重的模型（例如 Kimi K2.7 Code），或是具備不同優勢的模型（例如擅長長視野推理與程式撰寫的 GLM-5.2）。

接著，你可以將這些外部模型用於受限的子 Agent 工作，這有助於降低成本或發揮各個模型的不同優勢。

一個重要的細節是：這是透過 Codex 設定與自訂 Agent 檔案來完成的，而不是透過簡單的應用程式內模型挑選器。Codex 支援本機供應商（如 Ollama 和 LM Studio），以及自訂的、與 Responses 相容的供應商。

![USER、WORKER AGENT 與 ADVISOR MODEL 三者互動的協同運作循序圖](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/f0fb9207927107d5.jpg)

<details class="chart-data"><summary>展開畫面重點</summary><div class="me-note">本圖為三欄式循序圖（Sequence Diagram），橫向分為三大參與者：「USER」、「WORKER AGENT」與「ADVISOR MODEL」。
圖中步驟與流程依時間順序包含：
1. USER 傳送 `Task` 給 WORKER AGENT。
2. WORKER AGENT 執行 `Work on task`。
3. WORKER AGENT 透過 `Stream session` 將資料串流至 ADVISOR MODEL。
4. ADVISOR MODEL 執行 `Watch for drift` 監控偏移。
5. 若偏離計畫，ADVISOR MODEL 發出 `Nudge when off-program` 回饋給 WORKER AGENT。
6. WORKER AGENT 執行 `Correct course` 修正航向。
7. 最後 WORKER AGENT 回傳 `Result` 給 USER。</div></details>

## 結論

訂閱的使用額度相當慷慨，但隨著 AI Agent 對越來越多的人變得更有用，許多人正在把極限推向單一訂閱所能提供的範圍之外。

而且，就算你有錢可以燒，也不是每一個「前沿」（frontier）模型都穩坐所有使用情境的前沿。通常一個小模型在某些評測基準上，就能把全世界最好的模型聯合陣營打得落花流水。

速度是一個重要的切換開關。在白天與 Agent 互動時，高的 tok/s 可以大幅改善你的體驗；而在離峰時間，用 `/goal` 搭配速度較慢、但投入更多推理的模型，則能帶來天壤之別的效果。

最後，請持續關注 Artificial Analysis，裡面充滿了高品質的模型速度評測基準與智慧指數。

---

感謝 Sarah Chieng (@MilksandMatcha)、Joyce Er 和 Hai-Ching 的審閱與意見回饋，以及 Halley Change (@halleychangg) 為本部落格設計了精美圖表。

## 標籤

功能更新, LLM, OpenAI, Codex
