# OpenAI 用 GPT-5.6 Sol 自己優化推論堆疊，服務成本降 20%、token 生成效率提升超過 15%

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Tibo (@thsottiaux) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥 · 日期：2026-07-30

> 原始來源：https://x.com/thsottiaux/status/2082578335167807775

## 證據與延伸閱讀

- [OpenAI 發布 GPT‑5.6，透過全新架構優化運算效率。](https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency/) — 官方文件
- [Tibo 分享 OpenAI 訓練模型改善基礎設施與堆疊。](https://x.com/thsottiaux/status/2082578335167807775)

## 中文摘要

OpenAI 用 GPT-5.6 Sol 自己優化推論堆疊，服務成本降 20%、token 生成效率提升超過 15%。

Tibo（@thsottiaux）在 X 平台上分享，OpenAI 透過訓練極佳的模型，再利用該模型來改善自身基礎設施、推論堆疊與底層 kernel 等各個層面，實現了極高的運算效率。OpenAI 隨後公布了詳細的技術細節，指出在部署旗艦模型 GPT‑5.6 Sol 後，透過持續的系統級優化，成功讓模型自我改良並達成顯著的效能突破。

**推論堆疊與 kernel 優化**
- 生產環境的 GPU kernel（核心函式）獲得改善，使端到端的服務成本降低了 20%。
- 透過改進的推測解碼（speculative decoding）機制，讓 token 生成效率成長為超過 1.15 倍（15%+）。
- 負載平衡策略經過持續調整，能根據地理位置、可用容量、硬體類型與叢集負載等因素進行智慧分流。
- 借助 GPT‑5.6 Sol 在 Codex 中的應用，模型得以自主重寫並優化以 Triton 與 Gluon 撰寫的生產環境 kernel 程式碼。

**Agentic harness 架構調整**
- 導入延遲探索（deferred discovery）機制，僅在需要時才顯示整合功能、自訂 MCP 工具、skill 與 plugin，藉此避免上下文膨脹（context bloat）。
- 將工具輸出的上限預設限制在 10,000 個 token，防止單一工具消耗過多上下文視窗，除非模型主動要求不同上限。
- 採取只增不改（append-only）的歷史紀錄處理方式，有助於拉高提示快取（prompt caching）的命中率。

**整體效能與未來展望**
- 這些跨堆疊的系統級優化相互疊加，讓 OpenAI 得以在成本與智慧曲線的各個節點上，提供效能最強大的模型（GPT-5.6 系列的定位見本站先前策展〈[OpenAI 發表 GPT-5.6 系列模型](/curated/2230)〉）。
- 相關優化成果與詳細技術報告可參閱 OpenAI 的 [GPT-5.6 Frontier Intelligence and Efficiency 官方文章](https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency/)。

## 標籤

新產品, 功能更新, LLM, OpenAI, GPT
