# OpenAI 推出 GPT-5.6 提升運算效率

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Artificial Analysis (@ArtificialAnlys) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥 · 日期：2026-07-24

> 原始來源：https://x.com/artificialanlys/status/2080360526534877537

## 中文摘要

OpenAI 推出 GPT-5.6 提升運算效率。

**評估指標與運算機制**
Artificial Analysis 透過智慧指數測量模型在每個任務中產生的輸出 token 數量，藉此評估效能：
- 輸出 token 包含答案 token（代表模型的冗長程度）與推理 token（代表模型在給出答案前的思考量）。
- 推理 token 提供了一種讓模型在推論時使用額外運算來改善回應品質的途徑。
- 輸出 token 是決定每個任務成本與所需時間的重要關鍵。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/6ce33a0daf41d16b.png)
> Artificial Analysis 標誌與口號展示畫面

**效能表現與邊界分佈**
儘管本月有超過 5 家實驗室陸續推出重大模型，OpenAI 仍然主導了大部分的 token 效率柏拉圖邊界：
- GPT-5.6 Sol 的各種努力程度設定均主導了該邊界。
- 相比之下，GPT-5.6 Terra 與 GPT-5.6 Luna 在對應的智慧水準下，會產生相對更多的 token 數量。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/011e6011f90b6eb9.jpg)
> OpenAI 的 GPT-5.6 Sol 在不同推理深度設定下主導了 Token 效率的帕累托前沿，能在較低的每任務輸出 Token 數下取得更高的 Intelligence 指數。

讀者可前往 [Artificial Analysis 官方網站](https://artificialanalysis.ai/) 比較各大型語言模型的 token 使用量與智慧表現。

## 媒體內容

**OpenAI 的 GPT-5.6 Sol 在不同推理深度設定下主導了 Token 效率的帕累托前沿，能在較低的每任務輸出 Token 數下取得更高的 Intelligence 指數。**

**數據表**

| 項目 | X | Y |
| --- | --- | --- |
| GPT-5.5 (Non-reasoning) | 1.5k | 35.5 |
| GPT-5.6 Sol (Non-reasoning) | 2.1k | 41.2 |
| GPT-5.5 (low) | 2.2k | 43.5 |
| GPT-5.6 Sol (low) | 2.6k | 49.5 |
| GPT-5.6 Luna (medium) | 3.6k | 38.1 |
| GPT-5.6 Sol (medium) | 4.2k | 53.6 |
| KAT-Coder-Pro V2 | 6.4k | 33.7 |
| GPT-5.6 Sol (high) | 6.8k | 55.9 |
| Claude Sonnet 5 (Non-reasoning) | 9.7k | 41.7 |
| Grok 4.5 (high) | 12.2k | 53.8 |
| Gemini 3.1 Pro Preview | 14.2k | 46.5 |
| GPT-5.6 Sol (xhigh) | 15.1k | 57.6 |
| GPT-5.6 Sol (max) | 18.1k | 58.9 |
| GPT-5.5 (xhigh) | 18.5k | 54.8 |
| MiMo-V2.5-Pro | 20.5k | 42.2 |
| Muse Spark 1.1 (xhigh) | 21.5k | 50.6 |
| Nemotron 3 Ultra | 22.5k | 37.8 |
| Gemini 3.6 Flash | 22.8k | 50.1 |
| Qwen3.7 Max | 23.8k | 46.0 |
| Inkling | 24.2k | 40.7 |
| MiniMax-M3 | 24.5k | 44.5 |
| Kimi K3 | 26.5k | 57.1 |
| Claude Fable 5 (with fallback) | 32.5k | 59.9 |
| Claude Opus 4.8 (max) | 35.5k | 55.7 |
| DeepSeek V4 Pro (max) | 37.5k | 44.2 |
| GLM-5.2 (max) | 42.5k | 51.2 |
| Claude Sonnet 5 (max) | 69.0k | 53.3 |
| GPT-5.4 mini (xhigh) | 79.0k | 40.0 |

## 標籤

功能更新, LLM, Benchmark, OpenAI, GPT
