# OpenAI 發布 Jalapeño：每瓦 AI 工作量提升 1.5 至 1.9 倍，預計 2026 年底部署

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：OpenAI (@OpenAI) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥 · 日期：2026-08-26

> 原始來源：https://x.com/OpenAI/status/2092300846675505602

## 證據與延伸閱讀

- [OpenAI 發布 Jalapeño：每瓦 AI 工作量提升 1.5 至 1.9 倍，預計 2026 年底部署。](https://openai.com/index/jalapeno-first-results/) — 官方文件
- [gravitydevops.com/morning-openai-jalapeno-benchmarks](https://gravitydevops.com/morning-openai-jalapeno-benchmarks/)
- [OpenAI 發布 Jalapeño](https://x.com/OpenAI/status/2092300851482108064)
- [SemiAnalysis 驗證結果](https://newsletter.semianalysis.com/p/openai-jalapeno-better-than-nvidia)
- [Tibo 提到 ultrafast 需求](https://x.com/thsottiaux/status/2092311315545239771)

## 中文摘要

OpenAI 發布 Jalapeño：每瓦 AI 工作量提升 1.5 至 1.9 倍，預計 2026 年底部署。

**核心進展** OpenAI 在 2026 年 8 月 26 日分享首款自研推論晶片 Jalapeño 的實驗室結果，強調同一套架構同時提高吞吐量、降低延遲，不必在兩者之間取捨。官方表示，這將帶來更快的 ChatGPT 回應、更靈敏的 Codex session 與 Agent，以及需求持續成長時更可靠的服務存取。Jalapeño 預計在 2026 年底開始部署到 OpenAI 的運算基礎架構；Gen 2 已深入開發，Gen 3 也正在成形。

**實測數據** OpenAI 以公開 benchmark InferenceX，在相同使用者體驗與功耗條件下，比較 Jalapeño 和商用 AI 系統，涵蓋 GPT‑OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T：

- 三個模型的峰值每瓦 AI 工作量成長為 1.5 至 1.9 倍。
- 端到端延遲降低為原本的 1/1.7 至 1/3.6。
- 面向高度互動的工作負載，效能成長為 2.1 至 4.1 倍。
- 在最大的公開模型 Kimi K2.5 1T 上，每瓦峰值效能約成長為 1.5 倍，端到端延遲降低為 1/3.4。
- 晶片額定功耗為 700W，但測試工作負載的持續實測功耗維持在 550W 以下。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/39a6329ac6ed772a.jpg)
> Jalapeño 在 Interactivity 提升 2.1x–4.1x、E2E latency 降低 1.7x–3.6x，且 Perf/W 在 previous-best TBT 與 peak throughput 分別提升 8.6x–104.3x 及 1.5x–1.9x。

SemiAnalysis 也在實驗室驗證部分 InferenceX 執行結果，稱 Jalapeño 在多種情境的每瓦效能超越已測試的 NVIDIA、AMD 與 Google 晶片，包含 Blackwell。不過，這些數字由 OpenAI 提供，SemiAnalysis 並未執行完整 InferenceX 測試，也尚未取得 AgentX 結果；其指出，長 context、多輪互動和 agentic 工作負載會額外考驗路由器、前綴快取與整體快取管理，因此目前結果不代表所有生產情境。SemiAnalysis 也認為，Jalapeño 更適合拿來和採用 HBM4 的 NVIDIA Vera Rubin 比較，而非只和 Blackwell 比較。

**架構取向** Jalapeño 從一開始就以現代與未來的語言模型推論為目標，將晶片、記憶體、網路、軟體與機架級系統一起設計。Prefill 主要受運算能力限制，decode 則更依賴記憶體頻寬；Jalapeño 會把模型狀態與生成回應所需的 KV cache 保持在適當的本地位置，減少核心與晶片間的資料搬移。它不把 prefill 和 decode 固定拆到不同晶片池，而是採用較均一的資源池，以因應工作負載比例隨模型世代改變。

**AI 輔助開發** OpenAI 表示，AI 協助 Jalapeño 從初始設計走到 tapeout，僅花約 9 個月，並縮短設計、量測與驗證 loop。團隊使用 Codex 搭配 GPT‑Astra，在兩個月內讓原本不在生產計畫中的三個 open-weight 模型達到高效能；部分 GPT‑OSS attention 與 mixture-of-experts block 的 AI 生成實作，比原先由人類專家撰寫的版本快 1.5 至 1.8 倍，但這只適用於指定 block，並非完整模型。 

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1787762750794-bwwt3m60.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/41c8855ff1e5b821.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> Jalapeño 晶片安放於綠色主機板插槽上的特寫鏡頭

**後續規劃** Jalapeño 目前仍在進行 production qualification、軟體成熟化、規模化營運準備與更多模型的效能驗證。Tibo 同時提到 `/ultrafast` 需求非常大，OpenAI 將繼續和 Cerebras 合作，探索更快的模型推論；Cerebras 則表示，Jalapeño 與下一代 Cerebras 解決方案預計在 2027 年一同進入生產。OpenAI 也表示，訓練與推論仍將廣泛部署 NVIDIA 與其他合作夥伴的加速器。

## 標籤

硬體, 新產品, ChatGPT, Codex, Agent, OpenAI
