# OpenAI 發布語音轉文字模型 GPT Transcribe，AA-WER 詞錯率 3.31%（排行第 9），價格比前代便宜 25%

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Artificial Analysis (@ArtificialAnlys) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥 · 日期：2026-07-29

> 原始來源：https://x.com/artificialanlys/status/2082285338509418727

## 中文摘要

OpenAI 發布語音轉文字模型 GPT Transcribe，AA-WER 詞錯率 3.31%（排行第 9），價格比前代便宜 25%。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/6f95c73511a9d89c.jpg)
> OpenAI 發布 GPT Transcribe，在 Artificial Analysis 語音轉文字 WER 指標取得 3.3% 詞錯率（排名第 9），較前代 GPT-4o Transcribe（4%）降低 0.7 個百分點

**基準評測與模型表現**
根據 Artificial Analysis 的評測資料顯示，GPT Transcribe 在 AA-WER（Artificial Analysis Word Error Rate）綜合評分中拿下 3.31%（排名第九），並在各個分項資料集中展現出不同的辨識實力：
- 在 `AA-AgentTalk` 資料集上獲得 2.22% 的 WER
- 在 `VoxPopuli-Cleaned-AA` 資料集上獲得 2.72% 的 WER
- 在 `Earnings22-Cleaned-AA` 資料集上獲得 6.10% 的 WER
- 處理速度達到約 34 倍的即時速度（34× real-time），足以應付大多數的批次轉錄工作負載，不過仍落後於排行榜上最快的模型（例如 Smallest AI 的 Pulse Pro 速度可達約 251 倍即時速度）

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/cd53d17d523d0006.jpg)
> GPT Transcribe 在 AA-WER 的分項資料集中，分別於 AA-AgentTalk 取得 2.22% WER、VoxPopuli-Cleaned-AA 取得 2.72% WER，以及 Earnings22-Cleaned-AA 取得 6.10% WER。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/67370d6609894f9b.jpg)
> 本圖對照詞錯率與處理速度：GPT Transcribe 以約 34 倍即時速度取得 3.31% 詞錯率，速度明顯落後榜上最快的模型，準確度則優於前代 GPT-4o Transcribe（約 38 倍速、4.0%）。

**API 定價與上下文支援**
GPT Transcribe 是 OpenAI 最新推出的非串流（批次）語音轉錄模型，已透過 OpenAI API 平台正式上線，主要提供以下功能與定價優勢：
- 支援三種不同的上下文輸入以提升轉錄品質：描述錄音主題或場景的文字 prompt、可能出現在音訊中的專有名詞或縮寫等關鍵字（keywords），以及適用於多語言與程式碼切換（code-switching）音訊的多語言提示（multiple language hints）。
- 價格訂在每 1,000 分鐘音訊 4.50 美元（折合每分鐘 0.0045 美元），比起前一代 GPT-4o Transcribe 的每 1,000 分鐘 6.00 美元便宜了 25%，不過更平價的 GPT-4o Mini Transcribe 仍維持在每 1,000 分鐘 3.00 美元供應。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/a44eeb89ef69ee09.jpg)
> GPT Transcribe 的價格降至每 1,000 分鐘音訊 4.50 美元，相較前代 GPT-4o Transcribe 的 6.00 美元降低了 25%

**串流模型同步推出**
除了批次轉錄的 GPT Transcribe 之外，OpenAI 也同步發布了串流語音轉錄模型 `GPT-Live-Transcribe`。Artificial Analysis 目前正針對該串流模型進行基準評測，並計畫在日後於串流語音轉錄排行榜上公佈評測結果，呼應了本站先前策展過〈[OpenAI 推出 GPT-Live-Transcribe 模型](/curated/2763)〉的低延遲即時轉錄佈局。

## 媒體內容

**OpenAI 發布 GPT Transcribe，在 Artificial Analysis 語音轉文字 WER 指標取得 3.3% 詞錯率（排名第 9），較前代 GPT-4o Transcribe（4%）降低 0.7 個百分點**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Fun-Realtime-ASR-preview | 1.7%,Scribe v2 |
| ElevenLabs | 2.2% |
| MAI-Transcribe-1.5 | 2.4% |
| Smallest AI Pulse Pro | 2.4%,Voxtral Small |
| Mistral | 2.8% |
| Gemini 3.1 Pro Preview (High) | 2.8%,Universal-3.5 Pro |
| AssemblyAI | 3%,Solaria-3 |
| Gladia | 3.2%,GPT Transcribe |
| OpenAI | 3.3% |
| Resonant-1 | 3.4%,Inkling (256K) |
| Thinking Machines | 3.5% |
| Qwen3.5 Omni Plus | 3.5% |
| Gemini 3.1 Pro Preview (Low) | 3.6%,Voxtral Mini Transcribe 2 |
| Mistral | 3.6% |
| Soniox v5 Async | 3.8%,GPT-4o Transcribe |
| OpenAI | 4%,Grok Speech to Text |
| SpaceXAI | 4% |
| Speechmatics Enhanced | 4%,Whisper Large v3 |
| OpenAI | 4.1% |
| Amazon Transcribe | 4.1% |
| Modulate STT Batch English VFast | 4.2%,Canary Qwen 2.5B |
| NVIDIA | 4.3%,Chirp 3 |
| Google | 4.3% |
| Smallest AI Pulse | 4.4%,GPT-4o Mini Transcribe |
| OpenAI | 4.5% |
| Cohere Transcribe | 4.6%,Nova 2 Pro |
| Amazon | 4.9% |
| Melia | 4.9%,Nova-3 |
| Deepgram | 5.2%,Qwen3 ASR Flash |
| Alibaba | 5.8% |
| Rev AI | 5.9% |

**GPT Transcribe 在 AA-WER 的分項資料集中，分別於 AA-AgentTalk 取得 2.22% WER、VoxPopuli-Cleaned-AA 取得 2.72% WER，以及 Earnings22-Cleaned-AA 取得 6.10% WER。**

**數據表**

|   | AA-AgentTalk | VoxPopuli-Cleaned-AA | Earnings22-Cleaned-AA |
| --- | --- | --- | --- |
| Fun-Realtime-ASR-preview | 2.0% | 1.2% | 1.8% |
| Scribe v2, ElevenLabs | 1.5% | 1.7% | 4.0% |
| MAI-Transcribe-1.5 | 2.0% | 1.6% | 4.0% |
| Smallest AI Pulse Pro | 1.8% | 1.6% | 4.4% |
| Voxtral Small, Mistral | 2.3% | 1.7% | 4.8% |
| Gemini 3.1 Pro Preview (High) | 1.5% | 1.8% | 6.5% |
| Universal-3.5 Pro, AssemblyAI | 1.9% | 2.3% | 5.9% |
| Solaria-3, Gladia | 2.2% | 2.9% | 5.6% |
| Inkling (256K), Thinking Machines | 3.1% | 2.3% | 5.4% |
| GPT Transcribe, OpenAI | 2.2% | 2.7% | 6.1% |
| Voxtral Mini Transcribe 2, Mistral | 3.0% | 2.2% | 6.3% |
| Resonant-1 | 2.1% | 2.6% | 6.8% |
| Soniox v5 Async | 3.1% | 2.3% | 6.7% |
| Qwen3.5 Omni Plus | 1.6% | 4.8% | 6.1% |
| Gemini 3.1 Pro Preview (Low) | 1.7% | 2.0% | 8.9% |
| Speechmatics Enhanced | 3.4% | 2.9% | 6.6% |
| Whisper Large v3, OpenAI | 3.4% | 2.4% | 7.0% |
| Grok Speech to Text, SpaceXAI | 3.1% | 2.2% | 7.7% |
| GPT-4o Transcribe, OpenAI | 2.7% | 2.8% | 7.7% |
| Amazon Transcribe | 3.0% | 4.3% | 6.0% |
| Canary Qwen 2.5B, NVIDIA | 3.2% | 4.3% | 6.3% |
| Modulate STT Batch English VFast | 2.8% | 8.9% | 7.4% |
| Smallest AI Pulse | 3.6% | 4.0% | 6.6% |
| GPT-4o Mini Transcribe, OpenAI | 3.7% | 2.4% | 8.1% |
| Chirp 3, Google | 2.4% | 2.5% | 8.7% |
| Cohere Transcribe | 3.1% | 4.2% | 6.7% |
| Melia | 4.2% | 3.9% | 7.2% |
| Nova 2 Pro, Amazon | 4.0% | 5.3% | 6.2% |
| Nova-3, Deepgram | 3.6% | 2.9% | 10.5% |
| Qwen3 ASR Flash, Alibaba | 5.9% | 4.1% | 7.3% |
| Rev AI | 5.8% | 3.6% | 8.4% |

**本圖對照詞錯率與處理速度：GPT Transcribe 以約 34 倍即時速度取得 3.31% 詞錯率，速度明顯落後榜上最快的模型，準確度則優於前代 GPT-4o Transcribe（約 38 倍速、4.0%）。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| GPT Transcribe | (34, 3.31%) |
| GPT-4o Transcribe | (38, 4.0%) |
| Smallest AI Pulse Pro | (251, 2.4%), Parakeet TDT 0.6B V3 |
| Togetherai | (890, 4.5%), Whisper Large v3 |
| together.ai | (480, 4.5%) |
| Resonant-1 | (340, 3.4%) |
| Nova-3 | (301, 5.2%) |
| Smallest AI Pulse | (245, 4.5%), Wizper (L, v3) |
| fal.ai | (240, 4.7%) |
| Cohere Transcribe 03-2026 | (200, 4.7%), Grok Speech to Text |
| SpaceXAI | (160, 4.0%), Whisper (L, v3) |
| fal.ai | (150, 4.9%) |
| Modulate STT Batch English VFast | (120, 4.2%) |
| Voxtral Mini Transcribe 2 | (115, 3.6%) |
| Voxtral Small | (105, 2.8%) |
| GPT-4o Mini Transcribe | (100, 4.7%) |
| Parakeet TDT 0.6B V2 | (95, 6.4%) |
| MAI-Transcribe-1 | (90, 2.6%) |
| Gemini 3 Flash (High) | (70, 1.7%) |
| Soniox v5 Async | (70, 3.8%) |
| Solaria-3 | (65, 3.3%) |
| Nova 2 Pro | (53, 4.5%) |
| Scribe v2 | (50, 2.2%), Canary Qwen 2.5B |
| Replicate | (50, 4.8%) |
| Melia | (45, 4.6%) |
| Gemini 3.1 Pro Preview (Low) | (35, 3.3%) |
| Gemini 3.1 Pro Preview (High) | (25, 2.8%) |
| Rev AI | (25, 5.9%) |
| Amazon Transcribe | (22, 4.9%) |

**GPT Transcribe 的價格降至每 1,000 分鐘音訊 4.50 美元，相較前代 GPT-4o Transcribe 的 6.00 美元降低了 25%**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Modulate STT Batch English VFast | 0.42,Wizper (L, v3) |
| fal.ai | 0.5,Canary Qwen 2.5B |
| Replicate | 0.74,Whisper (L, v3) |
| fal.ai | 1.15,Parakeet TDT 0.6B V3 |
| Together.ai | 1.5,Whisper Large v3 |
| together.ai | 1.5 |
| Soniox v5 Async | 1.66,Grok Speech to Text |
| SpaceXAI | 1.67 |
| Voxtral Mini Transcribe 2 | 3 |
| GPT-4o Mini Transcribe | 3 |
| Nova 2 Pro | 3.1 |
| Rev AI | 3.33 |
| Resonant-1 | 3.6 |
| Scribe v2 | 3.67 |
| Smallest AI Pulse Pro | 4 |
| Melia | 4 |
| Voxtral Small | 4 |
| Nova-3 | 4.3 |
| GPT Transcribe | 4.5 |
| Smallest AI Pulse | 5 |
| MAI-Transcribe-1 | 6 |
| GPT-4o Transcribe | 6 |
| Amazon Transcribe | 6 |
| Gemini 3.1 Pro Preview (Low) | 7.72 |
| Solaria-3 | 10.16 |
| Enhanced | 12.5 |
| Gemini 3 Flash (High) | 13.7 |
| Gemini 3.1 Pro Preview (High) | 18.15 |

## 標籤

新產品, 功能更新, ASR, STT, OpenAI
