# 阿里雲發布 Qwen-Audio-3.0-TTS，推出 Flash 與 Plus 雙版本語音合成模型

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Qwen (@Alibaba_Qwen) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥 · 日期：2026-07-24

> 原始來源：https://x.com/Alibaba_Qwen/status/2080270065547809133

## 證據與延伸閱讀

- [Qwen-Audio-3.0-TTS系統介紹與排名](https://funaudiollm.github.io/qwen-audio-3.0-tts/)
- [WebSocket串流協議與URL格式](https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide)
- [substack.com](https://tongyilab.substack.com/p/qwen-audio-30-tts-more-multilingual)
- [aliyun.com](https://help.aliyun.com/zh/model-studio/realtime-tts-user-guide)
- [alibabacloud.com](https://www.alibabacloud.com/help/en/model-studio/cosyvoice-voice-list)

## 中文摘要

阿里雲發布 Qwen-Audio-3.0-TTS，推出 Flash 與 Plus 雙版本語音合成模型。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/bddf8a19482a9871.jpg)
> 宣傳海報：一隻戴著耳機的卡通熊正對著專業麥克風唱歌，上方印有「More Multilingual, Easier to Direct」與「Qwen-Audio-3.0-TTS」字樣。

Alibaba Group 旗下 Qwen Audio 與 Token Foundry 共同開發出面向生產環境的語音合成系統 Qwen-Audio-3.0-TTS，並在 Artificial Analysis Text-to-Speech Leaderboard 上取得第一名的領先表現。該模型共分為 Flash（專為即時互動打造）與 Plus（主打高品質生成）兩種版本，提供開發者兼顧低延遲與高音質的語音合成方案。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/c1f367385f918186.jpg)
> Alibaba 推出的 Qwen-Audio-3.0-TTS-Plus 在 Artificial Analysis Speech Arena 排行榜中以 1,234 的 Elo 分數榮登第一名。

**核心功能與架構特色**

- 採用 12.5 Hz 低影格率（low-frame-rate）監督式 speech tokenizer 來降低自迴歸解碼成本。
- 結合五階段漸進式訓練範式，在多項基準評測中表現優異。
- 支援 16 種語言（其中 7 種為新增）、20 個中文方言區、困難文本正規化案例。
- 支援長達 3 分鐘的單次長文本合成，並能在吵雜、混響或不清楚的參考語音下進行強健生成。
- 提供雙向 WebSocket 串流協議，支援低首包延遲的即時語音合成、串流輸入與輸出、聲音選定（voice cloning）、聲音設計（voice design）及音量、語速、音高與位元速率調整。
- 相容主流音訊格式（PCM、WAV、MP3、Opus），最高支援 48 kHz 取樣率輸出。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/e813daffd3f7d5f8.png)
> Qwen-Audio-3.0-TTS、ElevenLabs-v3-API、MiniMax-Speech-2.8-HD-API、VoxCPM2、Qwen3-TTS-1.7B-Base 與 DotsTTS-SOAR 在 CV3 多語言評測集上的表現比較。

**產出等級控制與精細化標籤**

- 支援透過自由格式自然語言指令調整角色、情緒、說話風格、語速、音色與口音（例如以自然語言指令「`read this slowly, like a bedtime story`」或 `instruction="请用河南话表达。"` 調整語氣）。
- 提供 86 個新增的精細化 inline tags，實現字詞級別的區域控制與非語言事件（如 `[whisper]`、`[angry]`、`[breaths]`、`[laughs]`）。
- Qwen-Audio-TTS 系列模型支援在 `text` 參數中直接嵌入情感與豐富語言標籤（如 `[sad]`、`[amazed]`、`[shouting]`、`[asmr]`、`[crying]`、`[gasp]`、`[sighing]`、`[clears throat]`、`[giggles]`、`[laughing]`、`[cough]`、`[snorts]`），控制情感表現或插入笑聲與嘆氣等聲音特效。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/5204b4a02b3ce81d.png)
> 這張雷達圖比較了 Qwen-Audio-3.0-TTS、DotsTTS-SOAR、MiniMax-Speech-2.8-HD-API、VoxCPM2、Qwen3-TTS-1.7B-Base 以及 ElevenLabs-v3-API 在 16 種語言（CV3 基準）上的性能數據。

**即時互動模式與 API 呼叫**

- 提供兩種互動模式：由伺服器自動處理文字斷句與合成時機的 `server_commit mode`，以及由客戶端明確提交文字緩衝區以精確控制合成時機的 `commit mode`。
- 呼叫 API 前需先設定 API Key 為環境變數 `DASHSCOPE_API_KEY`，並透過 DashScope SDK 進行呼叫。
- 提供了 Python 與 Java 的實作範例，模型可設定為 `qwen-audio-3.0-tts-flash` 或 `qwen-audio-3.0-tts-plus`。
- 若要啟用 Instruction control 功能，需將 `model` 替換為 `qwen3-tts-instruct-flash-realtime` 並透過 `instructions` 參數設定指令。
- Python 範例中使用 `cosyvoice-v3-flash` 模型搭配 `longanhuan_v3` 語音與 `instruction="请用河南话表达。"` 參數，並透過 WebSocket 連線 `wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference` 進行語音合成與儲存的程式碼如下：
  ```python
  # coding=utf-8

  import os
  import dashscope
  from dashscope.audio.tts_v2 import *

  dashscope.api_key = os.environ.get('DASHSCOPE_API_KEY')
  dashscope.base_websocket_api_url='wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference'

  model = "cosyvoice-v3-flash"
  voice = "longanhuan_v3"

  synthesizer = SpeechSynthesizer(model=model, voice=voice, instruction="请用河南话表达。")
  audio = synthesizer.call("叫你去买盐，你买回来一袋面，这不是弄啥嘞吗！")
  print('[Metric] requestId: {}, first-packet latency: {} ms'.format(
      synthesizer.get_last_request_id(),
      synthesizer.get_first_package_delay()))

  with open('output.mp3', 'wb') as f:
      f.write(audio)
  ```

**連線池與高併發效能最佳化**

- DashScope SDK 內建連線池機制可重複使用 WebSocket 連線與合成器物件以降低負荷。
- Python SDK 利用 `SpeechSynthesizerObjectPool` 管理與複用 `SpeechSynthesizer` 物件，建議將 pool 大小設定為尖峰併發數的 `1.5x` 至 `2x` 之間且不超過帳戶的 QPS 限制。
- 借用合成器物件的程式碼範例：
  ```python
  speech_synthesizer = connectionPool.borrow_synthesizer(
      model='cosyvoice-v3-flash',
      voice='longanyang',
      seed=12382,
      callback=synthesizer_callback
  )
  ```
- 任務完成後需呼叫 `connectionPool.return_synthesizer(speech_synthesizer)` 將物件歸還以供複用，但未完成或失敗的任務物件不得歸還。
- Java SDK 透過內建的 OkHttp3 連線池與基於 `commons-pool2` 的自定義物件池協同運作來達到最佳效能，相關環境變數設定包含 `DASHSCOPE_CONNECTION_POOL_SIZE`、`DASHSCOPE_MAXIMUM_ASYNC_REQUESTS`、`DASHSCOPE_MAXIMUM_ASYNC_REQUESTS_PER_HOST` 與 `COSYVOICE_OBJECTPOOL_SIZE`。

## 媒體內容

**Alibaba 推出的 Qwen-Audio-3.0-TTS-Plus 在 Artificial Analysis Speech Arena 排行榜中以 1,234 的 Elo 分數榮登第一名。**

**數據表**

|   | 排名 | Range | Creator | Elo | 95% CI | Samples | Arena Voices | Released | API Pricing |
| --- | --- | --- | --- | --- | --- | --- | --- | --- | --- |
| Qwen-Audio-3.0-TTS-Plus | 1 | 1-2 | Alibaba | 1,234 | -16/16 | 1,517 | 8 voices | Jul 2026 | $27.6 /1M chars |
| Simba 3.2 | 2 | 1-3 | SpeechifyAI | 1,230 | -16/16 | 1,523 | 8 voices | Jul 2026 | $10.0 /1M chars |
| Gemini 3.1 Flash TTS | 3 | 3-4 | Google | 1,215 | -13/13 | 2,858 | 7 voices | Apr 2026 | $18.3 /1M chars |
| Sonic 3.5 | 4 | 3-8 | Cartesia | 1,208 | -14/14 | 2,344 | 8 voices | May 2026 | $49.0 /1M chars |
| Realtime TTS 1.5 Max | 5 | 4-8 | Inworld | 1,198 | -14/14 | 2,080 | 8 voices | Jan 2026 | $26.0 /1M chars |
| Lightning V3.1 Pro (Jul 2026) | 6 | 3-8 | Smallest.ai | 1,198 | -17/17 | 1,152 | 8 voices | Jul 2026 | $19.5 /1M chars |
| Realtime TTS-2 - Research Preview | 7 | 4-8 | Inworld | 1,197 | -14/14 | 2,079 | 8 voices | May 2026 | $20.8 /1M chars |
| Luna TTS | 8 | 4-9 | VUI Labs | 1,194 | -16/16 | 1,424 | 3 voices | Jun 2026 | N/A |
| Speech 2.8 HD | 9 | 9-11 | MiniMax | 1,178 | -12/12 | 3,959 | 8 voices | Feb 2026 | $100.0 /1M chars |
| StepAudio 2.5 TTS | 10 | 9-12 | StepFun | 1,176 | -18/18 | 1,031 | 3 voices | Apr 2026 | $85.0 /1M chars |

## 標籤

新產品, 功能更新, TTS, Alibaba, Qwen
