# Fish Audio 推出 S2.1 Pro 模型，只要上傳五秒音檔就能複製聲線

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Fish Audio (@FishAudio) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥🔥 · 日期：2026-07-29

> 原始來源：https://x.com/FishAudio/status/2082152596739862853

## 中文摘要

Fish Audio 推出 S2.1 Pro 模型，只要上傳五秒音檔就能複製聲線。

**融資與業務里程碑**
Fish Audio 於 2026 年 7 月 29 日宣布完成 5200 萬美元的種子輪融資，同時宣布 S2.1 Pro 正式公開推出。官方指出，團隊在短短一年內從一個開源專案成長為達到 2100 萬美元 ARR（年度經常性收入）的規模。目前其模型已被 HeyGen、LiveKit、Retell、Sanas 與 OpenArt 等前沿 AI 企業在生產環境中實際採用。為慶祝成立一週年，官方推出互動優惠活動，使用者只要在社群平台按讚、轉發並留言「Fish」，即可獲得一個月的 S2.1 Pro 免費使用權限。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/c2a19da2d59294e1.jpg)
> 展示十三位不同背景與組織成員大頭照的陣容列表，每位下方皆附有姓名與所屬公司名稱。

**核心效能與成本優勢**
根據官方與展示影片（

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1785285944774-pazsohd5.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/22f5557bf323f76e.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> 一名講者在筆電前展示 Fish Audio S2.1 Pro 的即時語音複製與多語系對話展示

）資料，S2.1 Pro 在語音合成效能與經濟成本上具備顯著優勢：
- 僅需 5 秒的音訊樣本即可完成聲音複製。
- 運作速度是 Cartesia 的兩倍，成本則僅為 ElevenLabs 的六分之一（影片顯示每 100 萬字為 15 美元，相比 ElevenLabs 的 100 美元與 Cartesia 的 45 美元更具競爭力）。
- 提供具備單字層級（word level）控制能力的表達力，使用者能精細調整情緒、語調與語速等細節。
- 官方承諾若企業客戶改用其語音 AI 方案無法節省超過 50% 的成本，將提供一年的 Fish Audio 免費使用服務，預約展示可透過 [S2.1 Pro 預約連結](https://s.fish.audio/tmapke)進行。

**展示與基準測試表現**
在官方展示影片中，S2.1 Pro 展現了即時語音複製與多語系對話能力，並在 Coval AI TTS 基準測試中達到 240 毫秒（ms）的首個音訊延遲（TTFA），落在「FAST & ACCURATE」區域。影片與展示畫面也揭露了以下累積數據與功能標籤：
- 累積呼叫次數突破 1 億次（100M+ calls），語音處理時數超過 1000 萬小時。
- 支援多語系（Multilingual）、表達模式（Expressive Mode）、多發話者理解（Multi-Speaker Understanding）以及人名發音（Name Pronunciation）等功能。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/d7b8349e382aeda3.webp)
> 具有流線型光影與紅、橘、紫漸層的抽象背景圖像

## 媒體內容

**一名講者在筆電前展示 Fish Audio S2.1 Pro 的即時語音複製與多語系對話展示**

**影片中的 Prompt 與操作**

操作步驟：

1. OGFRAME: 00:23

## 標籤

新產品, 功能更新, TTS, Fish Audio
