# Google Gemma 4 31B 整合 Cerebras 技術降低語音延遲

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Google Gemma (@googlegemma) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥🔥 · 日期：2026-07-21

> 原始來源：https://x.com/googlegemma/status/2079273584959328589

## 證據與延伸閱讀

- [Gemma 4 31B 整合 Cerebras 降延遲](https://huggingface.co/blog/cerebras-gemma4-voice-ai)
- [語音管線包含四個具體模型步驟](https://huggingface.co/spaces/smolagents/hf-realtime-voice)

## 中文摘要

Google Gemma 4 31B 整合 Cerebras 技術降低語音延遲。

**核心技術與應用**
Google Gemma 團隊與 Hugging Face 及 Cerebras 合作，推出了一套完全開源的級聯式（cascaded）語音對話架構。該系統透過 Cerebras 的高速推論能力，解決了語音 AI 常見的延遲瓶頸，讓使用者能獲得接近真人互動的即時回應體驗。此架構具備高度模組化特性，開發者可根據需求替換各個環節的元件。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/a0a61d481b92be9f.png)
> 這是一個展示 Hugging Face 平台上實現語音對話功能的技術說明頁面，強調透過 WebSocket 進行即時語音互動。

**語音對話管線（Pipeline）運作流程**
該系統並非單一的端到端模型，而是將四個開源模型串聯而成，具體流程如下：
1. 語音偵測：使用 `silero-vad` 進行即時語音活動偵測。
2. 語音轉文字（STT）：透過 `nvidia/parakeet-tdt-1.1b` 將語音轉換為文字。
3. 語言理解與生成：由 Cerebras 驅動 `google/gemma-4-31B-it` 模型進行分析並組成回覆。
4. 文字轉語音（TTS）：使用 `Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice` 將文字轉為語音輸出。 

**實際影響與演示**
這套語音對話架構不僅適用於軟體應用，目前已實際應用於超過 9,000 台 Reachy Mini 機器人，證明其在實體機器人與具身智慧（Embodied AI）領域的穩健性。根據演示內容，該系統除了基礎對話外，還整合了網頁搜尋（`web_search`）與影像辨識（`camera_snapshot`）功能，能針對環境中的物體進行互動。 

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1784616915701-4qls7lq5.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/53cdbde1a4b95d73.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> 一名使用者透過語音與 Hugging Face 平台上的語音對話模型進行互動，並展示了該模型與實體機器人的整合應用。

開發者可透過以下資源進一步研究與實驗：
- 體驗線上 Demo：[Hugging Face Realtime Voice](https://huggingface.co/spaces/smolagents/hf-realtime-voice)
- 閱讀技術部落格：[Hugging Face Blog](https://huggingface.co/blog/cerebras-gemma4-voice-ai)
- 存取程式碼庫：`huggingface/speech-to-speech`

## 媒體內容

**一名使用者透過語音與 Hugging Face 平台上的語音對話模型進行互動，並展示了該模型與實體機器人的整合應用。**

**影片中的 Prompt 與操作**

Prompt（00:00）：

```
嘿，你好嗎？
```

原文：Hey, how are you doing?

Prompt（00:07）：

```
我也很好。你能告訴我我的 T 恤上寫著什麼嗎？
```

原文：I'm also good. Can you tell me what my t shirt says?

Prompt（00:15）：

```
不錯。你能告訴我他們過去幾個月都在忙些什麼嗎？
```

原文：Nice. And can you tell me what they've been up to the last few months?

操作步驟：

1. （00:00）使用者透過語音輸入對話
2. （00:11）系統觸發 camera_snapshot 功能辨識 T 恤文字
3. （00:19）系統觸發 web_search 功能查詢 Hugging Face 新聞
4. （00:35）機器人開始與使用者進行語音互動

## 標籤

開源專案, TTS, ASR, 功能更新, Google, Gemma, Hugging Face, Cerebras
