# MiniMax H3：打破任務與模態界線的開放模型

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：MiniMax (official) (@MiniMax_AI) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥🔥 · 日期：2026-08-01

> 原始來源：https://x.com/MiniMax_AI/status/2083008095488516262

## 證據與延伸閱讀

- [推出 MiniMax H3 支援 2K 影片生成](https://x.com/MiniMax_AI/status/2083008095488516262)

## 中文摘要

# MiniMax H3：打破任務與模態界線的開放模型

今天，我們推出通用型多模態生成模型 MiniMax H3。H3 能夠理解橫跨文字、圖片、影片與音訊的統一 context，並能原生生成具備立體聲、最高 15 秒且解析度達 2K 的影片。

早期測試顯示，H3 已準備好應用於各種使用情境的商業內容創作，並在指令遵循（instruction following）、精確的文字與品牌渲染（rendering），以及 V2V（影片到影片）動作遷移（motion transfer）方面表現出色。憑藉著精確、可控的多模態生成與編輯能力，H3 非常適合應用於廣告、品牌行銷、電子商務、產品設計、UI/UX、遊戲等領域。

在 Contextual Omni Representation、H3-VAE、H3-Omni Transformer 和 In-Context Regeneration 等技術的驅動下，H3 提供了業界領先的性價比。我們預設提供 2K 解析度。在 2K 解析度下，H3 的每秒價格不到主流模型的三分之一；而在 768p 解析度下，價格則不到主流模型 720p 的一半。

長期以來，閉源模型一直主導著影片生成領域，其迭代速度較慢，生態系統也不如大型語言模型等領域開放。為了支援開源社群、加速與更廣泛 AI 硬體相容，並讓使用者更容易打造專屬的自定義版本，我們計畫在遵守適用法律和法規的前提下，於未來幾天內開源模型權重。硬體相容性一直是 H3 設計初期以來的關鍵考量。

---

# H3 模型亮點

## 1. 多模態 context 理解

真實的創意工作需要在多個模態之間融合複雜資訊，並將圖片、音訊、影片等作為輸入來源。例如，以下鏡頭的 prompt 是：「參考影片 1 中的希區考克式鏡頭運動（Hitchcock camera movement），讓圖片 2 中的角色唱歌，且歌聲要與音訊 3 相符。」只需用文字描述 context 與目標影片之間的關係，H3 就能自行處理複雜的全模態理解。

> 多模態輸入

![一名留著捲髮、臉上有雀斑的年輕女性坐在戶外咖啡座，正低頭端著小巧的杯子啜飲。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/8e5979a8f1c35eee.jpg)

<details class="chart-data"><summary>展開畫面重點</summary><div class="me-note">畫面為戶外咖啡座的實景拍攝。主體是一位留著黑色蓬鬆捲髮、臉上有明顯雀斑的年輕女性，身穿白色上衣與藍色吊帶褲，手腕戴著多色手環，正低頭捧著一個小型白瓷杯飲用。背景為歐式街景，左側可見「CAFÉ」字樣的招牌，並有其他顧客坐在藤編座椅上用餐，整體光線明亮。</div></details>

> （原文此處為 H3 生成影片，未收錄）

## 2. 2K 效能

## 3. 原生立體聲

---

# H3 使用情境

## 1. 電影開場片頭

## 2. 產品網站

## 3. 動態海報

## 4. 廣告與電子商務

---

# H3 的設計哲學

## 打破任務之間的界線：從專用走向通用

我們先前已經開發過兩代模型：海螺 01（Hailuo 01）從零開始建立了系統，而海螺 02（Hailuo 02）則專注於改善核心元件，例如架構效率、資料品質與規模。

在設計 H3 時，我們意識到先前生成式模型在任務界線上的限制：圖片生成通常被拆分為 T2I（文字轉圖片）、編輯、主體參考、動作參考和風格參考等不同的專家模型；音訊生成中的語音、音效和音樂，很大程度上也被視為獨立的領域研究；影片生成則進一步碎片化為文字轉影片、圖片轉影片、首尾幀、主體參考、動作參考、語音參考、影片編輯等，圖片、影片和音訊之間也存在著清晰的界線。

這些孤立的任務、能力和模態在實務上限制了創作自由，而在訓練方面，也限制了模型的泛化能力。這兩點都表明，無論是在應用範式還是訓練範式上，都有很大的改變空間。因此，指導 H3 開發的第一原則就是跨任務的統一與泛化。

基於此，以下是 H3 預訓練範式的簡要概述：

## 1. 資料與任務

文字轉圖片

文字轉影片
伴隨聯合生成的音訊，所有音訊輸出皆為原生立體聲
原生多鏡頭建模

文字轉音訊
語音、音效與音樂之間沒有區隔——全部進行聯合建模

## 2. 廣義參考與編輯

圖片到圖片的參考與編輯

圖片到影片的參考與編輯

音訊到音訊的參考與編輯

音訊影片到音訊影片的參考與編輯

在我們的設計中，「廣義參考與編輯」意味著：

- 完全由真實、自然的資料構建，賦予其強大的資料可擴展性。

- 參考與編輯關係透過自然語言表達，而不侷限於固定的任務集；語言（廣義上的智慧結構）是通往泛化的橋樑。

## 3. 架構

儘早融合多樣化的資料類型與任務——合適的混合比例是關鍵。

## 4. 訓練策略

在訓練過程中儘早融合多樣化的資料類型與任務——合適的混合比例是關鍵。

這些選擇都指向同一個目標：從預訓練階段開始，賦予 H3 廣泛的多模態 context 理解與生成能力。

我們稍早談到了訓練範式的轉變，那麼影片模型的應用版圖又是如何變化的呢？

我們看到創作者直接用自然語言描述他們的意圖，而不只是輸入簡單的視覺 prompt。隨著多模態理解、指令遵循和複雜任務執行的不斷提升，影片模型將能夠掌握更完整的創作意圖，處理更複雜的內容需求，並逐漸從「生成片段」真正參與到整個內容生產過程中。

---

# H3 的技術選擇

H3 的設計哲學很簡單——但建構過程絕非如此。從海螺 01（Hailuo-01）到海螺 02（Hailuo-02）再到 H3，每一代模型的工程複雜度都比上一代大約成長為 10 倍。

以下簡要介紹 H3 的幾項核心技術：

## 1. H3-Contextual Omni Representation

在工程化 H3 的過程中，我們做過最重要的事情之一就是強化其標註（captioning）能力。

- 引入多模態 context 進一步擴大了「標註」需要涵蓋的範圍，我們不再只是描述目標影片，還要描述 context 與目標影片之間的關係，甚至是 context 內部元素之間的關係。

- 我們需要聯合描述影片與音訊，而這種音影關係在多個鏡頭之間會變得更加複雜。

- 這本質上是一種 Contextual Omni Representation 的形式，其中語言扮演著可泛化的橋樑與解譯器，將「任務」統一為開放的描述性形式。這就是 H3 具備廣泛指令遵循能力的根源。

- 為了實現這一點，我們建立了專用模型和全模態理解管道。大多數原始素材都需要大約 100K token 的推論，並被蒸餾至平均約 4K token。

## 2. H3-VAE：大幅提升架構效率

H 系列不斷推進 tokenizer 技術。在 H3 中，我們徹底改造了先前的 tokenizer，在重建品質與可學習性上實現了全面提升，讓 H3 在效率上具備競爭優勢。其高壓縮比也帶來了 4 倍的有效序列長度提升，大幅降低了訓練與推論成本，這也是我們支援原生 2K 解析度的關鍵技術。

## 3. H3-Omni Transformer：為任務泛化而生的架構

秉持著 H3「架構應為任務服務」的設計哲學，通用性與效率是僅有的兩個目標。值得一提的是，我們捨棄了海螺 02（Hailuo-02）的架構，儘管它曾帶給我們顯著的架構優勢，因為對於一個以任務泛化為核心的模型來說，它會引入不必要的複雜性。我們相信任務泛化是不可逆轉的趨勢，架構上的小技巧應該讓位於模型的定義方式。

在 H3 中，多模態 context 的引入使序列長度的變異數增為三倍，理解與生成的運算工作負載也變得明顯異質化。我們採用了一種將理解與生成工作負載分離的訓練架構，針對每一種負載微調硬體利用率，同時兼顧單一樣本內的異質運算與跨樣本的負載平衡。端到端來看，這將訓練吞吐量提升了近 30%。

## 4. H3-In-context Regeneration

針對 H3 的 2K 輸出，我們沒有使用傳統的專用超解析度（super-resolution）模組，而是讓 H3 基礎模型在 context 內對自身的低解析度輸出進行重新生成（regenerate）。這帶來了兩個好處：首先，重新生成過程最大限度地重複利用了 H3 基礎模型內建的生成能力；其次，context 內的方法讓模型能夠再次利用原始的多模態 context 來產出高解析度輸出，恢復傳統超解析度只能「猜測」且往往無法還原的細節，例如小字型和精細細節。

In-Context Regeneration 本身就是任務泛化的另一種表現形式。

> 我們很快就會分享完整的 H3 技術報告。我們期待聽到您的意見回饋。

---

# 我們的願景與下一步

語言、圖片、影片和音訊是人類體驗的基本模態。它們深度互聯，是我們與世界互動的主要介面。它們共同構成了多模態 context，能夠高效傳遞豐富的資訊，而表達與分享資訊的能力本身就是一種生產力。

對於多模態理解與生成，我們將語言視為一個可泛化、可擴展的計算系統。這就是為什麼我們堅信多模態智慧應該深深紮根於語言之中。

H3 還有成長空間，以下是我們對未來版本的優先規劃：

- 強大的多模態理解是高品質生成的基礎，且仍有很大的提升空間。在下一代的 H 系列中，我們計畫整合 M 系列模型的強大能力。

- H3 當前的模型規模在幾項能力上仍有提升空間。規模化（Scaling）是明確的發展方向，我們相信更強的任務泛化將使我們能夠完全釋放其潛力。

- 視覺細節在某些情境下仍可改善。我們將繼續朝著更高的解析度和更真實的視覺效果邁進。

Intelligence with Everyone.

## 標籤

新產品, AIGC, VLM, MiniMax H3, MiniMax
