# MiniMax 公開 H3 全模態影片生成模型，最高輸出 2K、15 秒立體聲影片

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：MiniMax (official) (@MiniMax_AI) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥🔥 · 日期：2026-08-03

> 原始來源：https://x.com/MiniMax_AI/status/2084106804032872591

## 證據與延伸閱讀

- [MiniMax-H3 全模態影片生成模型](https://huggingface.co/MiniMaxAI/MiniMax-H3) — 官方文件

## 中文摘要

MiniMax 公開 H3 全模態影片生成模型，最高輸出 2K、15 秒立體聲影片。MiniMax 於 2026 年 8 月 3 日宣布開放模型，模型頁面位於 [Hugging Face](https://huggingface.co/MiniMaxAI/MiniMax-H3) 。

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1785735166585-uzz7nvix.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/ccc3970a13872d0b.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> 以偵探風格呈現的 MiniMax H3 宣傳短片，展示文字、圖像、聲音與影片等多模態生成功能。

**核心能力** MiniMax-H3 支援 4～15 秒影片、24 FPS、32 kHz 立體聲，以及 21:9、16:9、1:1、9:16 等多種畫面比例；穩定支援阿拉伯文、中文、英文、法文、德文、義大利文、日文、韓文、葡萄牙文、俄文與西班牙文共 11 種對話語言。H3-Base-FL2VA 可接受零至兩張圖片，支援文字生影片、首幀／末幀生影片與首末幀生成；H3-Base-Ref2VA 則可混合最多 9 張圖片、3 段影片與 3 段音訊，所有輸入檔案合計最多 12 個。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/cd5fc7ffa915c1f5.png)
> MiniMax H3 的 Next-Generation Open-Weights General-Purpose Multimodal Video Model 形象標題畫面

**系統架構** 完整系統由 H3-Context-IR、H3-Base 與 H3-Regenerate-2K 組成：前者負責解析跨模態關聯、時間脈絡與複雜推理，H3-Base 先生成 768p 結果，再由 H3-Regenerate-2K 依原始脈絡重生成 2K，以保留小字與細節。H3-Omni-Transformer 是 33B 參數的 dense 單流 Transformer；另有 H3-Encoder 使用 Qwen3-VL-32B 的完整預訓練權重，取其第 50 層 hidden states 餵給前者。H3-Omni-Transformer 的完整權重已釋出，但初始版本僅提供 full attention，sparse attention 將於後續更新推出。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/5e6807f3acb2d8de.png)
> MiniMax H3 System Overview 的系統架構流程圖，分為 Context Understanding、Base Generation 與 High-Resolution Regeneration 三個主要階段。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/6916bcdd32895e68.png)
> MiniMax H3-Base 的多模態編碼、上下文序列打包、統一生成與解碼架構圖

**開放範圍與限制** H3-Context-IR 與 H3-Regenerate-2K 因依賴多階段 hosted models 與服務，尚未開源，官方改以 API 驗證結果；使用者可在本機部署 H3-Base，或結合 Open Platform API 執行端到端 2K 流程。文字、圖片、影片與增強後 prompt 會經自動審核，疑似違法、色情或侵害第三方權利的內容可能遭封鎖，且官方提醒仍可能出現誤判。

## 媒體內容

**以偵探風格呈現的 MiniMax H3 宣傳短片，展示文字、圖像、聲音與影片等多模態生成功能。**

**逐字稿**

- `00:01` 他們問我看到了什麼。我說，全部。（They asked me what I see. I said, everything.）
- `00:04` 文字、影像、聲音、影片。別眨眼，它正在成形。（Text, image, sound, video. Don't blink, it's forming right now.）
- `00:15` 注意聽！（Pay attention!）
- `00:30` 大家聽我說（Listen to me everyone）
- `00:31` 它有一個名字（It has a name）
- `00:33` 你需要聽聽這個。（You need to hear this.）
- `00:35` 停下你正在做的事。（Stop what you're doing.）
- `00:37` 它已經來了。（It's already here.）

## 標籤

新產品, AIGC, VLM, MiniMax
