# H3-World 論文釋出 MiniMax-H3 LoRA，以 0.199% 的可訓練參數生成 5.2 秒遊戲控制片段

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Xingyi Yang (@yxy2168) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥🔥 · 日期：2026-09-02

> 原始來源：https://x.com/yxy2168/status/2094996731079622690

## 證據與延伸閱讀

- [H3-World 論文釋出 MiniMax-H3 LoRA，以 0.199% 的可訓練參數生成 5.2 秒遊戲控制片段。](https://arxiv.org/abs/2609.01560) — 一手來源 · 最後核對：2026-09-02 · 支持主張：研究補上 action-as-language、temporal latent alignment、attention routing 與 rank-32 LoRA 的方法和訓練配置：7,872 個訓練 clips、128 個 held-out clips，每段 124 frames、24 fps、832x480、37 個 prompts。論文的評估是 recorded/intervened control、未見 action-pair 組合與視覺轉移的 qualitative representative examples；明示沒有 standard cross-model benchmark 或 independently replicated control metric，並指出尚無 persistent world state、real-time interaction、planning 或 policy learning。
- [H3-World / MiniMax-H3 world control — github.com](https://github.com/Danzer1xxxxChan/H3-World) — 官方 Repository · 最後核對：2026-09-02 · 支持主張：研究補上 action-as-language、temporal latent alignment、attention routing 與 rank-32 LoRA 的方法和訓練配置：7,872 個訓練 clips、128 個 held-out clips，每段 124 frames、24 fps、832x480、37 個 prompts。論文的評估是 recorded/intervened control、未見 action-pair 組合與視覺轉移的 qualitative representative examples；明示沒有 standard cross-model benchmark 或 independently replicated control metric，並指出尚無 persistent world state、real-time interaction、planning 或 policy learning。
- [H3-World / MiniMax-H3 world control — danzer1xxxxchan.github.io（貼文明示來源）](https://danzer1xxxxchan.github.io/H3-World) — 一手來源 · 支持主張：研究補上 action-as-language、temporal latent alignment、attention routing 與 rank-32 LoRA 的方法和訓練配置：7,872 個訓練 clips、128 個 held-out clips，每段 124 frames、24 fps、832x480、37 個 prompts。論文的評估是 recorded/intervened control、未見 action-pair 組合與視覺轉移的 qualitative representative examples；明示沒有 standard cross-model benchmark 或 independently replicated control metric，並指出尚無 persistent world state、real-time interaction、planning 或 policy learning。
- [MiniMax-H3 LoRA生成短視界遊戲控制影片](https://x.com/yxy2168/status/2094996731079622690) — 一手來源
- [釋出step-10000 LoRA checkpoint](https://video.twimg.com/amplify_video/2094996572119736320/vid/avc1/1280x720/7aUNDI6MwtLkI3kl.mp4?tag=14) — 一手來源

## 中文摘要

H3-World 論文釋出 MiniMax-H3 LoRA，以 0.199% 的可訓練參數生成 5.2 秒遊戲控制片段。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/153f55dc0fba298d.jpg)
> H3-WORLD 的宣傳橫幅，畫面正中央印有「H3-WORLD」白色粗體字標題，背景採用拼貼合成風格，分為四個不同的奇幻與科幻場景：左上角為雪山環境中的一位背包客，右上角為霓虹燈閃爍的未來夜市街景與一名穿著科技感外套的人物，左下角為黃昏沙漠綠洲中的遠眺背影，右下角則為佈滿綠色植物的室內溫室通道。

這是研究論文與 LoRA（低秩適配器）checkpoint，也就是可載入的微調權重，不是可即時遊玩的完整產品。Xingyi Yang 表示，方法不新增 action module，只使用約 8K 個樣本（7,872 個 training clips 加 128 個 held-out clips）與 0.199% 的可訓練參數完成適配。

**方法設計** H3-World 把鍵盤與鏡頭指令轉成文字，對齊到影片各時間段的隱向量；再用時間注意力路由，減少某一時間段的動作訊號干擾其他時間段。系統重用 MiniMax-H3 原生的 text pathway，透過 rank-32 LoRA 訓練 `qkv_proj` 與 `out_proj`，學習 65.6M 個 LoRA parameters，約占 33B MiniMax-H3 backbone 的 0.199%，而不是另外建立專用的 action module。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/0ba0273c1aa315fc.png)
> H3-World 的序列建構與 LoRA 適應架構圖，分為 (a) 建構封裝的 H3-World 序列、(b) 適應 H3 區塊以及 (c) H3 自注意力機制內部的 LoRA 等三個部分，展示視覺與動作串流、H3 Omni Transformer 區塊及遮罩注意力機制的運作流程。

**訓練與輸出** 論文使用 ABot-World-Explorer-500h，包含 7,872 個 training clips 與 128 個 held-out evaluation clips；每段影片為 124 frames、24 fps、832×480 pixels，並搭配 37 個 latent-aligned prompts。訓練配置為 10,000 步、learning rate `1e-4`、rank-32 LoRA、20 個 epochs，預設使用四張 GPU；推論採 50 denoising steps，產生固定長度的 124-frame、5.2-second 影片。Repository 另以「8,000 gameplay clips」概述資料規模，但訓練流程明列實際準備 7,872 段與 128 段測試資料。

**展示內容** 釋出的 step-10000 LoRA checkpoint 可生成向前移動等短片段，並提供 still、forward、back、strafing、tilting 與 panning 等預設。展示影片以相同場景與 seed 比較不同 W、A、S、D、空白鍵及鏡頭控制，涵蓋外星雙月沙漠、水晶沙漠、燈籠洞穴第一人稱視角與霓虹小巷等情境；這些畫面可觀察動作和鏡頭變化，但不等於持續可操作的遊戲世界。

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1788345508669-sh7piwgp.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/a16c864dba77c57b.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> H3-World 發布展示 MiniMax-H3 控制介面的多視角示範，涵蓋不同場景下鍵盤與鏡頭控制鍵組合

**評估與限制** 論文以質化代表案例呈現錄製控制、介入控制、未見過的 action-pair 組合，以及不同初始畫面之間的轉移效果。作者明確指出，目前沒有 standard cross-model benchmark 或 independently replicated control metric，也尚未提供跨動作組合、場景與亂數種子的系統化評估；模型只能生成固定長度的短時段片段，不具備持續的世界狀態、即時互動、規劃或策略學習。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/2916268e2130121c.png)
> 作者提供的單一質化比較圖中，H3-WORLD 第 1 幀是綠框基準首幀，第 2–5 幀標有控制正確的綠色勾選；Additive bias 與 FiLM 在部分影格被標出 wrong movement 或 incorrect camera controls。這不是跨場景統計或 aggregate benchmark。

**重現門檻** Repository 測試環境為 Python 3.10 與 CUDA 12.8，必須使用 exact DiffSynth-Studio revision 及 H3-World attention patch；MiniMax-H3 base weights 約需 135 GB，訓練還需要 ABot dataset。這代表實驗重現仍有明顯硬體與環境成本，且 GitHub metadata 當時未宣告 repository license，不能僅因程式碼可取得就推定允許寬鬆再散布。論文連結為 [arXiv 2609.01560](https://arxiv.org/abs/2609.01560)。

## 標籤

研究論文, 新產品, H3-World, MiniMax H3, MiniMax-H3 LoRA
