# Dyna Robotics 發布 Dyna-2，以 100 萬小時人類影片驗證跨機器人具身擴展定律

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Dyna Robotics (@DynaRobotics) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥 · 日期：2026-08-12

> 原始來源：https://x.com/dynarobotics/status/2086856327150858298

## 證據與延伸閱讀

- [Dyna Robotics 發布 Dyna-2，以 100 萬小時人類影片驗證跨機器人具身擴展定律](http://dyna.co/dyna-2) — 官方文件
- [通過內部language-following benchmark並達87%評分](https://x.com/DynaRobotics/status/2086859099124449385)

## 中文摘要

Dyna Robotics 發布 Dyna-2，以 100 萬小時人類影片驗證跨機器人具身擴展定律。

**發布重點** Dyna Robotics 在 2026 年 8 月 11 日分享 Dyna-2，並邀請讀者閱讀其[技術部落格](http://dyna.co/dyna-2)。這個模型的核心主張不是單純展示更多任務，而是說明「持續擴大資料規模」如何推動 embodied AI：人類資料從 1,000 小時擴充到 1,000,000 小時時，模型在多種評估指標上的表現都持續改善；更重要的是，這種在人類資料上觀察到的 scaling law，也能轉移到訓練時從未看過的機器人資料。

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1786476775179-6102qdg8.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/04879f18d932d101.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> Dyna-2 文字標題畫面

**規模化結果** Dyna-2 使用超過 1,000,000 小時的第一人稱人類操作影片進行 pre-training，約等同 170 年不間斷的清醒經驗。Dyna Robotics 表示，這是首次在一百萬小時規模驗證 world-action model 的 scaling law，且為避免結論依賴單一評估方式，研究同時使用四種指標：

- 兩種連續誤差：MSE 與 L1。
- 兩種離散準確率：`accuracy@0.5` 與 `accuracy@0.1`。

畫面中的人類資料評估圖顯示，資料集從 1,000、10,000、100,000 到 1,000,000 小時逐步擴大時，held-out human data MSE 由 0.062 降至 0.054；圖中以 `MSE = 0.069 • D^-0.018` 擬合，`R²` 為 0.919。這些數字屬於示範畫面顯示的圖表資訊，Dyna Robotics 的貼文則概括指出四種指標都呈現可預測的改善。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/56b6dd91b0648ddb.jpg)
> Dyna-2 在預訓練人類數據規模從 1,000 擴展至 1,000,000 小時過程中，於 Held-out MSE、Held-out L1、Accuracy@0.1 與 Accuracy@0.5 四項評估指標上展現出符合 Scaling Law 的可預測性能提升

**跨 embodiment 轉移** 發文者認為最重要的結果，是只用人類影片做 pre-training，仍能改善模型對未曾看過的機器人資料之 zero-shot offline evaluation。來源技術內容以 39 項任務測試兩個不同的固定式雙臂 YAM 平台，任務涵蓋布料處理、打結、打包、清潔、餐飲服務與組裝；測試資料中的軌跡沒有被任何 pre-trained checkpoint 使用。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/c54f171ae79ef786.jpg)
> 預訓練人類影片資料時數從 1k 擴展至 1M 小時能顯著降低 Zero-shot action MSE 並提升 accuracy@0.5，展現跨體態的 Scaling Law

畫面顯示的 zero-shot robot data MSE，隨人類 pre-training 資料從 1,000 小時增加到 1,000,000 小時，由 0.180 降至 0.117，並以 `MSE = 0.306 • D^-0.071` 擬合，`R² = 0.884`。研究觀察到 10,000 至 100,000 小時之間出現轉折，暗示當人類操作資料的涵蓋範圍足夠時，跨 embodiment 的知識轉移可能單靠資料規模就會浮現。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/4fd9ea69fadb9f18.jpg)
> Dyna-2 透過增加預訓練的純影片時數，顯著降低零樣本機器人動作 MSE，展現跨載體資料 Scaling Law 的轉移效果。

**資料與訓練目標** Dyna Robotics 強調，跨 embodiment scaling law 並非只要堆疊影片資料就會自然出現，training objective 同樣關鍵。Dyna-2 將 video data 用於 world modeling，讓模型學習場景如何演變、物件如何回應接觸，以及手部如何與物件互動；貼文主張，world modeling 與影片資料規模化是跨 embodiment 轉移成立的必要條件。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/f914d4802e3cdfbb.jpg)
> Dyna-2 在預訓練人類影片時數從 1k 擴展至 1M 小時的過程中，14 項任務的平均標準化分數從 20% 穩步提升至 53%，顯現跨四個數量級的 scaling law。

來源指出，Dyna-2 是一個以 video-diffusion backbone 為基礎的單一生成模型，能共同或分別預測未來影片與動作。模型採用 mixture of transformers，將影片、動作與文字等輸入分別轉成 token，再讓不同模態的 transformer 透過 attention 互動；訓練時共同使用 video loss 與 action loss，但實際推論仍維持反應式策略，不需要生成或讀取預測的未來影片。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/ef0884050c68eb3e.jpg)
> Dyna-2 的單步生成方法（ours · 1 step）相較於 teacher 1 step 與 score-based 1 step，能更精準地切近真實影片流形並產生清晰的動態。

**機器人部署能力** scaling law 也延伸到 post-training 後的實際機器人表現。Dyna Robotics 表示，模型在 pre-training 階段完全沒有接觸機器人資料，只需幾小時、多種機器人 embodiment 的 post-training 資料，就能支援雙臂平行夾爪、半人形平台與靈巧手平台。來源中特別提到，僅 10 分鐘 teleoperation 資料，就足以將 Dyna-2 fine-tune 成能以兩隻五指機器人手開啟瓶蓋。

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1786476702315-dbcvsszb.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/c61626661f9cfeea.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> 雙臂機械人正在砧板上切西芹的示範畫面

貼文另稱，Dyna-2 是 Dyna Robotics 第一個通過內部 language-following benchmark 的模型，並具備更好的 robustness 與 zero-shot environment generalization。在新客戶場域的 zero-shot deployment 中，模型首次達到 87% 的品質與 throughput 評分。示範影片則展示雙臂機器人切芹菜、從冰箱拿取指定飲料、解開繩結、拿取工具與操作抽屜等任務，畫面字幕將能力歸納為 instruction following、robustness、precision、dexterity 與 teachability。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/956bc1e801dca063.jpg)
> Video co-train · Dyna-2 在語言跟隨基準測試的各項任務中取得最佳表現，四項任務總分達到 0.96。

**後續方向** Dyna Robotics 將 Dyna-2 視為 embodied AI scaling 的新方向，並稱「1,000,000 小時只是開始」。公司正在尋找資料與 model 合作夥伴，有興趣者可透過 `datapartnerships@dyna.co` 聯絡；不過，這些成果目前主要是 Dyna Robotics 對其內部模型與評估的說明，跨平台、跨任務的普遍性仍有待更多外部研究與獨立測試確認。

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1786476764419-qnpk71n8.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/2de28ae442e5d400.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> 雙臂機器人操作菜刀在砧板上切芹菜的烹飪作業演示影片

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/7193dd90e5a2bf5a.jpg)
> Dyna-2 的標題字樣以白色粗體呈現，由無數小圖像拼貼組成，背景則是由密集的微小影像所構成的暗色紋理。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/e23969dbb7d5bf8f.jpg)
> 金屬淺托盤裡盛裝著切成段的綠色芹菜，托盤置於木質與灰色檯面上。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/6e66e7de9fdbb45c.jpg)
> 一隻裝有切碎西洋芹塊的金屬烤盤，放置在木質砧板與灰色工作檯面上。

## 媒體內容

**雙臂機械人正在砧板上切西芹的示範畫面**

**影片中的 Prompt 與操作**

操作步驟：

1. （00:04）使用者從透明收納盒中拿取螢光筆
2. （00:58）使用者翻開檔案夾的活頁
3. （01:21）機械人拉開抽屜並夾出螢光筆

**Dyna-2 在預訓練人類數據規模從 1,000 擴展至 1,000,000 小時過程中，於 Held-out MSE、Held-out L1、Accuracy@0.1 與 Accuracy@0.5 四項評估指標上展現出符合 Scaling Law 的可預測性能提升**

**數據表（1）Held-out MSE ↓**

| 項目 | 數值 |
| --- | --- |
| 公式：MSE | 0.0691 · D^-0.0184 |
| R² | 0.919 |
| 1k | 0.062 |
| 10k | 0.057 |
| 100k | 0.056 |
| 1M | 0.054 |

**數據表（2）Held-out L1 ↓**

| 項目 | 數值 |
| --- | --- |
| 公式：L1 | 0.151 · D^-0.0132 |
| R² | 0.879 |
| 1k | 0.140 |
| 10k | 0.131 |
| 100k | 0.129 |
| 1M | 0.127 |

**數據表（3）Accuracy@0.1 ↑**

| 項目 | 數值 |
| --- | --- |
| 公式：acc@0.1 | 0.0116 · D^+0.0606 |
| R² | 0.926 |
| 1k | 0.017 |
| 10k | 0.021 |
| 100k | 0.024 |
| 1M | 0.026 |

**數據表（4）Accuracy@0.5 ↑**

| 項目 | 數值 |
| --- | --- |
| 公式：acc@0.5 | 0.357 · D^+0.0203 |
| R² | 0.865 |
| 1k | 0.40 |
| 10k | 0.44 |
| 100k | 0.45 |
| 1M | 0.47 |

**預訓練人類影片資料時數從 1k 擴展至 1M 小時能顯著降低 Zero-shot action MSE 並提升 accuracy@0.5，展現跨體態的 Scaling Law**

**數據表（1）Zero-shot action MSE ↓**

| 系列名 | 1k | 10k | 100k | 1M |
| --- | --- | --- | --- | --- |
| xdof (27) | 0.178 | 0.172 | 0.112 | 0.108 |
| all 39 | 0.181 | 0.175 | 0.125 | 0.115 |
| dyna (12) | 0.188 | 0.182 | 0.145 | 0.125 |

**數據表（2）Zero-shot accuracy@0.5 ↑**

| 系列名 | 1k | 10k | 100k | 1M |
| --- | --- | --- | --- | --- |
| xdof (27) | 0.045 | 0.082 | 0.165 | 0.188 |
| all 39 | 0.068 | 0.075 | 0.135 | 0.150 |
| dyna (12) | 0.045 | 0.058 | 0.072 | 0.110 |

**Dyna-2 在預訓練人類影片時數從 1k 擴展至 1M 小時的過程中，14 項任務的平均標準化分數從 20% 穩步提升至 53%，顯現跨四個數量級的 scaling law。**

**數據表（1）ALL 14 TASKS, MEAN NORMALIZED SCORE ↑**

| 項目 | 數值 |
| --- | --- |
| 1k | 20% |
| 10k | 28% |
| 100k | 45% |
| 1M | 53% |

**數據表（2）Highlighter in Drawer · dexterous**

| 項目 | 數值 |
| --- | --- |
| 1k | 10% |
| 10k | 80% |
| 100k | 80% |
| 1M | 90% |

**數據表（3）Bottle Cap Untwisting · dexterous**

| 項目 | 數值 |
| --- | --- |
| 1k | 10% |
| 10k | 10% |
| 100k | 40% |
| 1M | 50% |

**數據表（4）Trash Tray Pickup**

| 項目 | 數值 |
| --- | --- |
| 1k | 2.2 |
| 10k | 3.9 |

**Video co-train · Dyna-2 在語言跟隨基準測試的各項任務中取得最佳表現，四項任務總分達到 0.96。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| All four tasks (n = 36) |  |
| Action-only · early Dyna-2 | 0.35 |
| Video co-train · early Dyna-2 | 0.67 |
| Video co-train · Dyna-2 | 0.96 |
| Push/pull jenga (n = 8) |  |
| Action-only · early Dyna-2 | 0.44 |
| Video co-train · early Dyna-2 | 1.00 |
| Video co-train · Dyna-2 | 1.00 |
| Object kitting (n = 10) |  |
| Action-only · early Dyna-2 | 0.10 |
| Video co-train · early Dyna-2 | 0.35 |
| Video co-train · Dyna-2 | 0.95 |
| Piece stacking (n = 10) |  |
| Action-only · early Dyna-2 | 0.60 |
| Video co-train · early Dyna-2 | 0.95 |
| Video co-train · Dyna-2 | 1.00 |
| Napkin manipulation (n = 8) |  |
| Action-only · early Dyna-2 | 0.25 |
| Video co-train · early Dyna-2 | 0.38 |
| Video co-train · Dyna-2 | 0.88 |

**雙臂機器人操作菜刀在砧板上切芹菜的烹飪作業演示影片**

**影片中的 Prompt 與操作**

操作步驟：

1. （00:02）雙臂機器人手持菜刀在砧板上切芹菜

**Dyna-2 透過增加預訓練的純影片時數，顯著降低零樣本機器人動作 MSE，展現跨載體資料 Scaling Law 的轉移效果。**

**數據表（1）Video-only hours (action data fixed at 50k hr)**

|   | 0 | 1k | 10k | 50k |
| --- | --- | --- | --- | --- |
| Zero-shot robot action MSE | 0.34 | 0.18 | 0.15 | 0.12 |

**數據表（2）Video-only hours (action data fixed at 250k hr)**

|   | 0 | 250k | 750k |
| --- | --- | --- | --- |
| Zero-shot robot action MSE | 0.10 | 0.087 | 0.084 |

**Dyna-2 的單步生成方法（ours · 1 step）相較於 teacher 1 step 與 score-based 1 step，能更精準地切近真實影片流形並產生清晰的動態。**

**數據表（1）標題**

|   |
| --- |
| One step is a straight shortcut across a curved path — the whole problem is where it lands |

**數據表（2）方法與路徑比較**

|   | 步數 | 特性 | 結果 | 步數 | 特性 | 結果 | 步數 | 特性 | 結果 | 步數 | 特性 | 結果 |
| --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- |
| teacher · 50 curved steps | 50 steps (100 NFE) | trust region — the score is reliable here | real videos, same prompt and first frame | 50 steps (100 NFE) | trust region — the score is reliable here | real videos, same prompt and first frame | 50 steps (100 NFE) | trust region — the score is reliable here | real videos, same prompt and first frame | 50 steps (100 NFE) | trust region — the score is reliable here | real videos, same prompt and first frame |

## 標籤

新產品, Robot, 研究論文, Dyna Robotics, Dyna-2
