# World Labs 推出 Atlas：生成最長 1 分鐘、1440p 影片，並控制相機路徑與重建 3D 場景

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Fei-Fei Li (@drfeifei) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥🔥 · 日期：2026-09-02

> 原始來源：https://x.com/drfeifei/status/2094840371675283673

## 證據與延伸閱讀

- [World Labs 推出 Atlas：生成最長 1 分鐘、1440p 影片，並控制相機路徑與重建 3D 場景。](https://worldlabs.ai/blog/atlas) — 官方文件 · 最後核對：2026-09-02 · 支持主張：Atlas is pretrained from scratch as a multimodal autoregressive diffusion transformer over text, images, video, camera poses, and 3D depth; the official article reports camera-controlled generation, sparse-view reconstruction, space-time simulation, explicit 3D outputs, and vendor benchmark results.
- [多張影像組合成一致 3D world](https://x.com/drfeifei/status/2094840371675283673)

## 中文摘要

World Labs 推出 Atlas：生成最長 1 分鐘、1440p 影片，並控制相機路徑與重建 3D 場景。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/e72ad9a6cde67dbc.jpg)
> 一座紅色懸索橋橫跨在藍色水面上，遠方為起伏的海岸與陸地，畫面中央疊印著白色的英文字母。

**核心定位**  
Atlas 是面向 spatial intelligence 的 omni 多模態 world model，將文字、影像、影片、camera poses 與 3D depth 視為同一序列中的不同輸入與輸出。World Labs 在[官方文章](https://worldlabs.ai/blog/atlas)中表示，Atlas 採用自回歸 diffusion transformer，融合大型語言模型與影像、影片模型的設計：

- 自回歸 transformer 讓 Atlas 能沿用 KV-caching、cache-aware routing 與 disaggregated serving 等 LLM 系統技術。
- rectified flow diffusion 模型透過逐步去噪生成輸出，也能藉由調整推論時的去噪步驟，在速度與品質間取捨。
- Transformer 架構則利用適合現代硬體的矩陣乘法，作為 world modeling 的核心骨幹。

**主要能力**  
Atlas 會產生影片，也把相機運動、空間結構與時間變化納入同一模型：

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1788370370975-byndizfx.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/e72ad9a6cde67dbc.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> 來源：[@theworldlabs](https://x.com/theworldlabs/status/2094839756329041984)（回覆）｜Atlas 透過單張影像與相機路徑控制生成 3D 世界與模擬空間。

- 從一張或多張輸入影像生成最長 1 分鐘、1440p 的影片，並直接控制 camera path；輸入可以包含 pan、truck、crane 等一至三段電影式運鏡。
- 以稀疏影像與 camera poses 重建場景，輸出明確的 3D 空間；官方 reframing 範例使用三至五個 camera views，機器人重建範例則各使用 24 個 frames。
- 將多張具備姿態資訊的影像組合成一致的 3D world，並透過重新取景模擬影片中的時空變化。
- 產生一般影像或 360 度全景圖，也能模擬機器人視角。

不過，未被輸入影像觀察到的區域可能是模型自行想像的內容，因此稀疏視角重建不能直接視為完整、經驗證的真實場景。

**官方評測**  
World Labs 選擇 camera-controlled generation 與 sparse-view 3D reconstruction 兩條評測軌道。前者由第三方人工評審判斷模型是否遵循指定運鏡；Atlas 在各組比較中獲選的比例為：

- 相較 MiniMax H3：75%，95% 信賴區間為 68% 至 82%。
- 相較 Gemini Omni Flash：81%，區間為 74% 至 87%。
- 相較 Happy Horse 1.1：86%，區間為 82% 至 91%。
- 相較 FLUX 3：93%，區間為 88% 至 97%。
- 相較 Seedance 2.5：94%，區間為 90% 至 97%。

3D 重建以平均絕對相對 pointmap error 評估，數值乘以 10^-3，越低越好：Atlas 為 25.3、Pi3X (posed) 為 28.7、pi cubed 為 34.7、VGGT-Omega 1B 為 36.4、Depth Anything 3 為 39.3，MapAnything 為 47.7。

<figure><img src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/illustrations/1788365376270-9bu8kfup.png" alt="World Labs Atlas 的指定運鏡偏好率與稀疏視角 3D 重建誤差比較" loading="lazy" /><figcaption>World Labs 公布的兩條評測軌道：左側是 Atlas 相較五個模型的指定運鏡偏好率，右側是 pointmap error；Atlas 原生接收 camera poses，其他模型以文字描述運鏡，條件並不完全相同。</figcaption></figure>

**評測限制**  
這些結果不能直接解讀成完全公平的模型對決。Atlas 使用原生 camera input format 接收 camera path；其他模型不支援原生相機輸入，只能在文字 prompt 中描述同一段運鏡。World Labs 也承認，更複雜的 prompt engineering 或 multimodal prompt 可能改善其他模型的 camera following 表現。此外，這些數字是 World Labs 發布的結果，雖然團隊表示以共同協定重現 baseline，仍沒有獨立 benchmark 報告可供驗證。

**開放狀態與後續**  
Atlas 目前僅向 select partners 提供 early access，官方尚未說明一般可用時間與定價；有興趣的團隊可申請測試，特別適合用代表性場景驗證生成、重建與模擬能力。World Labs 表示，開發期間持續擴大模型規模與訓練計算量，新的計算量層級都解鎖了更多能力，並預期未來 world model 仍會沿著 scaling 路線提升。

## 媒體內容

**Atlas 透過單張影像與相機路徑控制生成 3D 世界與模擬空間。**

**影片中的 Prompt 與操作**

操作步驟：

1. （00:25）展示 Input Image 與 Camera Path 生成 Output 三維畫面
2. （00:55）展示室內客廳的 Sparse Reconstruction 三維空間重建
3. （01:04）展示 Robotics Simulation 的三維點雲地圖與機器人移動模擬

## 標籤

新產品, Atlas, World Labs
