# dots studio 開放 dots3-note preview 權重，512K context 支援跨模態長期 Agent 任務

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：dots studio (@dotsstudioai) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥 · 日期：2026-08-15

> 原始來源：https://x.com/dotsstudioai/status/2088083314855018521

## 證據與延伸閱讀

- [dots studio 開放 dots3-note preview 權重，512K context 支援跨模態長期 Agent 任務。](https://studio.dots.ai/dots/dots3-en.html) — 官方文件

## 中文摘要

dots studio 開放 dots3-note preview 權重，512K context 支援跨模態長期 Agent 任務。

**核心發布** dots3-note preview 是 dots3 系列目前最輕量的模型，採用 280B 參數的 MoE 架構，每次啟用 16B 參數，能處理文字、圖片、影片與音訊，並輸出文字。模型針對推理、程式碼生成、工具使用、探索陌生環境與長期更新記憶進行最佳化，官方稱其在多項推理、agent 與跨模態評測中，可與大數倍的模型競爭。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/e540f56159cbd252.jpg)
> dots3-note Preview 在推理、Agent 與多模態評估等多項基準測試中與更大型的模型展現出競爭力，在各 benchmark 表現各有高低。

**訓練方法** 模型引入 TEMPO（Test-time-scaled Value Estimation with Macro-step Policy Optimization），把超長任務拆成多個 macro-step，讓同一個 agent 在行動者與評估者之間切換，透過 test-time reasoning 預估後續回報，再於任務完成前更新策略。官方在 ARC-AGI-3 測試中表示，TEMPO 平均分數比 baseline checkpoint 高 31.5%，比 GRPO 高 20.6%；模型也能在陌生環境中觀察、提出並驗證假設，再把經驗寫入記憶。dots studio 另稱，內部 harness 曾協助模型在 IMO 2026 取得官方認證的 42/42 滿分與金牌。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/c6b2ac72180c333a.jpg)
> dots3-note Preview 在各項多模態評測中展現出與更大規模模型競爭的實力，例如在 Charxiv-RQ 以 83.1 分與 Seed 2.1 turbo 持平，並在 SimpleVQA 及 MMAU-Pro 逼近領先模型。

**開放資源** 權重以 Apache License 2.0 發布，可從 [Hugging Face](https://huggingface.co/dots-studio/dots3-note-prev) 取得，程式庫則在 [GitHub](https://github.com/studio-dots-ai/dots3-note-prev)。團隊同步推出兩個評測環境：VibeSearchBench 有 20 個領域、200 項任務，測試逐輪揭露需求的多輪搜尋；VibeLifeBench 涵蓋 10 個領域、20 項任務，每項跨越 20～30 個階段，並以 1,247 項原子檢查評估狀態一致性、工具執行與最終成果。

**限制與後續** 官方強調這仍是 preview，強化學習尚未完成，在幻覺抑制、文字與跨模態能力平衡及整體穩定性方面仍有不足。文中展示的 real-life 任務也都在模擬環境執行；要可靠進入真實世界，還需要穩健的 harness、連接器、資料來源、安全與權限機制，以及完整產品設計。科技說明見 [Tech blog](https://studio.dots.ai/dots/dots3-en.html)。

## 媒體內容

**dots3-note Preview 在推理、Agent 與多模態評估等多項基準測試中與更大型的模型展現出競爭力，在各 benchmark 表現各有高低。**

**數據表**

|   | dots3-note Preview | GLM 5.2 | Seed 2.1 turbo | GPT-5.5 | DeepSeek-v4-flash-0731 | Opus 4.8 | Hy3 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| Claw-Eval | 73.4 | 62.4 | 64.0 | 67.8 | 68.5 | 72.1 | 78.9 |
| SWE-bench-pro | 61.0 | 62.1 | 57.0 | 58.6 | 57.9 | 69.2 |  |
| BrowseComp | 83.3 | 76.6 | 84.9 | 84.4 | 74.5 | 84.3 | 84.2 |
| ARC-AGI-2 | 81.4 | 22.8 |  | 85.0 | 61.4 | 72.1 | 35.8 |
| WildClawBench | 61.7 | 54.2 | 62.8 | 65.6 | 66.0 | 68.0 | 53.6 |
| NL2repo | 49.8 | 48.9 | 43.7 | 50.7 | 54.2 | 69.7 | 45.6 |
| DeepSearchQA | 92.1 | 91.8 | 89.6 | 95.5 | 91.0 | 93.1 | 93.1 |
| ARC-AGI-3(general harness) | 32.1 | 10.7 |  | 21.9 |  | 43.2 | 18.1 |
| VibeLifeBench | 28.1 | 25.4 | 22.8 | 30.1 | 27.3 | 27.5 | 30.0 |
| Terminal-Bench 2.1 | 75.1 | 81.0 | 67.6 | 82.7 | 82.7 | 84.6 | 71.7 |
| VibeSearchBench | 25.7 | 25.3 | 28.8 | 26.5 | 23.7 | 33.8 | 22.4 |
| Codeforces | 3056 | 2851 |  | 3362 | 3329 | 3188 | 2758 |

**dots3-note Preview 在各項多模態評測中展現出與更大規模模型競爭的實力，例如在 Charxiv-RQ 以 83.1 分與 Seed 2.1 turbo 持平，並在 SimpleVQA 及 MMAU-Pro 逼近領先模型。**

**數據表（1）WorldVQA**

| 項目 | 數值 |
| --- | --- |
| dots3-note Preview | 42.7 |
| Inkling-Small | 16.2 |
| Qwen3.7Plus | 35.5 |
| Seed 2.0 Lite | 49.4 |
| Kimi K3 | 51.0 |
| Gemini-3.5-flash | 51.9 |

**數據表（2）Charxiv-RQ**

| 項目 | 數值 |
| --- | --- |
| dots3-note Preview | 83.1 |
| Inkling-Small | 76.9 |
| Seed 2.0 Lite | 80.6 |
| Seed 2.1 turbo | 83.1 |
| Kimi K3 | 83.5 |
| Qwen3.5 Omni Plus | 84.2 |

**數據表（3）PerceptionBench**

| 項目 | 數值 |
| --- | --- |
| dots3-note Preview | 53.4 |
| Inkling-Small | 37.9 |
| Seed 2.0 Lite | 48.3 |
| Qwen3.5 Omni Plus | 52.3 |
| Kimi K3 | 58.5 |
| Gemini-3.5-flash | 60.9 |

**數據表（4）MMEVideo v2**

| 項目 | 數值 |
| --- | --- |
| dots3-note Preview | 39.3 |
| Qwen3.5 Omni Plus | 32.5 |
| Kimi K3 | 32.5 |
| Seed 2.0 Lite | 36.3 |
| Gemini-3.5-flash | 52.1 |

**數據表（5）SimpleVQA**

| 項目 | 數值 |
| --- | --- |
| dots3-note Preview | 72.5 |
| Inkling-Small | 50.1 |
| Qwen3.5 Omni Plus | 67.2 |
| Kimi K3 | 71.3 |
| Seed 2.1 turbo | 73.2 |
| Gemini-3.5-flash | 74.3 |

**數據表（6）GDP pdf(mean-criteria)**

| 項目 | 數值 |
| --- | --- |
| dots3-note Preview | 60.7 |
| Qwen3.5 Omni Plus | 50.5 |
| Inkling-Small | 53.5 |
| Seed 2.0 Lite | 60.4 |
| Seed 2.1 turbo | 65.7 |
| Kimi K3 | 71.9 |

**數據表（7）ZeroBench@5**

| 項目 | 數值 |
| --- | --- |
| dots3-note Preview | 19.0 |
| Inkling-Small | 11.0 |
| Qwen3.5 Omni Plus | 13.0 |
| Seed 2.1 turbo | 18.0 |
| Gemini-3.5-flash | 21.0 |
| Kimi K3 | 24.0 |

**數據表（8）MMAU-Pro**

| 項目 | 數值 |
| --- | --- |
| dots3-note Preview | 69.8 |
| Inkling-Small | 65.6 |
| Seed 2.0 Lite | 67.4 |
| Gemini-3.5-flash | 69.9 |
| Qwen3.5 Omni Plus | 70.0 |

## 標籤

新產品, LLM, Agent, dots3-note
