# Meta 發布 Muse Spark 1.3，內部比較少用約 25% tokens，支援長程 Agentic 工作

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Mark Zuckerberg (@finkd) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥🔥 · 日期：2026-09-03

> 原始來源：https://x.com/finkd/status/2095232032896946311

## 證據與延伸閱讀

- [Meta 發布 Muse Spark 1.3，內部比較少用約 25% tokens，支援長程 Agentic 工作。](https://x.com/AIatMeta/status/2095234385129963666) — 一手來源 · 最後核對：2026-09-03 · 支持主張：新增 Muse Spark 1.3 相較 Muse Spark 1.2 的較長 horizon、多 workflow 協作、主動澄清與重大行動確認、自身限制校準、複雜長指令遵循與 multitasking 能力；官方同時提供約 20% 少 tool calls、約 25% 少 tokens 的內部比較，以及 agentic/coding 安全改進、benchmark methodology 與 scorecard。
- [Muse Spark 1.3 — @AIatMeta](https://x.com/AIatMeta/status/2095234387273269349) — 官方文件 · 最後核對：2026-09-03 · 支持主張：新增 Muse Spark 1.3 相較 Muse Spark 1.2 的較長 horizon、多 workflow 協作、主動澄清與重大行動確認、自身限制校準、複雜長指令遵循與 multitasking 能力；官方同時提供約 20% 少 tool calls、約 25% 少 tokens 的內部比較，以及 agentic/coding 安全改進、benchmark methodology 與 scorecard。
- [Muse Spark 1.3 — @AIatMeta](https://x.com/AIatMeta/status/2095234388619579765) — 官方文件 · 最後核對：2026-09-03 · 支持主張：新增 Muse Spark 1.3 相較 Muse Spark 1.2 的較長 horizon、多 workflow 協作、主動澄清與重大行動確認、自身限制校準、複雜長指令遵循與 multitasking 能力；官方同時提供約 20% 少 tool calls、約 25% 少 tokens 的內部比較，以及 agentic/coding 安全改進、benchmark methodology 與 scorecard。
- [Muse Spark 1.3 — research.meta.ai](https://research.meta.ai/blog/introducing-muse-spark-1-3) — 官方文件 · 最後核對：2026-09-03 · 支持主張：新增 Muse Spark 1.3 相較 Muse Spark 1.2 的較長 horizon、多 workflow 協作、主動澄清與重大行動確認、自身限制校準、複雜長指令遵循與 multitasking 能力；官方同時提供約 20% 少 tool calls、約 25% 少 tokens 的內部比較，以及 agentic/coding 安全改進、benchmark methodology 與 scorecard。
- [Muse Spark 1.3 — research.meta.ai](https://research.meta.ai/static/muse-spark-1-3-multimodal-evaluation-methodology) — 官方文件 · 最後核對：2026-09-03 · 支持主張：新增 Muse Spark 1.3 相較 Muse Spark 1.2 的較長 horizon、多 workflow 協作、主動澄清與重大行動確認、自身限制校準、複雜長指令遵循與 multitasking 能力；官方同時提供約 20% 少 tool calls、約 25% 少 tokens 的內部比較，以及 agentic/coding 安全改進、benchmark methodology 與 scorecard。
- [Muse Spark 1.3 — artificialanalysis.ai](https://artificialanalysis.ai/articles/muse-spark-1-3) — 一手來源 · 最後核對：2026-09-03 · 支持主張：新增 Muse Spark 1.3 相較 Muse Spark 1.2 的較長 horizon、多 workflow 協作、主動澄清與重大行動確認、自身限制校準、複雜長指令遵循與 multitasking 能力；官方同時提供約 20% 少 tool calls、約 25% 少 tokens 的內部比較，以及 agentic/coding 安全改進、benchmark methodology 與 scorecard。
- [Muse Spark 1.3 — dev.meta.ai（貼文明示來源）](https://dev.meta.ai/) — 一手來源 · 支持主張：新增 Muse Spark 1.3 相較 Muse Spark 1.2 的較長 horizon、多 workflow 協作、主動澄清與重大行動確認、自身限制校準、複雜長指令遵循與 multitasking 能力；官方同時提供約 20% 少 tool calls、約 25% 少 tokens 的內部比較，以及 agentic/coding 安全改進、benchmark methodology 與 scorecard。
- [Zuckerberg 稱幅度最大的躍升](https://x.com/finkd/status/2095232032896946311)

## 中文摘要

Meta 發布 Muse Spark 1.3，內部比較少用約 25% tokens，支援長程 Agentic 工作。

**發布與可用性**  
Meta 的 @AIatMeta 表示，Muse Spark 1.3 已開始在 Muse Code 與 Meta Model API 推出；既有 reasoning modes 目前可用，但 max reasoning 要等額外 safety testing 完成後才會推出，官方尚未公布確切時間。Mark Zuckerberg（@finkd）則稱，這是 Meta 目前在 coding 與 agentic work 上「幅度最大的一次躍升」，成本「幾乎低到不需計量」。這些都是發布方的說法，不能直接當成獨立驗證結果。官方也預告更大型 model 與 Muse Spark open weights，但都還在 roadmap 階段。

**Agentic 工作能力**  
Muse Spark 1.3 能在單一長 thread 中維持多個 workflow，從混亂且互相衝突的來源建立自身 context，修正計畫缺口並完成交付成果。它也更積極與使用者協作：

- prompt 含糊時主動提出澄清問題，卡住時向使用者求助。
- 在 consequential actions 前要求確認，也更能判斷哪些行動具有不可逆風險。
- 更可靠地遵循複雜、長篇指令，在多步驟工作中保留細節與限制。
- 在同一 thread 混有新舊要求或遭到中斷時，更準確地把 prompt 對應到正確任務。
- 對自身能力與限制有較佳校準，遇到無法處理的障礙時，比較不會捏造結果。

官方表示，模型曾在多樣化 harness 上訓練，以適應不同 agentic 環境；長任務也能依使用者偏好頻繁更新進度，或安靜地在背景執行。

**Coding 與安全**  
Meta engineers 的內部比較指出，Muse Spark 1.3 在 coding 工作流程中會減少不必要的往返、縮短輸出，並改善整體 coding style；相較 Muse Spark 1.2，約少 20% tool calls、25% tokens。不過原文沒有提供可重現的獨立效率測試或 production workload 結果，因此這只能視為 Meta 的內部說法。安全方面，官方宣稱改善 對抗性穩健度、提示注入抵抗力，以及 agentic 工作中對不可逆行動的判斷；max reasoning 仍要等額外 safety testing 完成後才會推出，目前不能寫成已全面可用。

**評測結果與比較邊界**  
官方在涵蓋專業 Agent、電腦操作、網路研究、自動化、軟體工程、指令遵循與長 context 檢索的評測中，列出以下結果：

- DeepSWE v1.1：75.4；涵蓋 113 項任務、91 個程式庫與 TypeScript、Go、Python、JavaScript、Rust 五種語言。
- Terminal-Bench 2.1：88.8；SWEAtlas CodeBase QnA：59.4；OSWorld 2.0：66.9。
- DeepSearchQA：89.4；MRCR 512K–1M：98.1；該評測另在 256K–512K 與 512K–1M 兩個區段各使用 100 個範例。
- 其他分數包括 GDPVal-AA v2 1754、JobBench 64.9、DeepSearchQA 89.4、內部 Agentic IF Index 57.8，以及 AutomationBench 49.4。

但官方 scorecard 以 Muse Spark 1.3 max reasoning 對比 Muse Spark 1.2 xhigh，兩者的 reasoning effort 不同，不能當作同條件的世代比較；第三方 model 的測試也屬 best-effort，prompt、工具與執行環境未必經過各家最佳化。Artificial Analysis 的評測顯示，現階段可用的 Muse Spark 1.3 xhigh 在 Intelligence Index 拿到 61 分，比 Muse Spark 1.2 高 4 分，與 GPT-5.6 Sol max、Grok 4.6 high 並列；合作夥伴 limited preview 中的 Muse Spark 1.3 max 則拿到 62 分。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/6a73bb560c2ea07f.png)
> Muse Spark 1.3 (max) 在 Long Context 與 Coding 多項基準測試（如 MRCR、DeepSWE v1.1、SWEAtlas）中取得最高分，而在 Agent 相關測試中表現各有高低，由 Opus 5 (max) 與 GPT 5.6 Sol (max) 分別在多個指標領先。

**成本與取捨**  
Meta Model API 的標準價格維持每百萬 input tokens $1.25、每百萬 output tokens $4.25，cached input 為每百萬 $0.15。Artificial Analysis 估算 xhigh 每項 Intelligence Index 任務成本為 $0.55，但 agentic 評測約使用 57% 更多 input tokens，output tokens 也增加約 8%，因此每項任務成本高於 Muse Spark 1.2。max 雖在 GDPVal-AA v2 達 1754 Elo、Tau3-Bench Banking 達 52%，卻比 xhigh 分別多使用 62% 與 28% 的 turns 和 reasoning tokens。

**退步與驗證建議**  
評測並非全面上升：AA-LCR 從 83% 降至 79%；AA-Omniscience accuracy 則由 45% 降至 xhigh 的 42%，max 為 44%。Artificial Analysis 認為 xhigh 的下降與較高 abstention rate 有關，而較常拒答同時降低了 hallucination。Muse Spark 1.3 另提供 1M-token context window，支援文字、圖片與影片輸入；實際採用時仍應在 Muse Code 或 Meta Model API 以自身 coding 與 agentic 任務重測，並將澄清、卡點求助、重大行動確認及提示注入納入安全測試。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/9cb9d6d3805c9dfa.jpg)
> 來源：[@AIatMeta](https://x.com/AIatMeta/status/2095234385129963666)｜Muse Spark 1.3 的品牌視覺圖，黑色背景上以藍色斜向光束交織出波浪狀的網格與發光的白色粒子，並有多個帶有箭頭指標的藍色軌跡向上延伸。

## 標籤

新產品, Muse Spark 1.3, Meta AI Research, Meta, Meta Model API
