# GLM-5.3-Flash 登上 Agent Arena 開源模型第 4，單項任務中位成本 0.12 美元

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Arena.ai (@arena) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥 · 日期：2026-09-01

> 原始來源：https://x.com/arena/status/2094440382440611935

## 證據與延伸閱讀

- [GLM-5.3-Flash 登上 Agent Arena 開源模型第 4，單項任務中位成本 0.12 美元。](https://autoclaw.z.ai/blog/model/glm-5.3-flash) — 官方文件 · 最後核對：2026-09-01 · 支持主張：The result also reports +15.3% confirmed-success improvement and links a first-party GLM-5.3-Flash release describing native multimodality, efficient attention, and open weights.
- [GLM-5.3-Flash Agent Arena results — arena.ai](https://arena.ai/) — 官方文件 · 最後核對：2026-09-01 · 支持主張：The result also reports +15.3% confirmed-success improvement and links a first-party GLM-5.3-Flash release describing native multimodality, efficient attention, and open weights.
- [GLM-5.3-Flash 登上 Agent Arena 開源第 4](https://x.com/arena/status/2094440382440611935)

## 中文摘要

GLM-5.3-Flash 登上 Agent Arena 開源模型第 4，單項任務中位成本 0.12 美元。

**Arena 評測結果**　Arena.ai 於 2026 年 8 月 31 日表示，GLM-5.3-Flash 的結果來自超過 9K 場真實 agentic sessions，排名介於 DeepSeek V4 (High) 與 GPT-5.6 Luna (xHigh) 之間；整體排名比 GLM-5.3 (Max) 的第 20 名前一名。Arena 同時報告整體 net improvement 為 +4.6%；按不同 signal 拆分後，Confirmed Success 的改善幅度達 +15.3%，該項排名第 4。這些結果可在 [Arena 的原始貼文](https://x.com/arena/status/2094440382440611935) 查閱，但排名仍取決於抽樣 session 與 signal 定義，不能直接視為所有工作負載的普遍結論。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/d08182d6a2e786a7.jpg)
> GLM-5.3-Flash 在 Agent Arena 中每任務中位數成本為 $0.12，位於 DeepSeek V4 Pro (High) 與 GPT 5.6 Luna (xHigh) 之間的 Pareto Frontier 上，在開源模型中排名第 4、整體排名第 19。

**模型架構與效率**　Z.ai 的第一方發布資料指出，GLM-5.3-Flash 是 GLM-5 家族首個原生多模態模型，具備 320B 總參數、18B active parameters，並以 30T-token 多模態 corpus 訓練。它結合 sparse attention 與 linear attention，並採用 Manifold-Constrained Hyper-Connections；面對最長一百萬 token 的 context，IndexPool 會將四個快取 key vectors 透過加權 pooling 壓縮成一個，以降低 indexer 延遲與記憶體負擔。官方比較顯示，相較 GLM-5.3，attention compute reduction 約為 3.0×，KV-cache size reduction 約為 4.4×；不過，KV-cache footprint 仍略大於部分同級 Flash-class models，代表後續仍有最佳化空間。

**Agent 與多模態能力**　官方評測稱，GLM-5.3-Flash 在 Terminal Bench 2.1、DeepSWE v1.1、NL2Repo、Toolathlon Verified、AutomationBench v1.0.6 等工作上優於 GLM-5.2，分數分別為 84.3 對 81.0、63.4 對 46.2、56.3 對 48.9、78.4 對 59.9，以及 48.8 對 26.2；Agents’ Last Exam 也由 20.4 提升至 26.3。模型可同時理解文字、圖片、影片與檔案，並將視覺回饋納入執行與驗證，例如檢查文件版面、圖表表達、網頁狀態、文字溢出、元件重疊與樣式不一致，再決定下一步操作。

**部署與實務範圍**　官方表示，模型曾在中國 AI 加速器上承載真實流量，搭配節點內張量平行化（intra-node tensor parallelism）、ReplaySSM、W8A8 quantization、混合 INT8/FP8/BF16 cache quantization、Layer Split，以及 Encode–Prefill–Decode disaggregated architecture；相較同硬體的初始基線，端到端 serving performance 成長為三倍。GLM-5.3-Flash 的模型權重已在 Hugging Face 以 MIT License 公開，目前支援 SGLang、vLLM 與 TokenSpeed，但 framework 相容性與部署選項仍可能變動。官方也宣稱它已可在 AutoClaw 使用，支援文件分析、資料分析、簡報與商務工作流程。

**採用前提與風險**　GLM-5.3-Flash 的排名、成本與官方 benchmark 都應視為特定來源與條件下的結果。實際成本及效能會受到 inference settings、工具、執行框架、硬體與評測環境影響；官方架構與 benchmark 數字也仍屬第一方主張。採用前應先以自有工具和成本上限測試代表性任務，確認模型權重、License 與 inference framework，再決定是否部署。另須注意 Arena.ai 的服務聲明：對話及部分個人資訊可能提供給第三方 AI 供應商或公開，且對話會用於 automated evaluation；不宜提交不希望公開的敏感資料。

## 標籤

新產品, GLM-5.3-Flash, Z.ai, Agent Arena, Arena.ai, DeepSeek V4 (High), Luna (xHigh), GLM-5.3 (Max), Terminal Bench 2.1, DeepSWE v1.1, NL2Repo, Toolathlon Verified, AutomationBench v1.0.6
