# Z.ai 推出 GLM-5.3：程式開發基準 Terminal-Bench 3.0 從 4.6 提升至 28.3

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：ZCode (@zcode_ai) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥🔥 · 日期：2026-08-14

> 原始來源：https://x.com/zcode_ai/status/2088156248286147065

## 證據與延伸閱讀

- [Z.ai 推出 GLM-5.3：程式開發基準 Terminal-Bench 3.0 從 4.6 提升至 28.3。](https://z.ai/blog/glm-5.3) — 官方文件
- [圖片引用的數據](https://pbs.twimg.com/media/HPqagjlbwAA9gao.jpg?name=orig)
- [生態系支援與價格](https://x.com/ollama/status/2088153020609798167)

## 中文摘要

Z.ai 推出 GLM-5.3：程式開發基準 Terminal-Bench 3.0 從 4.6 提升至 28.3。

**ZCode 與方案變動** ZCode 表示 GLM-5.3 已全面推出，Coding Plan 使用者的配額歸零重算。官方也主打 98% 以上的快取命中率、約 30% 的有效 token 使用收益，以及截至 8 月 31 日的 1.5 倍限時配額加成，搭配快取節省後，標準配額最高可達 180%。Goal mode 會持續規劃、撰寫程式碼、測試與驗證，直到完成目標；Remote Control 則能讓使用者透過 WeChat 或 Feishu 從手機監控並操控長時間執行的任務。詳情見 [Z.ai 官方公告](https://z.ai/blog/glm-5.3)，ZCode 可從 [zcode.z.ai](http://zcode.z.ai) 取得。

**模型能力** GLM-5.3 沿用 GLM-5.2 的基礎模型，這次所有提升都來自 post-training。Z.ai 表示，模型在自家 Z.ai Code Bench 的表現提升 50%，並在 Terminal-Bench 3.0 與 Agents' Last Exam 取得 open-source SOTA。公開評測中，Terminal-Bench 3.0 從 4.6 提升至 28.3，DeepSWE v1.1 從 46.2 提升至 66.9，Agents' Last Exam 則從 23.8 提升至 28.5。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/97d82ec4bdf2580d.jpg)
> 來源：[@cline](https://x.com/cline/status/2088146558160355639)（回覆）｜GLM-5.3 在 Terminal-Bench 2.1 以 88.2 分擊敗 Fable 5 與 V4-Pro 0813 取得領先。

**Agentic 程式開發** Z.ai 將訓練環境擴展到更接近專業工程與研究工作的長流程任務，例如讓模型在具備運算叢集、儲存系統、內部文件、程式庫與實驗結果的環境中，診斷訓練瓶頸、實作最佳化、執行實驗，並在維持正確性的前提下交付端到端效能提升。在 Max effort 下，GLM-5.3 以約 75K output tokens 達到 34.5%，高於 GLM-5.2 的 23.4% 與 96K；High effort 則以約 50K output tokens 達到 31.4%，超過 Claude Opus 4.8 的 29.5% 與 120K，但仍落後 Claude Fable 5 的 39.5%。

**資安能力與風險** post-training 納入漏洞發現資料與環境後，GLM-5.3 的資安能力延伸到多階段漏洞利用。它在 CyberGym 得分 84.5%，高於 GLM-5.2 的 77.2%；在 ExploitBench 達 54.4%，是 GLM-5.2 的兩倍以上；ExploitGym 則在兩小時內完成 105 個任務、六小時內完成 130 個，GLM-5.2 分別為 29 與 39 個。Z.ai 與中國數個資安團隊檢視真實程式庫後，模型在 269 個專案中找出 2,436 個漏洞，其中 1,097 個屬中度至高度嚴重性；最早的漏洞可追溯至 1981 年，平均存在 26.6 年才被發現。這項能力也意味著模型部署與安全評估需要更嚴格的人工作業。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/0706783e1f9085ff.jpg)
> GLM-5.3 在 AutomationBench、GDPVal-AA v2 與 CyberGym 取得領先，但在其餘 benchmark 與 GPT-5.6 Sol 等模型各有高低。

**開放與整合** 模型權重預計在發布兩週後、完成安全評估與強化後公開。Ollama 表示將在 open release 後支援 GLM-5.3；Cline 稱其已在 ClinePass 提供，首月促銷價為 4.99 美元，之後每月 9.99 美元，可透過以下指令安裝：

```bash
npm i -g cline
```

OpenCode 則提供 GLM-5.3 的 Go 版本，支援文字輸出與 1M context，價格維持與 GLM-5.2 相同。

**API 遷移** GLM-5.3 僅支援 `low`、`high`、`max` 三種 thinking effort，不再支援停用 thinking。既有應用程式若使用 `thinking.type: "disabled"`，更新 model ID 前必須依序完成：

1. 將 `thinking.type: "disabled"` 改為 `enabled`。
2. 將 `reasoning_effort` 設為 `low`。
3. 將 model ID 更新為 `glm-5.3`。

否則 API request 會失敗。

## 媒體內容

**GLM-5.3 在 AutomationBench、GDPVal-AA v2 與 CyberGym 取得領先，但在其餘 benchmark 與 GPT-5.6 Sol 等模型各有高低。**

**數據表（1）Terminal Bench 3.0**

| 項目 | 數值 |
| --- | --- |
| GLM-5.3 | 28.3 |
| GLM-5.2 | 4.6 |
| Kimi K3 | 17.4 |
| Mythos / Fable 5 | 33.7 |
| GPT-5.6 Sol | 34.6 |

**數據表（2）DeepSWE**

| 項目 | 數值 |
| --- | --- |
| GLM-5.3 | 66.9 |
| GLM-5.2 | 46.2 |
| Kimi K3 | 67.5 |
| Mythos / Fable 5 | 69.7 |
| GPT-5.6 Sol | 72.7 |

**數據表（3）Agents' Last Exam**

| 項目 | 數值 |
| --- | --- |
| GLM-5.3 | 28.5 |
| GLM-5.2 | 23.8 |
| Kimi K3 | 27.6 |
| Mythos / Fable 5 | 23.8 |
| GPT-5.6 Sol | 28.6 |

**數據表（4）AutomationBench**

| 項目 | 數值 |
| --- | --- |
| GLM-5.3 | 48.2 |
| GLM-5.2 | 26.2 |
| Kimi K3 | 46.7 |
| Mythos / Fable 5 | 46.2 |
| GPT-5.6 Sol | 45.8 |

**數據表（5）HLE w/ Tools**

| 項目 | 數值 |
| --- | --- |
| GLM-5.3 | 62.5 |
| GLM-5.2 | 54.7 |
| Kimi K3 | 59.8 |
| Mythos / Fable 5 | 63.9 |
| GPT-5.6 Sol | 64.5 |

**數據表（6）GDPVal-AA v2**

| 項目 | 數值 |
| --- | --- |
| GLM-5.3 | 1769 |
| GLM-5.2 | 1508 |
| Kimi K3 | 1682 |
| Mythos / Fable 5 | 1743 |
| GPT-5.6 Sol | 1730 |

**數據表（7）CyberGym**

| 項目 | 數值 |
| --- | --- |
| GLM-5.3 | 84.5 |
| GLM-5.2 | 77.2 |
| Kimi K3 | 80.0 |
| Mythos / Fable 5 | 83.8 |
| GPT-5.6 Sol | 83.6 |

**數據表（8）ExploitBench**

| 項目 | 數值 |
| --- | --- |
| GLM-5.3 | 54.4 |
| GLM-5.2 | 24.4 |
| Kimi K3 | 32.2 |
| Mythos / Fable 5 | 78.0 |
| GPT-5.6 Sol | 76.5 |

**數據表（9）ExploitGym**

|   | 2-hour budget | 6-hour budget | 2-hour budget | 6-hour budget | 2-hour budget | 6-hour budget | 2-hour budget | 6-hour budget |
| --- | --- | --- | --- | --- | --- | --- | --- | --- |
| GLM-5.3 | 181 | 247 | 181 | 247 | 181 | 247 | 181 | 247 |

**GLM-5.3 在 Terminal-Bench 2.1 以 88.2 分擊敗 Fable 5 與 V4-Pro 0813 取得領先。**

**數據表**

|   | 分數 | 價格 |
| --- | --- | --- |
| GLM-5.3 | 88.2 | $1.40 / $4.40 |
| Fable 5 | 88.0 | $10 / $50 |
| V4-Pro 0813 | 87.9 | $0.435 / $0.87 |
| Opus 4.8 | 85.0 | $5 / $25 |
| GLM-5.2 | 81.0 | $1.40 / $4.40 |

## 標籤

新產品, 功能更新, LLM, Z.ai, GLM-5.3, ZCode
