# DevvMandal 推出 AutoCAD-Bench 評估 AI 任務

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Dev (@DevvMandal) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥 · 日期：2026-07-24

> 原始來源：https://x.com/devvmandal/status/2080325376463736986

## 證據與延伸閱讀

- [DevvMandal 推出 AutoCAD-Bench](https://www.markovstudios.com/research/autocad-bench)
- [GPT-5.6 Sol 取得 46.0% 領先](https://x.com/devvmandal/status/2080325376463736986)

## 中文摘要

DevvMandal 推出 AutoCAD-Bench 評估 AI 任務。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/71086216a1dc26a1.jpg)
> GPT-5.6 Sol 在 AutoCAD-Bench 基準測試中以 46.0% 的分數取得領先地位。

DevvMandal (Dev) 在社群發布了 AutoCAD-Bench，這是一項專門用來測試多模態 Agent 能否將帶有尺寸的參考圖紙轉化為正確且可編輯 DWG 檔案的基準測試。GPT-5.6 Sol 在此測試中表現主導，拿下 46% 的完成率，並能一次性解決許多基礎與中階任務。詳細的報告內容與測評結果已於 Markov Studios 網站上公開。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/7b1cb82c9320324c.png)
> AutoCAD Bench 評測展示了一個包含 2D 工程圖、3D 螺絲零件及其螺紋與花紋放大細節的設計藍圖。

**基準測試設計與任務架構**
AutoCAD-Bench 包含固定 50 個任務，涵蓋 2D 製圖與 3D 重建，並分為四個難度級別。
- 涵蓋 21 個 2D 與 3D 任務，包含 2D 基礎的尺寸輪廓、2D 專案的機械連桿、3D 基礎的圓角支架，以及 3D 專案的螺紋與滾花零件。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/8313c45b7819c1a6.png)
> 標註各項幾何尺寸與角度的 2D 零件工程圖，包含水平與垂直長度標示及斜邊角度。

- 2D 預期輸出包含具有正確幾何形狀、尺寸、引線、註解、中心記號與中心線的完整 Model Space 圖面。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/65f9032a23945742.png)
> 附有詳細尺寸標註與幾何數據的機械零件工程藍圖，主要標示了全長 100 毫米並包含圓孔、倒角及多處半徑圓角（如 R1、R2、R6 等）的金屬夾具結構。

- 3D 預期輸出包含真實的 3D Model Space 幾何形狀，以及帶有所有正投影、等角視圖、剖面圖、細部檢視與註解的完整 Layout1 圖紙。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/076c0a431e1a10cf.png)
> 呈現帶有尺寸標註的機械零件 3D 立體視圖與多視角正投影工程圖。

**執行環境與評分機制**
該基準測試透過特定的 harness 與沙盒環境來運行，確保測試結果的客觀性與一致性。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/b444b899dfd7758d.png)
> 帶有滾花頭部與螺紋尺寸標註的機械零件工程藍圖與 3D 立體視圖。

- 軟體環境：執行於 Windows 上的 AutoCAD 2019，手邊準備好一個乾淨的 `attempt.dwg`。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/3134dae9ea503f3d.webp)
> 標註了各項幾何尺寸與圓角半徑的電腦滑鼠外型 2D 工程設計圖。

- 顯示與隔離：解析度設為 1920 × 1080、英文地區設定，並具備固定的版本化 workspace；同時不提供 shell、檔案系統 API、AutoLISP、自動化 API、MCP、外部檔案或桌面網路存取。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/7bebb770bfa4d6d4.webp)
> Autodesk AutoCAD 2019 軟體的空白繪圖介面，正中央呈現十字游標，上方則為功能區與工具列。

- 評分方式：僅憑最終的 `attempt.dwg` 檔案判定正確性，由受信任的 AutoCAD 評估工具開啟並萃取實體、幾何、尺寸、註解、範圍、3D、配置與視埠證據，並產出標準化彩現圖；當評估工具分數達到至少 75 分時，該任務即算完成。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/c809acef4b9a5caa.png)
> 電腦滑鼠的外型設計2D工程圖，標示了各部位的半徑、長度與定位尺寸。

**主要發現與未來展望**
測試結果揭露了目前 AI 模型在 CAD 應用上的行為特徵與限制。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/0cc007f09ba62623.png)
> 展示帶有詳細尺寸標註與中心參考線的滑鼠外型 2D 設計工程圖，重疊顯示了紅色與藍色的外框輪廓。

- 終端機介面與互動行為：模型主要透過輸入的指令與鍵盤輸入來驅動 AutoCAD，滑鼠使用率極低，且許多點擊僅用於恢復命令列焦點。
- 評估限制：目前的評估機制僅針對最終儲存的輸出評分，不會對中途的操作軌跡或建構歷史進行評分，導致視覺上逼真的圖紙可能會隱藏語意上不同的 CAD 幾何形狀。
- 效能表現：Anthropic 的模型（如 Fable）常能恢復大體形狀，但會錯失精確幾何、尺寸、中心線與佈局細節；Opus 的表現更差，僅有兩個任務分數超過 50 且沒有任何任務達到 75 分。
- 未來規劃：計畫結合視覺評分與實體語意、幾何限制、可編輯性及操作軌跡檢查，並擴充任務集以涵蓋更廣泛的實際 AutoCAD 工作。

相關研究報告與詳細資訊可參閱 [AutoCAD-Bench 完整報告](https://www.markovstudios.com/research/autocad-bench)。若想進一步交流 computer-use 資料與環境，可透過 [Dev 的預約連結](https://cal.com/dev-markov/30min)安排會議。

## 媒體內容

**GPT-5.6 Sol 在 AutoCAD-Bench 基準測試中以 46.0% 的分數取得領先地位。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Sol | 46.0% |
| Terra | 14.0% |
| Fable 5 | 10.0% |
| Luna | 8.0% |
| Opus 4.8 | 0.0% |
| Kimi K2.5 | 0.0% |
| Qwen3.7 | 0.0% |

## 標籤

Benchmark, Agent, 新產品, OpenAI
