# Composio 測試 DeepSeek V4 Flash：Pi Agent 以 20／30 通過且每項成功成本 0.028 美元

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Composio (@composio) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥 · 日期：2026-08-11

> 原始來源：https://x.com/composio/status/2086814488162972027

## 證據與延伸閱讀

- [Composio 測試 DeepSeek V4 Flash：Pi Agent 以 20／30 通過且每項成功成本 0.028 美元](https://x.com/composio/status/2086814488162972027)
- [各執行框架成本與整體成功率區間](https://x.com/composio/status/2086814494739595392)
- [中位完成時間與對照組速度比較](https://x.com/composio/status/2086814496954147000)
- [排除 Prime Agent 6 次執行與原因](https://x.com/composio/status/2086814499110019513)
- [Composio 主張評測模型與執行框架組合](https://x.com/composio/status/2086814500921979222)
- [Composio 官方 Pi Agent vs Claude Code 評測](https://composio.dev/content/pi-agent-vs-claude-code) — 官方文件 · 支持主張：官方 30-task DeepSeek V4 Flash harness 評測，列出 Pi 20／30、132.2 秒與每次成功 0.028 美元。

## 中文摘要

Composio 測試 DeepSeek V4 Flash：Pi Agent 以 20／30 通過且每項成功成本 0.028 美元。

**測試結果** Composio 在 2026 年 8 月 10 日公布 DeepSeek V4 Flash 於 4 個新增執行框架的測試，Pi Agent 以 20／30 的通過數領先，也是成本最低的選擇；Deep Agents（由 LangChain 開發）通過 16／30，Hermes Agent 通過 15／30，Prime Agent 則在 24 次有效執行中通過 15 次。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/e8042d6d447dcc3e.jpg)
> Pi Agent 在 DeepSeek V4 Flash 搭配的 30 個任務測試中以通過 20 個任務表現最佳，領先其餘 7 個執行框架。

**成本比較** 以目前 API 費率估算，每個成功任務的成本如下：

- Pi Agent：0.028 美元
- Deep Agents：0.045 美元
- Hermes：0.056 美元
- Prime Agent：0.131 美元

Composio 也將這次結果與先前測試的 Codex、Claude Code、OpenCode 和 OMP 合併比較，涵蓋總共 8 個執行框架。整體而言，同一模型的任務成功率落在 47% 至 67%，每個任務成本介於 0.019 至 0.104 美元。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1956b79ff3dfe1c6.jpg)
> Pi Agent 以每項成功任務 $0.028 的成本成為 8 個執行框架中最便宜的選擇

**執行速度** 4 個新增執行框架完成單一任務的中位時間分別為：Pi Agent 132.2 秒、Hermes Agent 175.5 秒、Deep Agents 187.1 秒、Prime Agent 242.1 秒。整體排名中，Claude Code 與 OpenCode 的速度比 Pi Agent 更快；8 個執行框架的中位完成時間範圍則是 122.7 至 272.4 秒。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/a9d7bfb61c25c201.jpg)
> Claude Code 與 OpenCode 在 8 個執行框架搭配 DeepSeek V4 Flash 的每項任務中位數耗時中最快，分別為 122.7s 與 129.7s

**評測限制** Composio 排除了 6 次 Prime Agent 執行結果，因為評測器無法完成評分。其中 2 次是驗證器處理 Prime Agent 的大型工作階段時逾時，另外 4 次沒有留下紀錄。Prime Agent 的工作階段是 8 個執行框架中最繁重的，部分工作階段最多使用 350 萬個 token，並進行 33 次工具呼叫，因此其成本、速度與可評測性都必須放在這項限制下解讀。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/621bfe6fb15309fc.jpg)
> Pi Agent 通過 20／30，為四個新增執行框架中最多；Prime Agent 另有 6 次未評分。

**核心結論** Composio 主張，實際部署時不應只看模型本身的能力，而要評測準備採用的模型與執行框架組合；執行框架的運作方式足以改變成功率、成本與完成時間。

## 媒體內容

**Pi Agent 通過 20／30，為四個新增執行框架中最多；Prime Agent 另有 6 次未評分。**

**數據表（1）Pass rate**

| 項目 | 數值 |
| --- | --- |
| Pi Agent | 66.7% |
| Prime Agent | 62.5% |
| Deep Agents | 53.3% |
| Hermes Agent | 50.0% |

**數據表（2）Median cost per task**

| 項目 | 數值 |
| --- | --- |
| Pi Agent | $0.012 |
| Prime Agent | $0.045 |
| Deep Agents | $0.018 |
| Hermes Agent | $0.017 |

**數據表（3）Median time per task**

| 項目 | 數值 |
| --- | --- |
| Pi Agent | 132s |
| Prime Agent | 242s |
| Deep Agents | 187s |
| Hermes Agent | 176s |

**Pi Agent 在 DeepSeek V4 Flash 搭配的 30 個任務測試中以通過 20 個任務表現最佳，領先其餘 7 個執行框架。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Pi Agent | 20 passed |
| Oh My Pi | 17 passed |
| Claude Code | 16 passed |
| Codex | 16 passed |
| Deep Agents | 16 passed |
| Prime Agent | 15 passed (+6 not graded) |
| Hermes Agent | 15 passed |
| OpenCode | 14 passed |

**Pi Agent 以每項成功任務 $0.028 的成本成為 8 個執行框架中最便宜的選擇**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Pi Agent | $0.028 |
| Deep Agents | $0.045 |
| Hermes Agent | $0.056 |
| OpenCode | $0.073 |
| Codex | $0.081 |
| Oh My Pi | $0.103 |
| Prime Agent | $0.131 |
| Claude Code | $0.195 |

**Claude Code 與 OpenCode 在 8 個執行框架搭配 DeepSeek V4 Flash 的每項任務中位數耗時中最快，分別為 122.7s 與 129.7s**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Claude Code | 122.7s |
| OpenCode | 129.7s |
| Pi Agent | 132.2s |
| Hermes Agent | 175.5s |
| Deep Agents | 187.1s |
| Prime Agent | 242.1s |
| Codex | 245.0s |
| Oh My Pi | 272.4s |

## 標籤

Agent, Benchmark, Hermes Agent, LangChain
