# Prime Intellect 開源 Prime Agent：搭 Opus 5 在 ARC-AGI-3 拿 95.5%，超過人類專家基準 95.4%

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Prime Intellect (@PrimeIntellect) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥🔥🔥 · 日期：2026-08-06

> 原始來源：https://x.com/PrimeIntellect/status/2085086999267144083

## 證據與延伸閱讀

- [Prime Intellect 開源 Prime Agent](https://github.com/PrimeIntellect-ai/prime-agent) — 官方 Repository
- [ARC-AGI-3 上以 Opus 5 取得 95.5%](https://www.primeintellect.ai/blog/prime-agent) — 官方文件

## 中文摘要

Prime Intellect 開源 Prime Agent：搭 Opus 5 在 ARC-AGI-3 拿 95.5%，超過人類專家基準 95.4%。

**產品定位** Prime Intellect 將 Prime Agent 定位為通用程式開發 harness，也適合研究與長時間自主評測（long-horizon autonomous evaluation）。官方表示，它不只針對單一 benchmark 設計，在 ARC-AGI-3 上以 Opus 5 取得 95.5% 成績，超過人類專家基準 95.4%；團隊也稱，Prime Agent 在多項長上下文與長 horizon 任務中，相較模型原本搭配的專有 harness，能讓開放權重與封閉模型的下游表現更好。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/f0b679cfef393775.jpg)
> Prime Agent 搭配 Opus 5 在 ARC-AGI-3 達到 95.5%（179/183 levels），超越圖上標示的人類專家 baseline 95.4%；同圖其餘搭配為 Prime Agent + Sol 的 78.3%、+ Terra 的 25.7% 與 + GLM 5.2 的 8.6%；圖上的對照組為 GPT-5.6 Sol 的 ARC-AGI-3 harness 13.3%、Claude Opus 5 的 ARC-AGI-3 harness 30.2%，以及 GPT-5.6 Sol 走 Responses API 的 38.3%。

Prime Agent 建置於 pi 之上，採完全開源與 MIT License。

**三個核心設計** Prime Agent 將三種機制組合在同一個執行環境中：

- RLM-native programmatic tool calling：模型把 context 視為變數，並在持續運作的 REPL 中以程式碼操作歷史內容、呼叫工具與啟動 sub-agents。
- Persistent multi-agent orchestration：sub-agents 能並行或在背景執行，彼此直接傳送訊息，並保留自己的工作狀態。
- Self-improving Continual Harness：harness 可保存並更新 prompt、記憶、skill 與 sub-agent 規格，讓 Agent 根據實際執行軌跡逐步調整工作方式。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/65f3ce7cca537f2a.jpg)
> 單一 turn 與 Continual Harness 迴圈的架構圖，圖上標示 MODEL、IPYTHON KERNEL、SUB-AGENTS 與 CONTINUAL HARNESS；圖說寫明 Continual Harness 讀取跨 turn 的執行軌跡並寫回 harness 狀態

**RLM 執行模型** Prime Agent 的模型使用持續存在的 IPython kernel，並將它視為唯一的工具介面。檔案操作、Shell 命令、工具呼叫、context 管理與 sub-agent 啟動，都能由模型在 kernel 中以程式碼完成。這讓長 session 不必把所有歷史重新塞回 active context；模型可以把有用資料保存在變數或外部狀態中，把長時間工作變成可以用程式管理的問題。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/c7d02e4b6397ecdc.jpg)
> RLM 架構圖，說明讓 LLM 透過 persistent Python REPL 來檢查與轉換輸入資料，並在該 Python REPL 內呼叫 sub-LLMs 的運作機制。

**多 Agent 與持續工作** `rlm(...)` 能建立真正的子 Agent，每個子 Agent 都擁有自己的模型、IPython kernel、session tree 與對話歷史。Agent 之間可透過 daemon 傳遞訊息，協調平行工作、追蹤進度或處理共用資源；官方說明這類訊息傳遞限於同一個「核心家庭」，也就是父、子與兄弟 session 之間。Prime Agent 也支援 background session、heartbeat、schedule、persistent goal 與 bounded autonomous mode，官方提醒通過的 gate 只驗該 gate 檢查的項目、達到上限並不代表任務成功；即使終端機中斷，工作仍可在背景繼續，之後再重新連線。官方展示的使用情境包括 EmulatorBench、Factorio、MazeBench，以及從零以 Rust 建立 SEGA Genesis 與 Game Boy Color emulator。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/6c76c03592674a21.jpg)
> Prime Agent + GPT-5.6 Sol (xhigh) 在 EmulatorBench 的 GAME BOY COLOR 測試中達到 0.998 分數；圖上另外三種搭配（Codex + GPT-5.6 Sol、Prime Agent + Claude Opus 5、Claude Code + Claude Opus 5）皆為 0.000。官方標示 EmulatorBench 為 preview benchmark，數字是 16 次重建平均的初步結果

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1786004393386-93da7l9t.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/b00e6e5e4e421b8d.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> 執行 Prime-Agent 配合 GLM-5.2 在 MazeBench 上的迷宮導航與測試過程

**Continual Harness 與 skill** harness 狀態會持續寫入磁碟，並在不同 turn 與 session 間保留。`/refine` 會檢視 Agent 過去嘗試及其結果，對 prompt note、記憶、skill 或 sub-agent 規格做最小、有證據支持的修改，而不是重寫整個 harness。基礎 system prompt 維持不可變更，更新也會留下歷史紀錄並支援 rollback。這裡的 skill 是可匯入的 Python package，可由內建 skill creator 將重複性的工作流程整理成專案或個人 skill。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/0a932882d823cb58.jpg)
> Prime Agent 相比各模型專有與原生 harness，在 9 項長上下文與長 horizon benchmark 的多數對照中分數較高，但並非全部：Opus 5 的 OOLONG 為 0.900 對 Claude Code 的 0.920、LongBenchv2 為 0.744 對 0.746，GPT-5.6 Sol 的 OBLIQ-Bench 為 0.612 對 Codex 的 0.646、LongCoT-Mini 為 0.671 對 0.681、ManyIH IF 為 0.216 對 Codex 的 0.232，GLM-5.2 的 LongBenchv2 則是 0.680 對 Pi-Mono 的 0.696。EmulatorBench 的 Opus 5 兩欄（0.047、0.062）帶星號，官方說明 Opus 的 run 未能解出任務。

**評測結果** Prime Intellect 表示，Prime Agent 在 ARC-AGI-3 上以 Opus 5 取得 95.5% 的 RHAE Best@1，三次執行分數為 95.0%、95.2% 與 95.5%；Best@3 為 99.97%，並完成全部 183/183 個 levels。官方也指出，透過程式化函式直接處理資料，能在達到較高分數的同時降低整體 token 使用量。影片畫面另顯示一次執行從 93.39%（164/183 levels）更新至 95.54%（178/183 levels、11,118 actions），並將 Prime Agent 的 95.5% 與 native coding harnesses 的 38.3%、人類基準 95.4% 並列；這些是畫面展示的數據，不是額外的正式評測規格。

**開源與安裝** 原始貼文提供的安裝方式如下；官方文件說明該 installer 會下載已版本化的發行版並驗證其 SHA-256 checksum。（編按）它仍是透過網路下載、直接交由 Shell 執行的指令，建議先確認內容、權限與執行環境再執行：

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1786004307667-4e34l25u.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/bfc4818cbdc89f2a.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> 介紹 Prime Agent 程式碼 harness 的安裝指令與 ARC-AGI-3 基準測試表現

```bash
curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh
```

專案原始碼可見於 [Prime Agent GitHub repository](https://github.com/PrimeIntellect-ai/prime-agent)，發布說明則見 [Prime Intellect 官方部落格](https://www.primeintellect.ai/blog/prime-agent)。文件特別警告，Prime Agent 會以使用者權限執行模型產生的 Python 與專案命令；它的 worker 與 kernel 生命週期隔離、復原機制都不是 security sandbox，所以要用可信任的 repository、指示、skill 與 extension，並在可檢查、可還原的工作副本或外部沙盒中執行不受信任的程式碼。

## 媒體內容

**介紹 Prime Agent 程式碼 harness 的安裝指令與 ARC-AGI-3 基準測試表現**

**影片中的 Prompt 與操作**

Prompt（00:09）：

```
how do you work?
```

Prompt（00:23）：

```
/goal solve ARC-AGI-3
```

操作步驟：

1. （00:04）輸入安裝指令並執行
2. （00:09）輸入問句查詢運作方式
3. （00:23）輸入目標指令求解 ARC-AGI-3

**Prime Agent 搭配 Opus 5 在 ARC-AGI-3 達到 95.5%（179/183 levels），超越圖上標示的人類專家 baseline 95.4%；同圖其餘搭配為 Prime Agent + Sol 的 78.3%、+ Terra 的 25.7% 與 + GLM 5.2 的 8.6%；圖上的對照組為 GPT-5.6 Sol 的 ARC-AGI-3 harness 13.3%、Claude Opus 5 的 ARC-AGI-3 harness 30.2%，以及 GPT-5.6 Sol 走 Responses API 的 38.3%。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| PRIME AGENT + OPUS 5 | 起始 0% · 最佳 95.5% · 結束 95.5% (179/183) |
| PRIME AGENT + SOL | 起始 5% · 最佳 78.3% · 結束 78.3% (164/183) |
| PRIME AGENT + TERRA | 起始 0% · 最佳 25.7% · 結束 25.7% (81/183) |
| PRIME AGENT + GLM 5.2 | 起始 0% · 最佳 8.6% · 結束 8.6% (43/183) |
| GPT-5.6 SOL, RESPONSES API | 起始 0% · 最佳 38.3% · 結束 38.3% |
| GPT-5.6 SOL, ARC-AGI-3 HARNESS | 起始 0% · 最佳 13.3% · 結束 13.3% |
| HUMAN BASELINE | 分數 95.4% |
| CLAUDE OPUS 5, ARC-AGI-3 HARNESS | 分數 30.2% |

**Prime Agent 相比各模型專有與原生 harness，在 9 項長上下文與長 horizon benchmark 的多數對照中分數較高，但並非全部：Opus 5 的 OOLONG 為 0.900 對 Claude Code 的 0.920、LongBenchv2 為 0.744 對 0.746，GPT-5.6 Sol 的 OBLIQ-Bench 為 0.612 對 Codex 的 0.646、LongCoT-Mini 為 0.671 對 0.681、ManyIH IF 為 0.216 對 Codex 的 0.232，GLM-5.2 的 LongBenchv2 則是 0.680 對 Pi-Mono 的 0.696。EmulatorBench 的 Opus 5 兩欄（0.047、0.062）帶星號，官方說明 Opus 的 run 未能解出任務。**

**數據表**

|   | GLM-5.2 (HIGH) PRIME-AGENT | GLM-5.2 (HIGH) PI-MONO | OPUS 5 (HIGH) PRIME-AGENT | OPUS 5 (HIGH) CLAUDE CODE | GPT-5.6 SOL (HIGH) PRIME-AGENT | GPT-5.6 SOL (HIGH) CODEX |
| --- | --- | --- | --- | --- | --- | --- |
| OOLONG (yahoo, 128k) | 0.700 | 0.420 | 0.900 | 0.920 | 0.940 | 0.500 |
| OOLONG-Pairs | 0.874 | 0.556 | 0.929 | 0.922 | 0.911 | 0.895 |
| OBLIQ-Bench (math) | 0.669 | 0.635 | 0.802 | 0.795 | 0.612 | 0.646 |
| LongBenchPro (English) | 0.777 | 0.768 | 0.804 | 0.790 | 0.794 | 0.790 |
| LongBenchv2 | 0.680 | 0.696 | 0.744 | 0.746 | 0.714 | 0.704 |
| ManyIH Coding | 0.424 | 0.386 | 0.536 | 0.522 | 0.499 | 0.454 |
| ManyIH IF | 0.209 | 0.164 | 0.225 | 0.175 | 0.216 | 0.232 |
| LongCoT-Mini | 0.638 | 0.613 | 0.722 | 0.558 | 0.671 | 0.681 |
| EmulatorBench | 0.208 | 0.000 | 0.047* | 0.062* | 0.275 | 0.228 |

**Prime Agent + GPT-5.6 Sol (xhigh) 在 EmulatorBench 的 GAME BOY COLOR 測試中達到 0.998 分數；圖上另外三種搭配（Codex + GPT-5.6 Sol、Prime Agent + Claude Opus 5、Claude Code + Claude Opus 5）皆為 0.000。官方標示 EmulatorBench 為 preview benchmark，數字是 16 次重建平均的初步結果**

**數據表**

|   | 起始 | 最佳 | 結束 |
| --- | --- | --- | --- |
| Prime Agent + GPT-5.6 Sol (xhigh) | 0.000 | 0.998 | 0.998 |
| Codex + GPT-5.6 Sol (xhigh) | 0.000 | 0.000 | 0.000 |
| Prime Agent + Claude Opus 5 (xhigh) | 0.000 | 0.000 | 0.000 |
| Claude Code + Claude Opus 5 (xhigh) | 0.000 | 0.000 | 0.000 |

**執行 Prime-Agent 配合 GLM-5.2 在 MazeBench 上的迷宮導航與測試過程**

**影片中的 Prompt 與操作**

操作步驟：

1. （00:00）啟動 MazeBench 測試並以 3D 視覺化呈現迷宮場景與 Agent 移動過程

## 標籤

Agent, 開源專案, 新產品, Prime Intellect, Prime Agent
