# Pokee AI 發布 Pokee-Isaac 28B：單張 GPU 處理 1,000 萬 token 長上下文

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Pokee AI (@Pokee_AI) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥 · 日期：2026-08-06

> 原始來源：https://x.com/pokee_ai/status/2084682445648216383

## 證據與延伸閱讀

- [Pokee-Isaac 28B 單張GPU處理1000萬token](https://console.pokee.ai/model) — 官方文件
- [non-decoder-only架構與部分Qwen權重](https://x.com/Pokee_AI/status/2084728821048315961)
- [外部質疑Specimba評論](https://x.com/specimba/status/2084726591201091663)

## 中文摘要

Pokee AI 發布 Pokee-Isaac 28B：單張 GPU 處理 1,000 萬 token 長上下文。

它主打在資料不離開組織邊界的前提下，處理長期、多步驟的推理、規劃與工具操作。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/d7309cb5bb73be4e.jpg)
> Pokee-Isaac 28B 在 10M token 長上下文下維持 93.3% RULER 準確率，在 τ³-bench 與 DTAP ASR 領先，BFCL v4 與 GPT-5.6 Luna 持平，Terminal-Bench 與 MCP-Atlas 落後。

**核心規格** Pokee-Isaac 28B 採用 Pokee AI 自有的 non-decoder-only architecture，不是傳統的 Qwen fine-tune。Pokee AI 說明，部分 weights 以採用 Apache 2.0 授權的 Qwen3.6-27B 微調而來，但其餘 weights 是由團隊從頭訓練，因此不能直接視為一般的 Qwen 衍生模型。官方公布的主要結果包括：

- 在 1,000 萬 token context 下，RULER 得分 93.3%。
- 在單張 NVIDIA B200 上，1,000 萬 token context 的 prefill 最高達每秒 137K token。
- 在 BFCL v4 與 τ³-bench 的官方評估中領先。
- 在 DTAP security red-teaming benchmark 的受測模型中，綜合 attack success rate 最低。
- 模型規模為 28B parameters，官方稱其明顯小於比較組中的其他模型。

**長 context 表現** Pokee AI 的技術資料將 RULER 與 MRCR v2 分開使用：前者觀察模型能否在 context 變長時維持檢索能力，後者則測試模型能否從多個分散的「needle」中辨識指定目標，避免不同資訊彼此干擾。官方報告稱，Pokee-Isaac 28B 在測試的各個 context 長度都維持 93.3% 以上的 RULER 準確率，也是比較組中唯一在每個長度都產生有效分數的模型；在 MRCR v2 的 8-needle 測試中，它於 512K token 達到 0.743，1M token 仍有 0.500。

這些結果是 Pokee AI 在統一環境中，讓 Isaac 與五個 baseline 透過 hosted API 進行的測試（比較組刻意排除 GPT-5.6 Sol、Claude Opus 5、Gemini 3.1 Pro 等旗艦模型，理由是每 token 成本高約一個量級、且僅雲端託管），並把 context overflow、重試耗盡、基礎設施或驗證失敗視為零分。技術報告也提醒，benchmark 結果會受到 harness、prompt template、sampling parameters、turn limit 與任務子集影響，因此不能直接拿未公開測試條件的第三方數字比較。

**Agent 能力** Pokee AI 以四個 benchmark 檢驗不同類型的工具使用與長期執行能力：

- BFCL v4：測試函式呼叫、參數填寫、拒絕不存在的函式，以及多輪狀態操作。Pokee-Isaac 28B 得分 70.94，GPT-5.6 Luna 為 70.61；官方也承認 0.33 分差距應解讀為接近持平，而非明確領先。
- τ³-bench：模擬零售、航空、電信與銀行客服，要求 Agent 根據逐步揭露的需求與政策，多輪完成交易或拒絕不允許的操作。Pokee AI 宣稱 Isaac 在整體評估中領先，但四個領域中銀行是全場弱項（Isaac 0.186、最佳 0.203）。
- Terminal-Bench 2.1：透過真實 shell 執行工作並以任務測試套件驗證；在四項 agentic benchmark 中 Isaac 領先兩項，此項居次（65.1）、少完成四項任務，由 GPT-5.6 Luna（69.8）勝出。
- MCP-Atlas：在 36 個 live MCP server 上發現並組合工具，過程不告知 server 與 tool 名稱。Isaac 的 claim coverage 為 74.59，落後 Gemini 3.5 Flash Lite（76.67）約 2.1 個百分點，也低於 GPT-5.6 Luna（77.90），在此項排第三；不過其 trajectory length 約只有 Gemini 的 60%。

**安全與部署** DTAP 將 Agent 放進模擬環境，測量直接來自使用者 prompt、以及間接藏在工具輸出或環境中的攻擊是否成功。Pokee AI 稱 Isaac 在六個受測系統中兩種 attack axis 的成功率都最低；不過報告也揭露限制：間接攻擊數字是在 guards inactive 的條件下測得，且只有 1.5% 的惡意任務觸發明確拒絕，多數防禦效果屬於附帶產物，而非主動拒答。放到更廣泛的 16 個系統公開排行榜時，Isaac 在 Direct ASR 排名第 5、Indirect ASR 第 6、capability 第 9，屬於中段結果。

部署方面，Pokee AI 主打資料留在使用者控制的邊界內，可執行於 VPC、on-premises 或 on-device。官方列出的硬體範圍包括 NVIDIA B200、RTX 4090、RTX 5090、Intel Arc Pro B70，以及 Qualcomm 與 Intel Panther Lake 的 NPU；AMD 支援仍在進行中。模型目前是 text-only，不支援 image、audio 或 video input，並可透過 OpenAI-compatible chat-completions client 呼叫，提供 vLLM 與 SGLang 的 Day-0 支援，也支援 SSE streaming 與斷線後仍可持續的 background mode。

**價格與試用** 公開 API 價格為每 100 萬 input token $0.15、每 100 萬 output token $1；官方表示這低於比較組中能以相近 context 長度購買的模型，但價格仍屬 provisional，上市時可能確認或調整。自建部署則把按 token 計費改為硬體配置所決定的固定成本。開發者可從 [Pokee-Isaac 28B 模型頁面](https://console.pokee.ai/model) 查看技術資料，透過 [Pokee API](https://console.pokee.ai) 試用，也能填寫 [開發者表單](http://pokee.ai/developers) 申請 2,000 API credits；Pokee AI 在貼文回覆中多次以此方式邀請使用者測試。

**外部質疑** 回覆者 @specimba 認為，10M-token context 更像極端 context engineering 的研究展示，而不是已證明的產品突破。他指出，若實際服務仍需要 B200 等級硬體，且首次 token 延遲約 173 秒（此數字與官方技術頁量得的 72.9 秒有出入），商業價值仍待驗證；在沒有 open weights 或以基礎 Qwen 27B 重新 fine-tune 的情況下，也難以判斷成果究竟來自模型本身，還是 harness 與評測設計。這項質疑與 Pokee AI 的產品定位形成對照：前者要求實際部署與可重現性證據，後者則強調單張消費級 GPU、邊界內運算與長 context 能力。

## 媒體內容

**Pokee-Isaac 28B 在 10M token 長上下文下維持 93.3% RULER 準確率，在 τ³-bench 與 DTAP ASR 領先，BFCL v4 與 GPT-5.6 Luna 持平，Terminal-Bench 與 MCP-Atlas 落後。**

**數據表**

|   | Pokee-Isaac 28B (V0) | GPT-5.6-luna | Gemini 3.5 Flash Lite | Claude Haiku 4.5 | Nemotron-3-Super-120B | Qwen3.5-122B |
| --- | --- | --- | --- | --- | --- | --- |
| RULER 256K/512K/1M | 96.9 / 96.7 / 95.0 | 95.0 / 91.4 / 0.0* | 94.5 / 94.6 / 29.4* | 0.0 / 0.0 / 0.0 | 96.30 / 95.67 / 91.75^S | 0.0 / 0.0 / 0.0 |
| RULER 2M/4M/10M | 95.8 / 96.7 / 93.3 | 0.0 / 0.0 / 0.0 | 0.0 / 0.0 / 0.0 | 0.0 / 0.0 / 0.0 | 0.0 / 0.0 / 0.0 | 0.0 / 0.0 / 0.0 |
| MRCR v2 256K/512K/1M | 0.607 / 0.743 / 0.500 | 0.208 / 0.173 / 0.050 | 0.474 / 0.473 / 0.205 | 0.000 / 0.000 / 0.000 | 0.145 / 0.161 / 0.067 | 0.000 / 0.000 / 0.000 |
| BFCL v4 overall | 70.94 | 70.61 | 64.85 | 67.52 | 33.13 | 64.88 |
| τ³ 4-domain avg | 0.662 | 0.527 | 0.631 | 0.408 | 0.426 | 0.611 |
| Terminal-Bench 2.1 | 65.1 | 69.8 | 46.5 | 34.9 | 24.4 | 46.5 |
| MCP-Atlas | 74.59 | 77.90 | 76.67 | 56.45 | 48.95 | 70.24 |
| DTAP ASR ↓ Attack success rate | 35.6 | 50.1 | 66.3 | 37.9 | 60.4 | 54.0 |
| DTAP BSR ↑ Benign success rate | 82.5 | 85.1 | 83.3 | 71.3 | 63.3 | 79.4 |

## 標籤

新產品, LLM, Pokee-Isaac 28B, Pokee AI
