# GPT-5.6 Sol 玩《Slay the Spire》卡在策略規劃，記憶設定讓 ARC-AGI-3 效率由 13.3%升至 38.3%

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Epoch AI (@EpochAIResearch) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥 · 日期：2026-08-28

> 原始來源：https://x.com/epochairesearch/status/2093079297724735906

## 證據與延伸閱讀

- [GPT-5.6 Sol 玩《Slay the Spire》卡在策略規劃，記憶設定讓 ARC-AGI-3 效率由 13.3%升至 38.3%。](https://x.com/EpochAIResearch) — 最後核對：2026-08-28 · 支持主張：延伸脈絡把結果定位成 long-horizon planning case study：遊戲同時要求戰鬥決策、牌組建構、路線選擇與資源管理；OpenAI 的 harness 分析也提醒 memory、context 與 observation 設計會改變結果。
- [OpenAI ARC-AGI-3 harness memory settings — openai.com](https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores) — 官方文件 · 最後核對：2026-08-28 · 支持主張：文章同時報告 output tokens 約降六倍、平均人類測試者估計 48%，並明確把 Epoch AI 的 Slay the Spire streams 當作例子；但它的貢獻是 harness/memory 方法論，並非對 Epoch 精確 tactics/strategy 結論的獨立驗證。
- [Epoch AI 分享 GPT-5.6 Sol 實驗](https://x.com/epochairesearch/status/2093079297724735906)
- [各角色進階 A9、A7、A6、A4](https://pbs.twimg.com/media/HQwch2WbAAA3O5s.jpg?name=orig)

## 中文摘要

GPT-5.6 Sol 玩《Slay the Spire》卡在策略規劃，記憶設定讓 ARC-AGI-3 效率由 13.3%升至 38.3%。

**非正式遊戲實驗**　Epoch AI 於 2026 年 8 月 27 日分享 GPT-5.6 Sol 的《Slay the Spire》實驗。團隊讓模型以串流方式遊玩，並逐步提高 Ascension levels；Epoch 的觀察是，模型表現高於新手人類、但低於專家。其判斷是，Sol 並非主要卡在點擊或讀取螢幕，而是戰鬥中的 tactics 與整體 strategy。這項結論來自非正式的質化觀察，不是標準化 leaderboard benchmark，也沒有提供每次 run 的可重現分數表。[Epoch AI 原始貼文](https://x.com/epochairesearch/status/2093079297724735906)

**長期規劃脈絡**　《Slay the Spire》同時要求玩家做出戰鬥決策、建構牌組、選擇路線並管理資源，因此即使 Computer Use 運作正常，模型仍可能在跨多個回合的策略規劃上失誤。Epoch 的結果適合作為 long-horizon planning case study，但不能直接當成新的 agent 能力分數。實驗解讀也受 prompt、記憶策略、遊戲 seed、專家比較方式與 observation 設計影響，公開串流並未控制所有變因。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/3c811eb3e45f188a.jpg)
> GPT-5.6 Sol 在《殺戮尖塔》的 Extra High Thinking 設定下，Ironclad 角色達到最高進階 A9，Silent 為 A7、Defect 為 A6，Watcher 為 A4。

**harness 與記憶設定**　OpenAI 於 2026 年 7 月 29 日發布的 ARC-AGI-3 分析，重點不是獨立驗證 Epoch 對 tactics 或 strategy 的診斷，而是說明 harness 設定如何改變結果。原本的設定會在每次 action 後丟棄 private reasoning，並以 rolling history truncation 截斷歷史，導致 GPT-5.6 Sol 反覆從頭推理、遺失先前的 observation 與 action。改用 Responses API 的 `previous response ID` 保留跨 action reasoning，再以 compaction 取代滾動截斷後，Relative Human Action Efficiency 從 13.3% 升至 38.3%，output tokens 約降至原本六分之一；OpenAI 估計平均人類測試者為 48%。[OpenAI 分析](https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores)

**評估方式**　比較遊戲 agent 時，應固定並公開 推理保留方式、歷史截斷、脈絡壓縮、觀察資料、提示詞與測試框架/API 設定，再同時報告模型結果、分數與 token 成本。整體而言，Epoch 提供的是「高於新手、低於專家」的相對且非正式觀察；OpenAI 的數據則顯示，記憶與歷史脈絡的保留可能讓結果大幅變動，不能把兩者合併解讀為 GPT-5.6 Sol 已被標準化證明具有特定的策略能力。

## 標籤

GPT, Agent, 研究論文, OpenAI, Epoch AI
