# Together AI 與研究者 Zain 對比 Kimi K3 Max 與 GPT-5.6 Sol Max 在 DeepSWE 程式開發任務中的表現，指出兩者搭配使用能發揮互補優勢

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Together AI (@togethercompute) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥 · 日期：2026-07-24

> 原始來源：https://x.com/togethercompute/status/2080054904328986999

## 證據與延伸閱讀

- [digg.com/tech/9mrea18z](https://digg.com/tech/9mrea18z)

## 中文摘要

Together AI 與研究者 Zain 對比 Kimi K3 Max 與 GPT-5.6 Sol Max 在 DeepSWE 程式開發任務中的表現，指出兩者搭配使用能發揮互補優勢。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1fcff2ef6bbd6103.png)
> Kimi K3 與 GPT 5.6 Sol 的對比圖，標示前者為開源（Open source）而後者為封閉（Closed）。

**效能與成本對比**
- **效能表現**：在單次嘗試（1 attempt）中，GPT-5.6 Sol Max 以 72.7% 比下 Kimi K3 Max 的 68.5%；但隨著嘗試次數增加，Kimi K3 Max 展現較高的變異數（variability），在 2 次嘗試時以 82.0% 對 81.0% 超前，4 次嘗試時更擴大領先至 89.4% 對 85.8%。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/95d9c73e185e22da.png)
> Sol max 在單次解答（pass@1）的解題率較佳，而 Kimi K3 max 在多輪嘗試（pass@2 與 pass@4）的表現反超 Sol max，於 pass@4 達到 89.4% 的解決率。

- **成本與效率**：Kimi K3 Max 的花費為每次 rollout 4.65 美元，低於 GPT-5.6 Sol Max 的 8.37 美元。每花費 100 美元，Kimi 能解決 14.7 個任務，而 Sol 解決 8.6 個（依圖表數據）。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/f85bccb8bb2a82bc.png)
> Kimi K3 在每次 rollout 成本（$4.65 vs. $8.37）與每 100 美元解題數（14.7 vs. 8.6）具備顯著成本效益，而 Sol 則在每次 rollout 的中位數執行時間（17 分鐘 vs. 66 分鐘）展現近 4 倍的速度優勢。

- **執行時間**：Kimi 的中位數 rollout 時間為 66 分鐘，步驟比 Sol 多出 40%，這屬於模型行為，未來隨著推論提供者支援，端到端延遲有望改善。

**程式語言與任務型態分工**
- **語言偏好**：Kimi K3 在 Rust 語言表現較佳（65 對 60），Go 語言則以 79 對 79 打平；Sol 在 Python（74 對 68）、TypeScript（66 對 60）與 JavaScript（75 對 65）占優勢。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/918a078340ab3241.png)
> 在 DeepSWE 各程式語言測試中，GPT-5.6 Sol max 在 Python、Typescript 與 Javascript 取得領先，Kimi K3 max 在 Rust 領先，雙方在 Go 語言打成平手。

- **領域分工**：Sol 在序列化（92 對 79）、並行處理（72 對 55）與程式分析（64 對 56）等 5 個領域領先；Kimi 則在維運工具（79 對 73）與執行期內部機制（77 對 75）等 3 個領域較強，協定遵循則以 61 對 59 呈現五五波。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/ad96a50c9640689c.png)
> Kimi K3 Max 與 GPT-5.6 Sol Max 在 DeepSWE 各任務領域的 pass@1 表現各有勝負，Kimi K3 Max 在語言與運行時內部機制、構建測試與運維工具、協議與格式合規等領域取得領先，其餘領域則由 GPT-5.6 Sol Max 佔優。

- **失敗模式差異**：兩者成功與失敗的方式不同，相關性僅有 0.46。Sol 在 20% 的失敗案例中會破壞儲存庫原有的測試；Kimi 只有 11% 破壞基礎測試，但有 65% 屬於差一點成功的狀況（超過 80% 的新測試通過，但仍有部分失敗）。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/fd4d660298f79da2.jpg)
> Kimi K3 max 的失敗模式有 65% 為近乎成功且僅 11% 破壞基準線，而 Sol max 則有 20% 破壞基準線。

 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/f0146f1e07314878.jpg)
> GPT-5.6 Sol Max 在 DeepSWE 軟體工程任務上記錄最高 84.5% 的可靠度，而 Kimi K3 Max 則達到最高的 89.4% 涵蓋率。

**模型路由與組合策略**
- **效能加乘**：將兩者結合使用可帶來約 16% 的效能提升，共同涵蓋 113 個任務中的 108 個（達 95.6%），成為基準測試中最佳的雙模型組合。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/e919eb15dad0936d.png)
> Kimi K3 Max 與 GPT-5.6 Sol Max 在 DeepSWE 任務的 pass@4 表現互補性強（相關係數 0.46），兩者組合可達到 95.6% 的高任務覆蓋率。

- **具體路由策略**：建議優先使用 Kimi K3，僅在驗證器拒絕答案時才升級至 Sol。此策略能解決 85.6% 的任務，成本為每個任務 7.30 美元，比單獨使用 Sol（72.3%）提升 13% 覆蓋率，花費反而減少。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/b5de807de95c0876.jpg)
> Kimi-first 級聯策略相較於單獨使用 GPT-5.6 Sol，機能以更低的預期成本（約 $7.3）達成更高的 85.6% 任務解決率。

- **實作建議**：比起耗費心力訓練最佳的路由模型，透過程式語言或任務類型分類等啟發式（heuristic）路由方法就已經足夠好用。

## 媒體內容

**Sol max 在單次解答（pass@1）的解題率較佳，而 Kimi K3 max 在多輪嘗試（pass@2 與 pass@4）的表現反超 Sol max，於 pass@4 達到 89.4% 的解決率。**

**數據表**

|   | pass@1 (official) | pass@2 | pass@4 |
| --- | --- | --- | --- |
| Kimi K3 max | 68.5 | 82.0 | 89.4 |
| Sol max | 72.7 | 81.0 | 85.8 |

**Kimi K3 在每次 rollout 成本（$4.65 vs. $8.37）與每 100 美元解題數（14.7 vs. 8.6）具備顯著成本效益，而 Sol 則在每次 rollout 的中位數執行時間（17 分鐘 vs. 66 分鐘）展現近 4 倍的速度優勢。**

**數據表（1）$ per rollout**

|   |
| --- |
| Kimi K3 · $4.65 |
| Sol · $8.37 |

**數據表（2）solved rollouts per $100**

|   |
| --- |
| Kimi K3 · 14.7 |
| Sol · 8.6 |

**數據表（3）median minutes / rollout**

|   |
| --- |
| Kimi K3 · 66m |
| Sol · 17m |

**在 DeepSWE 各程式語言測試中，GPT-5.6 Sol max 在 Python、Typescript 與 Javascript 取得領先，Kimi K3 max 在 Rust 領先，雙方在 Go 語言打成平手。**

**數據表**

|   | Kimi K3 max | Sol max |
| --- | --- | --- |
| Python | 68 | 74 |
| Go | 79 | 79 |
| Typescript | 60 | 66 |
| Javascript | 65 | 75 |
| Rust | 65 | 60 |

**GPT-5.6 Sol Max 在 DeepSWE 軟體工程任務上記錄最高 84.5% 的可靠度，而 Kimi K3 Max 則達到最高的 89.4% 涵蓋率。**

**數據表**

| 項目 | X | Y |
| --- | --- | --- |
| Sol max | 85.8 | 84.5 |
| Kimi K3 max | 89.4 | 76.6 |

**Kimi K3 Max 與 GPT-5.6 Sol Max 在 DeepSWE 任務的 pass@4 表現互補性強（相關係數 0.46），兩者組合可達到 95.6% 的高任務覆蓋率。**

**數據表**

|   | 任務分佈統計：both |
| --- | --- |
| 標題：Per-task agreement (pass@4): both 90 - Kimi-only 11 - Sol-only 7 - neither 5, corr 0.46 - a real portfolio pair · X軸：Kimi K3 max - trials passed (of 4) · Y軸：GPT-5.6 Sol max - trials passed (of 4) | 90，Kimi-only=11，Sol-only=7，neither=5，相關係數=0.46 |

**Kimi-first 級聯策略相較於單獨使用 GPT-5.6 Sol，機能以更低的預期成本（約 $7.3）達成更高的 85.6% 任務解決率。**

**數據表**

| 項目 | X | Y |
| --- | --- | --- |
| Kimi K3 alone | 4.65 | 68.5% |
| GPT-5.6 Sol alone | 8.37 | 72.3% |
| Kimi > Sol (cascade) | 7.3 | 85.6% |

**Kimi K3 Max 與 GPT-5.6 Sol Max 在 DeepSWE 各任務領域的 pass@1 表現各有勝負，Kimi K3 Max 在語言與運行時內部機制、構建測試與運維工具、協議與格式合規等領域取得領先，其餘領域則由 GPT-5.6 Sol Max 佔優。**

**數據表**

|   | Kimi K3 max | GPT-5.6 Sol max |
| --- | --- | --- |
| Data modeling & serialization | 79 | 92 |
| Concurrency & durability | 55 | 72 |
| Query & config languages | 75 | 80 |
| Program analysis & instrumentation | 56 | 64 |
| Stateful reactivity | 59 | 64 |
| Language & runtime internals | 77 | 75 |
| Build, test & ops tooling | 79 | 73 |
| Protocol & format conformance | 61 | 59 |

**Kimi K3 max 的失敗模式有 65% 為近乎成功且僅 11% 破壞基準線，而 Sol max 則有 20% 破壞基準線。**

**數據表**

|   | near miss (>=80% new tests) | partial | big miss (<20%) | broke baseline | near miss (>=80% new tests) | partial | big miss (<20%) | broke baseline |
| --- | --- | --- | --- | --- | --- | --- | --- | --- |
| Kimi K3 max | 54% | 15% | 11% | 20% | 54% | 15% | 11% | 20% |

## 標籤

Benchmark, LLM, 研究論文, 其他, Together AI, Kimi, OpenAI
