# Kimi K3 如何稱霸設計排行榜

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：Design Arena (@DesignArena) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥 · 日期：2026-07-24

> 原始來源：https://x.com/designarena/status/2080359813947773334

## 證據與延伸閱讀

- [Kimi K3 以 1408 Elo 排名第一](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/e141e31d273f70a4.jpg)
- [Kimi K3 使用大量思考 token](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/01932e70b4625578.jpg)
- [多階段思考軌跡如 Agentic 開發](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/6455b055fd1496d2.jpg)
- [推理過程編寫的程式碼數量為 10 倍以上](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/2396e25344edf1f7.jpg)

## 中文摘要

# Kimi K3 如何稱霸設計排行榜

![Kimi K3 在 DesignArena 的 Overall Frontend (Non-Agentic) Elo 評分榜單中以 1408 分位居第一，領先 GPT-5.6 Sol 與 GLM 5.2 等模型。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/e141e31d273f70a4.jpg)

<details class="chart-data"><summary>展開數據表</summary><table><thead><tr><th>項目</th><th>數值</th></tr></thead><tbody><tr><td>Kimi K3</td><td class="rank-bar num bar-w-100"><span class="bar-val">1408</span></td></tr><tr><td>GPT-5.6 Sol</td><td class="rank-bar num bar-w-100"><span class="bar-val">1357</span></td></tr><tr><td>GLM 5.2</td><td class="rank-bar num bar-w-100"><span class="bar-val">1341</span></td></tr><tr><td>Claude Fable 5</td><td class="rank-bar num bar-w-100"><span class="bar-val">1339</span></td></tr><tr><td>Claude Opus 4.6</td><td class="rank-bar num bar-w-90"><span class="bar-val">1327</span></td></tr><tr><td>Gemini 3.6 Flash</td><td class="rank-bar num bar-w-90"><span class="bar-val">1324</span></td></tr><tr><td>Claude Opus 4.6 (Thinking)</td><td class="rank-bar num bar-w-90"><span class="bar-val">1322</span></td></tr><tr><td>Grok 4.5</td><td class="rank-bar num bar-w-90"><span class="bar-val">1322</span></td></tr><tr><td>Claude Opus 4.7</td><td class="rank-bar num bar-w-90"><span class="bar-val">1321</span></td></tr><tr><td>GLM 5.1</td><td class="rank-bar num bar-w-90"><span class="bar-val">1311</span></td></tr><tr><td>Kimi K2.6</td><td class="rank-bar num bar-w-90"><span class="bar-val">1311</span></td></tr><tr><td>Claude Sonnet 4.6</td><td class="rank-bar num bar-w-90"><span class="bar-val">1309</span></td></tr><tr><td>Muse Spark 1.1</td><td class="rank-bar num bar-w-90"><span class="bar-val">1303</span></td></tr><tr><td>MiMo-V2.5-Pro</td><td class="rank-bar num bar-w-90"><span class="bar-val">1303</span></td></tr><tr><td>GLM 5 Turbo</td><td class="rank-bar num bar-w-90"><span class="bar-val">1302</span></td></tr><tr><td>Qwen3.7 Max</td><td class="rank-bar num bar-w-90"><span class="bar-val">1299</span></td></tr><tr><td>Kimi K2.7 Code</td><td class="rank-bar num bar-w-90"><span class="bar-val">1291</span></td></tr><tr><td>Qwen3.7 Plus</td><td class="rank-bar num bar-w-90"><span class="bar-val">1291</span></td></tr><tr><td>Gemini 3.5 Flash</td><td class="rank-bar num bar-w-90"><span class="bar-val">1290</span></td></tr><tr><td>MiniMax M3</td><td class="rank-bar num bar-w-90"><span class="bar-val">1287</span></td></tr></tbody></table></details>

Kimi K3 是 Moonshot AI 最新的開源權重模型，在我們的單次呼叫（single-shot）Frontend Arena 中以 1408 的 Elo 分數排名第一。這比 Kimi K2.6 高出 10 個名次，比 Kimi K2.7 Code 高出 16 個名次，創下了 Moonshot 模型系列中見過的最大躍升。

然而，我們發現 Kimi K3 使用了大量的思考 token，幾乎是 Kimi K2.7 Code 的 4 倍。

![Kimi K3 在每個 Trace 使用的平均推理 Token 數量約為 12.2k，約為 Kimi K2.7 Code 的 4 倍。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/01932e70b4625578.jpg)

<details class="chart-data"><summary>展開數據表</summary><table><thead><tr><th>項目</th><th>數值</th></tr></thead><tbody><tr><td>Kimi K3</td><td>約 12.2k</td></tr><tr><td>Kimi K2.6</td><td>約 5.8k</td></tr><tr><td>Kimi K2.7 Code</td><td>約 3.2k</td></tr></tbody></table></details>

對於我們作為基準測試的簡單前端 HTML 任務來說，這包含相當大量的推理，因此我們決定深入探討，找出 Kimi K3 到底在思考什麼。

我們發現，Kimi K3 的優異表現主要歸功於其獨特的思維鏈（chain-of-thought）方法，它在思維鏈中反覆迭代設計，過程非常類似完整的 Agent，但這一切都發生在它的思考過程中。這種策略產生了精細、刻意打造的網站，具備富有創意的元件設計，同時也提升了 Kimi K3 整合外部相依性的能力。

# Kimi K3 在思維鏈中模擬一個 Agent

只要稍微瀏覽一下 Kimi K3 的思考軌跡，就能夠解釋它的效能表現。Kimi K3 擁有獨特的多階段思考軌跡，它會從規劃切換到決策，再到設計最終網站的各個獨立部分。這正是 Agentic 程式開發的工作流程，而且這是我們從 Kimi 系列中從未見過的模式。

![這是一張展示 Kimi K3 思考軌跡與代理功能（Agent）的流程範例圖片，劃分為 11 個步驟的設計與開發階段。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/6455b055fd1496d2.jpg)

<details class="chart-data"><summary>展開畫面重點</summary><div class="me-note">畫面最上方標題為「Sample Kimi K3 Thinking Trace - Acts like an Agent」，下方以網格狀排列了 11 個編號步驟，每個區塊都配有背景顏色與底層的程式碼或文字說明。各步驟內容如下：
01) Plan
02) Choose Images
03) Decide Page Sections
04) Create Sample Data
05) Decide on SPA with animation
07) Animation Design
08) CSS Design
09) Header Design
10) Checkout Design
11) Micro-interaction Design
（註：畫面中未依序顯示第 6 步，直接由 05 跳至 07）</div></details>

將此與 Kimi 模型系列中先前的模型進行比較，它們的推理軌跡短得多，而且極少編寫程式碼。這些模型在直接跳進最終輸出之前，通常只決定高層級的細節或區段。

![本圖對比了 Kimi K2.6 與 Kimi K2.7 Code 在規劃與程式碼產出上的差異，強調後者能直接決定技術堆疊與區塊並輸出程式碼。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/001d62d1778e91e4.jpg)

<details class="chart-data"><summary>展開畫面重點</summary><div class="me-note">畫面左側分為四個區塊，各包含一行行文字，右側則對應四行說明文字：
1. 第一段（最上方紅底區塊）：對應右側「Only Plans」，文字為英文長段落，內容探討古董網站的需求、版面配置、互動性、視覺設計、響應式設計等規劃考量。標題上方標示「Kimi K2.6」。
2. 第二段（第二個紅底區塊）：對應右側「Plans」，文字同樣為英文規劃內容，涵蓋電子商務風格網站、舊物與收藏品、HTML/CSS/JS 等。標題上方標示「Kimi K2.7 Code」。
3. 第三段（藍底區塊）：對應右側「Decides Tech Stack」，文字描述技術實作細節，例如使用 Tailwind CSS、CSS Grid、Flexbox 以及字型選擇等。
4. 第四段（綠底區塊）：對應右側「Decides Sections / No Code Written!」，文字列出具體的網頁區塊（如導覽列、英雄區塊、分類區塊、產品網格、關於我們、產品詳情、購物車、結帳等）以及 JavaScript 陣列與篩選功能，並提及最終產生包含所有必要樣式與腳本的完整 HTML 檔案。</div></details>

如果我們將所有 Kimi 模型超過 3,000 次的生成結果進行彙整，會發現 Kimi K3 在推理過程中編寫的程式碼數量，是其模型系列中任何其他模型的 10 倍以上，其花在編寫程式碼的推理 token 甚至比實際進行推理的還要多。

![Kimi K3 在推理過程中的平均程式碼區塊數量達到 33 個以上，相比 Kimi K2.6 與 Kimi K2.7 Code 提升超過 10 倍，同時平均推理 Token 數亦顯著增加。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/2396e25344edf1f7.jpg)

<details class="chart-data"><summary>展開數據表</summary><table><thead><tr><th></th><th>Avg Code Blocks</th><th>Avg Reasoning Tokens</th></tr></thead><tbody><tr><td>kimi-k2.6</td><td class="rank-bar num bar-w-10"><span class="bar-val">3</span></td><td class="rank-bar num bar-w-40"><span class="bar-val">5.3k</span></td></tr><tr><td>kimi-k2.7-code</td><td class="rank-bar num bar-w-10"><span class="bar-val">3.7</span></td><td class="rank-bar num bar-w-30"><span class="bar-val">4.1k</span></td></tr><tr><td>kimi-k3</td><td class="rank-bar num bar-w-100"><span class="bar-val">33.3</span></td><td class="rank-bar num bar-w-100"><span class="bar-val">13.3k</span></td></tr></tbody></table></details>

Kimi 系列中沒有其他模型在推理過程中具備這種密度的程式碼區塊，這是因為 Kimi K3 會在推理過程中對個別元件進行迭代，進行「心智測試」（mental testing），而不是使用它在 Agent 迴圈中通常會有的正常測試。這也暗示了 Kimi K3 實際上是在用程式碼思考，以程式碼和具體限制的形式表達其規劃的規格，而不是憑感覺產生一個不精確的計畫。

![Kimi K3 模型在思考過程中透過「在心中測試」（Testing Mentally）對設計進行疊代修正的示意圖。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/e395973485462ef3.jpg)

<details class="chart-data"><summary>展開畫面重點</summary><div class="me-note">圖片頂端文字：「Kimi K3 iterates on designs during thinking, “Testing Mentally” as it works」。
中間呈現三個版本（v1、v2、v3）的藍色與黑色雲朵設計，透過箭頭連接表示疊代過程：
- v1：藍色雲朵圖形
- v2：黑色雲朵圖形
- v3：藍色雲朵圖形
下方為黑色程式碼與文字框，左側包含一段包含座標與數值的字串「`M25 48 h22 a9 9 0 0 0 1.6-17.8 A13 13 0 0 0 23.6 25 10 10 0 0 25 48 z`」，右側經紅色圈選框標註的文字為：「`I'll just test mentally ...`」。</div></details>

透過在其推理軌跡中選擇這種策略，Kimi K3 刻意產生了需要更多 token 但表現更好的結果，本質上是用 token 來換取智慧。這導致生成的過程明顯變慢，但偏好分數更高。

![在 Elo 評分與生成時間（Generation Time）的關係圖中比較 Kimi K3、GPT-5.6 Sol、Grok 4、GPT-5.6 Terra、GPT-5.6 Luna、Gemini 2.5 Flash Lite Preview 09-2025、Gemini 3.1 Flash-Lite Preview 及 Mercury 2 等模型。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/5973701176c42728.jpg)

# Kimi K3 的思考將 Unsplash 圖片武器化

然而，Kimi K3 有一個祕密武器：對其訓練資料進行了強大的索引。通常，推理的威力遠不如完整的 Agent 軌跡，因為 Agent 無法使用網頁搜尋等工具來更新其內部思考。不過，Kimi K3 擁有極度緊密的「提出-重新評估」（propose-reconsider）迴圈，它會提出一項資訊，然後繼續推理該資訊是否符合其意圖。這充分利用了模型已學習到的網際網路索引。以下是 Kimi K3 將此技術應用於 Unsplash 的範例，Unsplash 是一個免費圖片提供者，模型經常使用它來尋找主視覺和其他填充圖片。上方是思維鏈推理，下方則是模型在產生 ID 時所思考的 Unsplash CDN 圖片。

Kimi K3 會思考它想要什麼圖片，一次性生出該圖片的 Unsplash ID，然後思考該 Unsplash ID 是否真的有效，以確認是否要使用它。以下是其思考軌跡的真實視覺化呈現。

這意味著 Kimi K3 非常擅長為其網站尋找圖片。以下是上述思維鏈所產生的網站。沒有任何一張圖片遺漏，且都與內容息息相關。

其他模型（如 Fable 5）不像 Kimi K3 那樣充分利用其學習到的索引，也沒有對它們產生的圖片進行那麼多的推理。以下是 Kimi K3 與其他模型的生成範例對照，其中 Kimi K3 沒有漏掉任何一個圖片裝飾，而 Claude Fable 5 和 Kimi K2.7 Code 則必須改為依賴替代文字（alt text）和預設值。

![比較兩個不同網頁介面設計的視覺畫面，左側標示為「Kimi K3」，右側標示為「Kimi K2.7 Code」。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/a6916f2624d24310.jpg)

<details class="chart-data"><summary>展開畫面重點</summary><div class="me-note">畫面呈現兩個電子商務網站的介面設計與排版對比。
下方標籤分別為：
- 左側：「Kimi K3」（採用深色背景主題，介面呈現各類古董、鐘錶、裝飾品等商品清單與分類標籤）。
- 右側：「Kimi K2.7 Code」（採用淺色背景主題，同樣展示多種精選商品與分類，並帶有價格標示與折扣標籤）。</div></details>

這種思考策略也延伸到了相依性的使用上，Kimi K3 能夠建立更好的捲動動畫、圖表和前端 UI，單純是因為它在推理過程中思考了如何使用這些相依性。

![gsap 在勝率提升方面表現最佳（+31.9pp），而 zustand 則呈現顯著負成長（-25.2pp）。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/4d0b43fd978b117a.jpg)

<details class="chart-data"><summary>展開數據表</summary><table><thead><tr><th>項目</th><th>數值</th></tr></thead><tbody><tr><td>gsap</td><td>+31.9pp</td></tr><tr><td>mammoth</td><td>+26.2pp</td></tr><tr><td>xlsx</td><td>+17.6pp</td></tr><tr><td>html2canvas</td><td>+16.2pp</td></tr><tr><td>recharts</td><td>+12.9pp</td></tr><tr><td>lenis</td><td>+12.9pp</td></tr><tr><td>pdfjs-dist</td><td>+12.9pp</td></tr><tr><td>jspdf</td><td>+10.5pp</td></tr><tr><td>clsx</td><td>+9.8pp</td></tr><tr><td>tailwind-merge</td><td>+9.8pp</td></tr><tr><td>zustand</td><td>-25.2pp</td></tr></tbody></table></details>

![左右雙分割畫面比較兩個金融數據終端機介面，左側顯示 CandleTabs 的 Kimi K3 介面，右側顯示 TickerDeck 的 Claude Fable 5 介面。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/bf79ab0564be1dac.jpg)

<details class="chart-data"><summary>展開畫面重點</summary><div class="me-note">畫面分為左右兩個半部，分別展示不同的金融數據介面與走勢圖：

左側（下方標註 Kimi K3）：
- 頂端導覽列左側顯示「CandleTabs LIVE OHLC terminal - crypto, stocks &amp; more」，右側顯示「DATA: BINANCE, TWELVE DATA」。
- 上方行情列列出多個加密貨幣代號與即時價格及漲跌幅：
  - DOGE: 1.14 (+1.05%)
  - ADA: 0.3290 (-1.85%)
  - LINK: 6.71 (+0.58%)
  - AVAX: 0.07339 (-1.91%)
  - LTC: 78.10 (-0.46%)
  - DOT: 0.8540 (+1.91%)
  - TRX: 3.4
- 標籤頁顯示「Bitcoin」與「Ethereum」，右側有「+ New tab」。
- 主視圖為 Bitcoin (BTC/USDT) 的蠟燭圖與成交量圖，左上角顯示「BTC/USDT」「CONNECTING」「66,332.00」「+0.94% (+619.84)」。
- 圖表上方工具列包含時間週期選項（1m、5m、15m、1h、4h、1d）及圖表類型切換（Candles、Line、Area），右側顯示 24 小時高低價與總量（24H HIGH 66,956.15、24H LOW 65,471.69、24H VOLUME $1.27B）。
- 下方時間軸橫跨 18 日至 22 日。

右側（下方標註 Claude Fable 5）：
- 頂端導覽列左側顯示「TICKERDECK LIVE CANDLE TERMINAL」，右側黃色按鈕顯示「+ ADD TICKER」。
- 上方行情列列出：
  - BTC/USDT (帶有綠色上漲圖示)
  - ETH/USDT
  - AAPL
- 主視圖為 BTC/USDT 的蠟燭圖，左上角顯示「BTC/USDT」「BTC/USDT」「CRYPTO」「66,329.35」「+0.93% (24h)」「LIVE - WS」。
- 圖表上方右側有時間週期切換按鈕（1s、5s、1m、1h、4h、1d）。
- 下方顯示成交量與價格走勢，時間軸顯示 20:25 至 20:27。</div></details>

![Kimi K3 與 Gemini 3.5 Flash 分別展示其生成的選擇權交易儀表板介面（Options Trading Desk 與 VegaPulse Terminal）。](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/c74ea90d1672648c.jpg)

<details class="chart-data"><summary>展開數據表（1）Kimi K3</summary><table><thead><tr><th></th><th>Spot VWAP</th><th>CE Vega Current</th><th>CE Vega Average</th><th>PE Vega Current</th><th>PE Vega Average</th></tr></thead><tbody><tr><td>Spot Price=₹24,195.17 (-0.28%)</td><td>₹24,205.42 (-0.04%)</td><td>0.1390</td><td>0.1325</td><td>0.1729</td><td>0.1247</td></tr></tbody></table></details><details class="chart-data"><summary>展開數據表（2）Gemini 3.5 Flash</summary><table><thead><tr><th></th><th>Spot VWAP</th><th>CE Vega</th><th>PE Vega</th><th>Vega Diff (CE - PE)</th><th>Sentiment Score</th></tr></thead><tbody><tr><td>Spot Price (NIFTY)=₹22,212.0 (+0.56%)</td><td>₹22,143.0 (+0.25%)</td><td>106.7</td><td>106.7</td><td>0.0000</td><td>40.0</td></tr></tbody></table></details>

# 這對模型選擇意味著什麼

Kimi K3 是設計改進上的一大步，也是整體開源模型的一大躍進。像這樣的發表讓我們想起開源領域的前沿進展有多快，以及開源模型如何能夠提出推動所有人前進的新點子。每一次像這樣的發布，都為研究人員和開發者提供了更強大的基礎，讓他們得以進一步突破。

我們將持續監控 Kimi K3 的效能，以及它與其他模型的比較。恭喜 Moonshot AI 團隊成功發表，也歡迎前往 DesignArena.ai 看看你是不是比其他模型更喜歡 Kimi K3。

對基準測試與評估感興趣嗎？歡迎加入我們：intelligence.ai。

## 標籤

Benchmark, 功能更新, LLM, Kimi, OpenAI, Zhipu
