# Google 發布 Gemini 3.7 Flash，程式開發評測領先前代並改善 Agent 工作流程

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：koray kavukcuoglu (@koraykv) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥🔥🔥🔥🔥 · 日期：2026-08-13

> 原始來源：https://x.com/koraykv/status/2087948169552490845

## 證據與延伸閱讀

- [Google 發布 Gemini 3.7 Flash，程式開發評測領先前代並改善 Agent 工作流程。](https://x.com/koraykv/status/2087948169552490845)
- [三 Agent 團隊在 MuJoCo 訓練機器人](https://video.twimg.com/amplify_video/2087944397472296960/vid/avc1/1280x720/wWFxoF_XRhyPZ_e6.mp4?tag=29)
- [年底前提供入門價格為半價](https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/) — 官方文件

## 中文摘要

Google 發布 Gemini 3.7 Flash，程式開發評測領先前代並改善 Agent 工作流程。

這次更新也以三個 Agent 協作、從零訓練機器人控制模型的展示，說明其 agentic performance 與 coding accuracy 的進展。

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1786641905361-itqxhyr9.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/e679cd89dc12ca16.jpg" autoplay loop muted playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> 來源：[@GoogleDeepMind](https://x.com/GoogleDeepMind/status/2087948366294515977)（回覆）｜Gemini 3.7 Flash 產品名稱與彩星圖示

**發布背景** 發文者 Koray Kavukcuoglu 表示，Flash 系列在短時間內快速迭代，從 Gemini 3.5 到 Gemini 3.7 約三個月；Google 其他官方貼文則指出，Gemini 3.7 Flash 僅在 Gemini 3.6 Flash 推出約三週後登場。Logan Kilpatrick 將這次進步歸因於演算法改良，並強調模型速度快、價格較低，已可透過 API、Google AI Studio、Google Antigravity 等管道使用。Google DeepMind 將它定位為適合程式開發、知識工作與網頁開發的「workhorse model」，也就是面向日常生產工作的主力模型。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/9397b86af121d387.png)
> Gemini 3.7 Flash 的產品標誌與四色星形圖示浮水印於淺藍色漸層背景上。

**評測表現** 相較 Gemini 3.6 Flash，Gemini 3.7 Flash 在多項程式開發與企業工作流程評測中提升，發文者列出的結果包括：

- DeepSWE v1.1：發文者列出的整體評測由 37.0% 升至 65.3%。
- Code Arena Elo：1506 成長至 1588。
- AutomationBench：13.4% 成長至 30.4%。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/80a33bb94ceeb6d0.jpg)
> Gemini 3.7 Flash 在多項程式碼與 agent 工作流程測試中相較 3.6 Flash 均有大幅提升，並在跨領域 benchmark 中與 GPT-5.6 Terra 及 Claude Sonnet 5 各有高低。

Google 的產品文章提供了更細的對照數據。針對產出可直接用於生產環境的程式碼，FrontierCode 1.1 Main 從 34.4% 提升至 43.6%，Google 產品文章的文字口徑則顯示，DeepSWE v1.1 從 49.0% 提升至 65.3%。同篇不同附圖分別以 48.6% 或 48.0% 標示前代基準，反映來源版次或對照組不同，不宜混為同一組數據。在 Arena.ai 的 WebDev Arena 中，Elo 分數由 1538 提升至 1588；GDP.pdf 文件理解評測則由 22.0% 提升至 34.0%。這些結果涵蓋除錯、問題修復、複雜文件處理與真實世界企業流程，而不只是單次程式碼生成。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/b931d99243119e37.png)
> 來源：[@OfficialLoganK](https://x.com/OfficialLoganK/status/2087948481721962669)（回覆）｜Gemini 3.7 Flash 在 DeepSWE V1.1 長期軟體工程基準測試獲得 65.3% 的成績，顯著超越 Gemini 3.6 Flash 的 48.6%，在各模型中僅次於 GPT-5.6 Terra 的 69.6%。

**程式開發與網頁生成** Gemini 3.7 Flash 被描述為更擅長處理除錯與 issue resolution，也提高首次產出程式碼的正確率。網頁開發方面，模型能用較少的 prompt 產生功能更完整的版面與應用程式；進行 UI 生成時，還能依照螢幕截圖、圖片或完整 design system，維持較高的設計遵循度與視覺一致性。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/02aeacbac097cbec.png)
> 來源：[@OfficialLoganK](https://x.com/OfficialLoganK/status/2087948481721962669)（回覆）｜Gemini 3.7 Flash 在 FrontierCode 1.1 Main 的正式程式碼品質評測中以 43.6% 的準確率領先 Claude Sonnet 5、GPT-5.6 Terra 與前代 Gemini 3.6 Flash。

官方展示包含多種端到端產出：從文字 prompt 即時建立可遊玩的 3D 遊戲，並搭配 Nano Banana 動態生成角色、物品與材質；也展示以 Gemini 3.7 Flash 協調 sub-agents，再由 Gemini Omni 產生具互動視差效果的 landing page。此外，模型能把靜態 PDF 年報轉成包含即時圖表與彙整洞察的互動式資料故事。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/db072eb6d906c5f6.png)
> 來源：[@OfficialLoganK](https://x.com/OfficialLoganK/status/2087948481721962669)（回覆）｜Gemini 3.7 Flash 在 Code Arena 網頁開發（Web development）基準測試中以 Elo 1588 領先 Claude Sonnet 5、Gemini 3.6 Flash、Muse Spark 1.2 及 GPT-5.6 Terra。

**Agent 協作展示** 發文者特別分享了一項機器人實驗：以三個 Agent 組成團隊，讓 Gemini 3.7 Flash 在 MuJoCo 物理模擬環境中，從零開始自主訓練四足機器人的控制模型。媒體畫面顯示，這套展示採用「3-Agent Conditional Branching Graph」，由 Coordinator、Evaluator 與 Tuner 分工，反覆執行訓練、觀察與調整。

<video src="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/1786641579611-1sj3pevi.mp4" poster="https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/a96250901987a1f2.jpg" controls playsinline preload="metadata" style="max-width:100%;height:auto;display:block;margin:1rem 0"></video>
> Gemini 3.7 Flash 訓練機器人模型的展示畫面

- Coordinator 管理 Evolutionary Strategies（ES）的族群基準，並監控前進距離與保持直立等條件。
- Evaluator 讀取記憶體中的 `video_frames` 陣列與數值遙測資料，分析連續畫面的運動流與腿部離地高度，再輸出結構化 JSON 診斷。
- Tuner 依據診斷結果調整 `reward_function.py` 中的 `compute_reward`，以及 `Kp`、`Kd`、`sigma`、`ACTION_SCALE` 等超參數，將建議回傳給 Coordinator。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/7f6fdd0d25fa756e.png)
> 來源：[@OfficialLoganK](https://x.com/OfficialLoganK/status/2087948481721962669)（回覆）｜Gemini 3.7 Flash 在 AutomationBench 企業工作流程自動化測試中以 30.4% 領先各模型。

展示畫面所列的機器人設定包括 0.4m × 0.2m × 0.1m、0.8kg 的軀幹、四條各有髖關節與膝關節的腿、8 個 hinge joints，以及最高 2.0 Nm 的馬達扭矩。控制迴圈為 50 Hz，`dt = 0.01s`，每個 step 使用 2 個 substeps。這些屬於展示中出現的實驗設定，不應直接視為 Gemini 3.7 Flash 的通用產品規格。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/8c0384014dd04d40.png)
> 來源：[@GoogleDeepMind](https://x.com/GoogleDeepMind/status/2087948368957894859)（回覆）｜Gemini 3.7 Flash 在 DeepSWE V1.1 評測取得 65.3% 的成績，較前代 Gemini 3.6 Flash 的 48.6% 大幅提升，並超越 Claude Sonnet 5 與 Muse Spark 1.2。

**持續診斷與障礙測試** 展示中的 Orchestrator Agent 會重複執行 ES 最佳化，直到機器人停止學習，再把影片交給 Multi-Modal Evaluator Agent 判斷問題，最後由 Tuner Agent 提出神經政策更新。媒體內容設定的最終驗證條件，是在完整 15.0 秒的 evaluation episode 中，champion policy 必須達到 `distanceTraveled >= 15.0m` 與 `timeUpright >= 10.0s`；訓練期間則可由 Coordinator 與 Tuner 動態選擇 rollout horizon，例如先使用 3.0 至 5.0 秒的探索區間，再逐步延長。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/df1d7625981e198c.png)
> 來源：[@GoogleDeepMind](https://x.com/GoogleDeepMind/status/2087948368957894859)（回覆）｜Gemini 3.7 Flash 在 FrontierCode 1.1 Main 的正式程式碼品質測試中以 43.6% 的成績領先 Claude Sonnet 5、GPT-5.6 Terra 與 Gemini 3.6 Flash。

在不重新訓練、也不使用 privileged vision 的情況下，展示進一步測試了可推動木箱、固定階梯與多物件碎片場。畫面中的 Phase 2 報告指出，Gen 90 政策能與可移動障礙物互動，但面對固定垂直障礙時，單靠平面行走策略仍有限制。Gemini 3.7 Flash 的 Evaluator 建議提高擺腿離地高度，或加入以自身視角取得的地形高度感測，例如 egocentric raycast elevation grids；後續 Phase 3 則轉向高離地的 leaping gait，目標是讓機器人像青蛙一樣跳過全部物件，並持續迭代到視覺評估確實呈現跳躍動作。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/d26109ad16df8408.png)
> 來源：[@GoogleDeepMind](https://x.com/GoogleDeepMind/status/2087948368957894859)（回覆）｜Gemini 3.7 Flash 在 Code Arena 的 Web development 基準測試中以 1588 分領先 Claude Sonnet 5、Gemini 3.6 Flash 等模型。

**開發體驗** Google 表示，Gemini 3.7 Flash 不只提高評測分數，也改善實際使用時的互動品質。模型遇到阻礙時更能調整策略，需要時會釐清使用者意圖，並更精準遵循指示；在多步驟規劃與 tool call 上投入更多推理，藉由較有紀律的執行方式，降低工程流程中的人工監督需求與重試次數。這些改進是針對複雜工作流程的實用性，而非只追求單一 benchmark 的表現。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/74950be96661ced4.jpg)
> 來源：[@GoogleDeepMind](https://x.com/GoogleDeepMind/status/2087948368957894859)（回覆）｜Gemini 3.7 Flash 在 AutomationBench 的企業工作流程自動化測試中以 30.4% 的成績領先，高於 GPT-5.6 Terra（23.6%）、Gemini 3.6 Flash（17.0%）與 Claude Sonnet 5（10.7%）。

**價格與使用管道** Gemini 3.7 Flash 在年底前提供入門價格：每 100 萬個 input tokens 為 0.75 美元，每 100 萬個 output tokens 為 3.75 美元，約為 Gemini 3.6 Flash 原始成本的一半。Google 認為，較低的 token 成本搭配更高的模型表現，可讓開發者與企業以較低成本擴大部署 production-ready Agent。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/9a721af55a50fb2a.webp)
> Gemini 3.7 Flash 在 Production Code Eval 評測中以 73.8% 的正式環境程式碼品質得分率領先 Gemini 3.6 Flash、Gemini 3.5 Flash 與 Claude 3.5 Sonnet。

目前可使用的管道包括：

- 開發者可在 Google Antigravity 探索 agent-first 工作流程，或透過 Gemini API 搭配 Google AI Studio、Android Studio 建立應用程式。
- 企業可在 Gemini Enterprise Agent Platform 與 Gemini Enterprise 使用。
- Google AI Pro 與 Ultra 訂閱者可在支援地區的 Gemini App 中，透過 Gemini Spark 使用 Gemini 3.7 Flash；Spark 已在超過 160 個國家提供，並可協助彙整檔案、撰寫 email 與更新狀態文件。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/b3502309d70569c2.webp)
> Gemini 3.7 Flash 的產品標誌，以藍色斜向立體色塊背景呈現，中央印有彩色的四芒星圖示與品牌名稱。

**安全措施** 官方表示，Gemini 3.7 Flash 更新了 Frontier Safety safeguards，針對化學、生物、放射性與核能（CBRN）以及網路攻擊濫用情境加強防護，同時保留有益用途。這些安全設計仍應搭配 official model card 由人工核對實際部署情境，不能僅根據發布文章中的描述推定所有風險都已排除。完整背景可參考 Google 的[產品介紹](https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash)。

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/68eac607fa08cd48.webp)
> Gemini 3.7 Flash 在 DeepSWE v1.1 測試中取得 65.3% 的成績，領先 Gemini 3.6 Flash（48.0%），但仍落後於 Gemini 3.5 Pro（69.0%）。

## 媒體內容

**Gemini 3.7 Flash 在多項程式碼與 agent 工作流程測試中相較 3.6 Flash 均有大幅提升，並在跨領域 benchmark 中與 GPT-5.6 Terra 及 Claude Sonnet 5 各有高低。**

**數據表**

|   | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra | Muse Spark 1.2 |
| --- | --- | --- | --- | --- | --- |
| Input price ($/1M tokens) | $0.75* | $0.75* | $2.00 | $2.00 | $1.25 |
| Output price ($/1M tokens) | $3.75* | $3.75* | $10.00 | $12.00 | $4.25 |
| Artificial Analysis Intelligence Index | 56 | 52 | 55 | 57 | 57 |
| DeepSWE v1.1 | 65.3% | 49.0% | 54.0% | 69.6% | 59.3% |
| FrontierCode 1.1 Main | 43.6% | 34.4% | 42.7% | 41.3% | - |
| Code Arena | 1588 | 1538 | 1541 | 1523 | 1535 |
| Terminal-bench 2.1 | 85.8% | 78.0% | 80.4% | 87.4% | 82.9% |
| Terminal-bench 3.0 | 14.9% | 5.4% | 14.6% | 20.8% | - |
| GDPVal-AA v2 | 1525 | 1422 | 1598 | 1578 | 1628 |
| AutomationBench | 30.4% | 17.0% | 10.7% | 23.6% | - |
| Harvey LAB-AA | 90.7% | 85.1% | 90.1% | 85.2% | - |
| GDP.PDF | 34.0% | 22.0% | 28.0% | 24.7% | 16.0% |
| CharXiv Reasoning (No tools) | 84.5% | 85.2% | 77.0% | 85.9% | - |
| CharXiv Reasoning (With tools) | 88.7% | 89.4% | 88.3% | - | - |
| LVBench | 85.4% | 84.2% | 68.5% | 78.9% | - |
| GDM-MRCR v2 (8-needle, 128k) | 97.0% | 91.8% | 81.5% | 93.5% | - |
| GDM-MRCR v2 (8-needle, 1M) | 62.5% | 54.0% | - | - | - |
| OSWorld-2.0 | 38.1% | 33.8% | 39.6% | 50.2% | - |
| Agent's Last Exam | 26.3% | 24.2% | 33.3% | 28.0% | - |
| HLE-Verified | 53.6% | 51.2% | 31.0% | 51.1% | - |
| BioMysteryBench (Human solvable) | 87.1% | 80.6% | 87.5% | 83.8% | - |
| BioMysteryBench (Human difficult) | 43.5% | 41.2% | 34.1% | 49.4% | - |
| LABBench2 | 82.1% | 76.1% | 80.1% | 81.2% | - |

**Gemini 3.7 Flash 訓練機器人模型的展示畫面**

**影片中的 Prompt 與操作**

Prompt（00:51）：

```
/goal 讓機器人像青蛙一樣跳躍穿過它。
不斷進行迭代，直到它成功跳過所有物件，且視覺評估看起來確實像是青蛙跳躍為止。
```

原文：/goal Make the robot jump across it like a frog.
Don't stop iterating until it makes it across all the objects and the visual evaluation actually looks like frog jumps.

操作步驟：

1. （00:55）點擊傳送按鈕送出 prompt

**Gemini 3.7 Flash 在 AutomationBench 企業工作流程自動化測試中以 30.4% 領先各模型。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Gemini 3.7 Flash | 30.4% |
| Gemini 3.6 Flash | 17.0% |
| Claude Sonnet 5 | 10.7% |
| GPT-5.6 Terra | 23.6% |

**Gemini 3.7 Flash 在 Code Arena 網頁開發（Web development）基準測試中以 Elo 1588 領先 Claude Sonnet 5、Gemini 3.6 Flash、Muse Spark 1.2 及 GPT-5.6 Terra。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Gemini 3.7 Flash | 1588 |
| Gemini 3.6 Flash | 1538 |
| Claude Sonnet 5 | 1541 |
| GPT-5.6 Terra | 1523 |
| Muse Spark 1.2 | 1535 |

**Gemini 3.7 Flash 在 DeepSWE V1.1 長期軟體工程基準測試獲得 65.3% 的成績，顯著超越 Gemini 3.6 Flash 的 48.6%，在各模型中僅次於 GPT-5.6 Terra 的 69.6%。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Gemini 3.7 Flash | 65.3% |
| Gemini 3.6 Flash | 48.6% |
| Claude Sonnet 5 | 53.8% |
| GPT-5.6 Terra | 69.6% |
| Muse Spark 1.2 | 54.9% |

**Gemini 3.7 Flash 在 FrontierCode 1.1 Main 的正式程式碼品質評測中以 43.6% 的準確率領先 Claude Sonnet 5、GPT-5.6 Terra 與前代 Gemini 3.6 Flash。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Gemini 3.7 Flash | 43.6% |
| Gemini 3.6 Flash | 34.4% |
| Claude Sonnet 5 | 42.7% |
| GPT-5.6 Terra | 41.3% |

**Gemini 3.7 Flash 在 FrontierCode 1.1 Main 的正式程式碼品質測試中以 43.6% 的成績領先 Claude Sonnet 5、GPT-5.6 Terra 與 Gemini 3.6 Flash。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Gemini 3.7 Flash | 43.6% |
| Gemini 3.6 Flash | 34.4% |
| Claude Sonnet 5 | 42.7% |
| GPT-5.6 Terra | 41.3% |

**Gemini 3.7 Flash 在 DeepSWE V1.1 評測取得 65.3% 的成績，較前代 Gemini 3.6 Flash 的 48.6% 大幅提升，並超越 Claude Sonnet 5 與 Muse Spark 1.2。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Gemini 3.7 Flash | 65.3% |
| Gemini 3.6 Flash | 48.6% |
| Claude Sonnet 5 | 53.8% |
| GPT-5.6 Terra | 69.6% |
| Muse Spark 1.2 | 54.9% |

**Gemini 3.7 Flash 在 AutomationBench 的企業工作流程自動化測試中以 30.4% 的成績領先，高於 GPT-5.6 Terra（23.6%）、Gemini 3.6 Flash（17.0%）與 Claude Sonnet 5（10.7%）。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Gemini 3.7 Flash | 30.4% |
| Gemini 3.6 Flash | 17.0% |
| Claude Sonnet 5 | 10.7% |
| GPT-5.6 Terra | 23.6% |

**Gemini 3.7 Flash 在 Code Arena 的 Web development 基準測試中以 1588 分領先 Claude Sonnet 5、Gemini 3.6 Flash 等模型。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Gemini 3.7 Flash | 1588 |
| Gemini 3.6 Flash | 1538 |
| Claude Sonnet 5 | 1541 |
| GPT-5.6 Terra | 1523 |
| Muse Spark 1.2 | 1535 |

**Gemini 3.7 Flash 在 Production Code Eval 評測中以 73.8% 的正式環境程式碼品質得分率領先 Gemini 3.6 Flash、Gemini 3.5 Flash 與 Claude 3.5 Sonnet。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| Gemini 3.7 Flash | 73.8% |
| Gemini 3.6 Flash | 58.2% |
| Gemini 3.5 Flash | 65.1% |
| Claude 3.5 Sonnet | 63.8% |

**Gemini 3.7 Flash 在 DeepSWE v1.1 測試中取得 65.3% 的成績，領先 Gemini 3.6 Flash（48.0%），但仍落後於 Gemini 3.5 Pro（69.0%）。**

**數據表**

| 項目 | 數值 |
| --- | --- |
| 3.7 Flash (3-7-26) | 65.3% |
| 3.6 Flash (2-12-26) | 48.0% |
| 3.5 Flash (11-18-25) | 54.0% |
| 3.5 Pro (11-18-25) | 69.0% |
| 3.0 Pro (11-18-25) | 54.0% |

## 標籤

Gemini, 新產品, 功能更新, Agent, LLM, Benchmark, Google, DeepMind, Gemini
