Gemini 3.7 Flash 正式發布:比 3.6 便宜一半、FrontierCode 43.6% 創新高,Google 最強工作馬模型(2026)

Google 於 2026 年 8 月 13 日發布 Gemini 3.7 Flash,主打編程與 AI Agent 工作流:FrontierCode 1.1 達 43.6%(較 3.6 提升 9.2%)、DeepSWE v1.1 65.3%、WebDev Arena Elo 1588,價格卻砍半至每百萬輸入 Token 0.75 美元。本文整理基準測試、定價、與 GPT-5.6 Terra 及 Claude Sonnet 5 的比較,以及 API 遷移注意事項。

  • Dennis
  • 5 分鐘閱讀
Gemini 3.7 Flash 正式發布:比 3.6 便宜一半、FrontierCode 43.6% 創新高,Google 最強工作馬模型(2026)

Google 在 2026 年 8 月 13 日正式發布 Gemini 3.7 Flash,這是 Flash 系列迄今最強的「工作馬」模型:FrontierCode 1.1 達 43.6%、DeepSWE v1.1 65.3%,價格只要 3.6 Flash 的一半(每百萬輸入 Token 0.75 美元),專為編程與 Agent 工作流設計,並同步進入 Gemini Spark 與 GitHub Copilot。

距離 3.6 Flash 發布僅僅三週,Google 就端出了 Gemini 3.7 Flash。這不是一次例行小更新——官方部落格稱它是「迄今最智能的工作馬模型」,而且把價格直接砍半。對開發者來說,這可能是 2026 下半年性價比最兇的模型發布之一。

Gemini 3.7 Flash 是什麼?

Gemini 3.7 Flash(API 模型 ID:gemini-3.7-flash)是 Google 在 3.6 Flash 基礎上,透過推理基礎(Reasoning Foundation)的演算法創新優化而來,並非重新預訓練。它的產品規格與 3.6 高度一致:

  • 上下文視窗:輸入上限維持 1,048,576 Token(1M),最大輸出 65,536 Token
  • 原生多模態:支援文字、圖片、語音、影片與 PDF 輸入,輸出為文字
  • 思考等級(Thinking Levels):新增 Low / Medium / High 三種可調思考深度,讓開發者在品質、成本與延遲之間取捨

不過 API 有幾個重要的破壞性變更,遷移時要特別注意(詳見下文)。

基準測試:編程與 Agent 全面升級

這次 3.7 Flash 的進步集中在多步驟規劃、程式碼修改、工具操作與複雜文件解析,以下整理官方評估與 Artificial Analysis 的數據:

基準測試Gemini 3.7 FlashGemini 3.6 Flash提升幅度
AA Intelligence Index(綜合智力)5652+4
FrontierCode 1.1 Main(生產級程式碼)43.6%34.4%+9.2%
DeepSWE v1.1(長流程軟體工程)65.3%49.0%+16.3%
WebDev Arena Elo(網頁開發)15881538+50
Terminal-bench 2.1(終端操作 Agent)85.8%78.0%+7.8%
OSWorld-2.0(電腦使用)47.9%33.8%+14.1%
AutomationBench(企業工作流自動化)30.4%17.0%+13.4%
GDP.pdf(複雜 PDF 解析)34.0%22.0%+12.0%
GDM-MRCR v2(長上下文檢索)97.0%91.8%+5.2%

官方部落格特別點名三個亮點:

  1. 編程:FrontierCode 1.1 Main 從 34.4% 跳到 43.6%,首次通過率與生成生產級程式碼的能力明顯提升
  2. 知識工作:GDP.pdf 基準(解析複雜財報/法務文件)從 22% 提升到 34%,金融、法律、生醫領域的文件理解大幅改善
  3. 網頁開發:WebDev Arena Elo 1588 分,能更少次 prompt 就產生功能完整的版面

值得一提的是,這一代側重「推理與執行」,純多模態感知(如 CharXiv)的成績與 3.6 持平,沒有明顯退步也沒有大幅進步。

價格:砍半再砍,年底前最划算

3.7 Flash 最殺的不是性能,而是價格。官方定價如下:

項目促銷價(即日起至 2026/12/31)標準價(2027/1/1 起)
輸入 Token(每百萬)$0.75 USD$1.50 USD
輸出 Token(每百萬)$3.75 USD$7.50 USD
Context Caching 檢索$0.075 USD$0.15 USD
Context Caching 儲存(每百萬/小時)$0.50 USD$1.00 USD
Batch API(輸入/輸出)$0.375 / $1.875 USD$0.75 / $3.75 USD

以標準的 80% 輸入 / 20% 輸出比例計算混合成本,促銷期內 3.7 Flash 約 $1.35 美元/百萬 Token,比 Claude Sonnet 5(約 $3.60)便宜近三分之二,也比 GPT-5.6 Terra(約 $4.00)便宜近三倍。

⚠️ 兩個帳單陷阱要小心

  • 思考 Token 以輸出費率計費:如果全部任務都開 High 思考等級,即使可見輸出很短,帳單也會飆升
  • Google Search / Maps 工具:每月共享 5,000 次免費額度,用完後每 1,000 次額外請求收費 $14 美元

與競品比較:GPT-5.6 Terra、Claude Sonnet 5

項目Gemini 3.7 FlashGPT-5.6 TerraClaude Sonnet 5
DeepSWE v1.165.3%69.6%53.8%
Terminal-bench 2.185.8%87.4%80.4%
OSWorld-2.0(電腦使用)47.9%50.2%-
WebDev Arena Elo158815231541
GDP.pdf34.0%24.7%28.0%
Agent’s Last Exam26.3%28.0%33.3%
混合成本(百萬 Token)$1.35$4.00$3.60
原生多模態(影片/語音輸入)

解讀:GPT-5.6 Terra 在終端操作與電腦使用(OSWorld)仍保持領先,但價格貴近 3 倍且缺乏原生影片/語音輸入;Claude Sonnet 5 在極困難的推理任務(Agent’s Last Exam)依然是首選,成本則顯著較高。3.7 Flash 的定位很清楚——用接近開源模型的價格,提供前段班的 Agent 能力

可用性:從 API 到個人助理一次到位

  • API(GA 正式版):已可透過 Gemini API 呼叫 gemini-3-7-flash,Google AI Studio 提供免費額度測試(Computer Use 仍為預覽版)
  • Google Antigravity:可探索 Agent-first 工作流
  • Gemini Spark:Google AI Pro / Ultra 訂閱用戶(160+ 國家)今天起自動升級為 3.7 Flash 底座
  • GitHub Copilot:Copilot Pro / Business / Enterprise 用戶可在 VS Code、JetBrains、Xcode 等編輯器選擇此模型(企業需先由管理員啟用預覽政策)
  • 企業平台:可透過 Google Cloud 的 Gemini Enterprise 平台部署

API 遷移注意事項(3.6 → 3.7)

如果你是既有 3.6 Flash 使用者,以下變更務必注意:

  1. temperaturetop_ptop_k 已棄用——3.7 Flash 改用思考等級控制輸出
  2. thinking_budgetthinking_level 取代(Low / Medium / High),不支援 minimal
  3. 移除 candidate_count
  4. 連續對話建議使用 previous_interaction_id 取代重建歷史;多輪函式呼叫需精確保留思考簽名(Thought Signatures)

業界反應:定價才是真正的底牌

  • MarkTechPost:「這款模型的定價才是真正的底牌」,對需要大規模常駐運行 Agent 的新創與中型團隊,直接拉低了開發門檻
  • Kingy AI(評分 8.8/10):認為 3.7 Flash 是「把 Google Flash 系列視為首選核心模型、而非廉價備用方案的最佳理由」,但也提醒在極困難的 Agent 任務上,GPT-5.6 Terra 與 Sonnet 5 在各自擅長領域仍有小幅優勢,正式遷移前應在自己的資料集上跑回歸測試

延伸閱讀

資料來源

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。