Gemini 4 Argon 正式發布:1M token 輸出、DeepSWE 77.9% 登頂,Google 時隔 7 個月重回前沿 AI 前三(2026)

Google DeepMind 於 2026 年 9 月 30 日發布 Gemini 4 世代首款旗艦模型 Argon:單次輸出上限從 64K 暴增到 100 萬 token,DeepSWE v1.1 以 77.9% 刷新 SOTA,在 12/18 項基準獨占鰲頭並領先 GPT-6 Astra 與 Claude Opus 5.5,更首度透過 Fairwind 計畫把前沿模型優先交給資安防禦者。本文整理完整規格、定價、benchmark 對照、Google 內部成果與業界爭議。

  • Dennis
  • 5 分鐘閱讀
Gemini 4 Argon 正式發布:1M token 輸出、DeepSWE 77.9% 登頂,Google 時隔 7 個月重回前沿 AI 前三(2026)

Google DeepMind 於 2026 年 9 月 30 日發布 Gemini 4 Argon,這是 Gemini 4 世代的首款旗艦模型(也是時隔 7 個月來第一款非 Flash 級旗艦),一口氣把單次輸出上限從 64K 拉到 100 萬 token,並以 DeepSWE v1.1 77.9% 刷新業界 SOTA,在多項基準上領先 GPT-6 Astra 與 Claude Opus 5.5。

這是什麼:Gemini 4 Argon 的定位

Argon 是 Google DeepMind 資深副總裁 Koray Kavukcuoglu 口中的「下一個前沿智能時代」(next era of frontier intelligence)開端。官方明確定義它主打三大戰場:

  • 軟體工程:處理需要跨多檔案、數百上千行程式的複雜重構與除錯。
  • 企業知識工作:涵蓋金融分析、法律文書撰寫、稅務研究與業務自動化(Zapier 工作流)。
  • 網路安全防禦:能「自主地發現、驗證並修補」關鍵軟體漏洞。

它支援文字、圖片、影片、語音輸入(輸出為文字),但並未開源,是閉源模型。

最大亮點:1M token 單次輸出

這是 Argon 最有辨識度的規格。前一代 Gemini 的單次輸出上限只有 64K token,而 OpenAI 的 GPT-6 Astra、Anthropic 的 Claude Opus 5.5 與 Fable 5.1 目前都停在 128K。Argon 直接拉到 1M,是業界之最。

模型單次最大輸出
Gemini 4 Argon1M token
Claude Opus 5.5128K
Claude Fable 5.1128K
GPT-6 Astra128K

100 萬 token 是什麼概念?官方說,當模型有足夠的「思考空間」,可以在單一軌跡(single trajectory)內產生數十萬 token 的深度推理,把大型重構或長篇報告一次完成,不必拆成多輪對話。API 端還配套了 Long Decode Continuation 功能,能在後續呼叫中暫停與恢復長回應,避免推理跑到一半就 timeout。

代價也不小:一次完整 1M 輸出,優惠價就要 $10、恢復原價後 $20。Google 尚未正式公布 Argon 的輸入上下文窗口(第三方 Artificial Analysis 測得為 1M)。

定價:優惠價、原價與快取折扣

計費Gemini 4 ArgonClaude Opus 5.5GPT-6 Astra
輸入 / 輸出(每百萬 token)$2 / $10(優惠) → $4 / $20$4 / $20$10 / $50
快取輸入(每百萬 token)$0.10$0.20$1.00

Argon 上市就打出 50% 折扣(至少一個月,官方未公布結束日),輸入 $2、輸出 $10;優惠結束後恢復 $4 / $20。快取輸入享有 95% 折扣,優惠期內低至每百萬 $0.10(比 Gemini 3.8 Flash 的 90% 折扣更進一步)。

基準測試:哪裡領先、哪裡落後

Google 官方宣稱 Argon 在 13 / 19 項可信基準上達到 SOTA(據 Latent Space AINews 統計);第三方整理的 18 項對比中,Argon 獨占鰲頭 12 項、並列 1 項。

基準測試Gemini 4 ArgonClaude Opus 5.5GPT-6 Astra
DeepSWE v1.1(長行程軟體工程)77.9% ✅SOTA74.2%74.1%
Vals Index(GDP 加權經濟影響)68.9% ✅第167.0%63.1%
AutomationBench(Zapier 業務執行)51.3% ✅第142.5%—
Harvey 法律 Agent Benchmark19.6%—5.4%
LVBench(長影片理解)91.7% ✅SOTA——
CWE-bench v1(漏洞修復)68%(並列第1)67%68%(並列第1)
Terminal-Bench 4.057.4%66.4%58.2%
FrontierSWE v255.0%62.3%65.5%

值得注意的相對弱項:在 Terminal-Bench 4.0(終端機操作)落後 Opus 5.5 約 9 個百分點,FrontierSWE v2(另一套軟體工程基準)也輸給 GPT-6 Astra。換句話說,Argon 在「長行程、多步」的深度工作流很強,但在部分即時互動型任務上並非全面碾壓。

Fairwind 計畫:資安防禦者先用

Google 這次刻意採分階段釋出,把最強版本優先交給「好人」:

  1. 第一階段(現在):僅透過 Fairwind 計畫開放給受信任的網路防禦者——政府與國家網路安全機構、關鍵基礎設施營運商(醫療、電信、能源、金融)。這些夥伴會拿到去除網路安全護欄的專屬版本,用於授權的威脅模擬、逆向工程與惡意軟體分析。
  2. 第二階段(下一步):開放給付費 API 用戶與 Google AI Ultra 訂閱者。
  3. 第三階段(後續):全面推向開發者、企業與一般消費者。

Google 也正參與美國政府針對「預發布 AI 模型」的自願評估流程。這套「資安優先」的作法,恰好在 OpenAI 因 GPT-6.1 Astra 未過內部安全測試而取消發布、且身陷 Agent 資安訴訟的背景下,格外引人注目。

Google 內部的實際成果

Argon 已在 Google 內部跑了一陣子,官方分享了四個具體成果:

  • 量子演算法優化:幾分鐘內就把量子子程序的時空資源基準線提升 40%。
  • 資料中心記憶體優化:Argon Agent 分析全域遙測後自主套用記憶體優化,釋出 300 TiB 記憶體,預估最終省下 500 TiB~1 PiB。
  • C/C++ → Rust 大規模遷移:涵蓋 re2、libgav1 等核心函式庫,一路到 80 萬行以上的 Fuchsia Zircon 核心。
  • libgav1 影片解碼器:取代 3.2 萬行 SIMD 程式碼,生成的記憶體安全 Rust 版比原 Rust 移植快 2.7 倍,輸出完全一致。

第三方獨立評測怎麼說

Artificial Analysis 的獨立評估與官方說法大致相符,但多了一些冷靜的數字:

  • 智力指數(Intelligence Index)53 分,與 GPT-6 Astra 打平,領先 GPT-6.1 Sol 1 分——宣告 Google 重回「前沿前三」。
  • 單任務成本 $1.99(優惠價),僅為 GPT-6 Astra($3.26)的 60%;但優惠結束後會升到 $3.98,反而比 Astra 貴約 1.2 倍。
  • 在 AA-Omniscience 幻覺率測試中,Argon 幻覺率僅 15%,是高分模型中最低(GPT-6 Astra 為 51%)——代表它更傾向「承認不知道」而非瞎猜。

資安公司 Wiz 則透過「Scan for Good」計畫實測:Argon 在醫院通用的醫療軟體中找出一個先前其他前沿模型都漏掉的高危漏洞,並在無原始碼的黑盒滲透中,於攻擊面識別與 PoC 生成上明顯超越 Gemini 3.8 Flash Cyber。

業界反應與爭議

彭博社(Bloomberg)報導指出,Google 內部有部分員工對 Argon 抱持懷疑:benchmark 漂亮,但投入實際程式工作時表現不如預期,也對先前承諾 6 月發布卻取消的 Gemini 3.5 Pro 感到遺憾。Google 官方則回應,稱「Gemini 4 在程式方面表現不佳」的說法不準確,內部對其前沿能力存在「廣泛共識」。

整體而言,Argon 的發布讓外界認定 Google 正式重回前沿 AI 實驗室前三,尤其在 1M 輸出與資安防禦兩點上立下新標竿。

延伸閱讀


來源:Google 官方部落格、TechCrunch、Latent Space AINews、Artificial Analysis

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。

訂閱即表示同意收到 most.tw 電子報,隨時可一鍵退訂。

💬 有問題想討論?加 LINE 聯絡我

歡迎透過 LINE 官方帳號直接留言,我會盡快回覆你的問題。

加入 LINE 好友