Grok 4.7 在 2026 年 9 月 21 日上線:參數 2.1 兆、上下文 50 萬 token,API 價格維持 $2/$6 不漲,但第三方評測顯示它仍落後 GPT-6 與 Claude Fable 5.1。
這次發布的六個重點
xAI 在 2026 年 9 月 21 日(週一)正式推出 Grok 4.7,官方定位是「目前最強的 coding 與知識工作模型」。這不是一次小改版,而是一次架構級的更換;同時它也是 xAI 更名為 SpaceXAI(併入 SpaceX 之後的 AI 部門)之後的第一個旗艦模型發布。
| 項目 | Grok 4.7 | Grok 4.6(前代) |
|---|---|---|
| 參數規模 | 2.1 兆(Musk 公開數字) | 1.5 兆 |
| 上下文長度 | 500,000 token | 未對外公布 |
| 推理強度等級 | low / medium / high / xhigh | high |
| 輸入價格 | $2/百萬 token | $2/百萬 token |
| 輸出價格 | $6/百萬 token | $6/百萬 token |
| 推論速度 | 與 4.6 相同;另有 2 倍速 Fast 版 | 基準 |
| 上線平台 | Cursor、Grok Build、Grok App、xAI API、第三方 harness、模型路由、雲平台、GitHub Copilot | 同上 |
值得注意的是:這是旗艦模型世代交替時罕見的「不漲價」。過去兩年多數前沿模型換代都伴隨 token 單價上調,Grok 4.7 選擇把價格與推論速度壓在前代水準,另外提供一個 2 倍輸出速度、價格 2 倍的 Fast 版本,等於用「同價換能力」的方式搶開發者。
訓練與架構改了什麼
根據官方發布說明,Grok 4.7 的改動集中在三個方向:
- 更大的基礎模型:相較 Grok 4.6 使用新的、更大的 base model(2.1 兆參數,較前代增加約 40%)。
- 更長的強化學習(RL)訓練:這輪 RL 刻意加重「需要好幾小時才能完成」的難題比重,目標是讓模型在長任務上不要中途放棄、也不要胡亂收尾。
- 自我檢查與長上下文管理:官方強調 Grok 4.7 更擅長驗證自己的產出、管理更長的上下文,並且原生理解 Grok Bot 的 harness,因此在對話型任務與一般知識工作上表現更好。
另外,多家外媒報導指出,這一代模型在訓練時加入了 SpaceX 的工程資料作為補充訓練素材——這也是「SpaceXAI」這個新身分最直接的能力來源。官方同時提到 Grok 4.7 在產生文件與簡報上有明顯進步,這對「AI 幫你做投影片、寫報告」這類應用是關鍵。
官方 benchmark:幾乎全面進步
以下是官方公布的數據(皆為廠商自報,未經第三方驗證):
| 評測項目 | Grok 4.7 | Grok 4.6 | 同期競品 |
|---|---|---|---|
| CursorBench 4.0(長時程 coding) | 46.3% | 40.4% | GPT-5.6 Sol Max 41.7%、Claude Fable 5.1 51.8% |
| DeepSWE v1.1(high effort) | 71.0% | 65.2% | GPT-5.6 Sol Max 72.7% |
| Terminal-Bench 4.0(終端機長任務) | 38.0% | 20.3% | GPT-5.6 Sol Max 37.3%、Fable 5.1 57.9% |
| EEBench(電子工程) | 64.0% | 53.0% | GPT-5.6 Sol Max 39.4% |
| AA Briefcase v1.1(多小時辦公任務,Elo) | 1,657 | 1,546 | Fable 5.1 1,678 |
| GDPval(專業知識工作,Elo) | 1,695 | — | 最高為 Fable 5.1 的 1,735 |
| Harvey Legal Agent(法律工作) | 19.6% | 15.8% | GPT-5.6 Sol Max 僅 2.5% |
| HealthBench Professional(臨床推理) | 56.7% | 48.5% | GPT-5.6 Sol Max 60.5% |
幾個判讀重點:
- 進步幅度最大的是終端機與法律工作。Terminal-Bench 4.0 幾乎翻倍(20.3% → 38.0%),Harvey Legal Agent Benchmark 從 15.8% 跳到 19.6%,而且是這一組裡最高分——GPT-5.6 Sol Max 在法律代理任務上只有 2.5%。
- CursorBench 4.0 的官方說法是「同價位區間的成本效益前緣」。官方公開的圖表把「平均每任務成本、平均輸出 token、平均步數」三個維度並排,基準點是 Claude Sonnet 5(high 預設):30.8% 分數、每任務 $3.48、約 61,000 輸出 token、85 步。Fable 5.1 分數最高但每任務成本接近 $18;Grok 4.7 落在兩者之間。
- 但它沒有稱霸。官方自己的表格裡,AA Briefcase、GDPval 都輸給 Claude Fable 5.1,Clinical reasoning 輸給 GPT-5.6 Sol Max,DeepSWE 也小輸。
第三方評測:落差浮現
真正需要留意的是獨立評測與廠商數據之間的差距。
| 指標 | 廠商自報 | 第三方(Artificial Analysis 等) |
|---|---|---|
| 綜合智能指數(v4.3.2,10 項基準合成) | 未提供 | 46 分,中段班;Claude Fable 5.1 與 GPT-6 各 53 分 |
| Terminal-Bench 4.0 | 38.0% | 約 26%;GPT-6 Astra 60%、Claude Fable 5.1 55%、DeepSeek V4.1 Flash 27% |
同一個 Terminal-Bench 4.0,官方 38.0%、第三方量到約 26%,兩者差了 12 個百分點。這類落差通常來自 harness 設定、工具可用性、reasoning effort 與重試策略的不同,不必然是任何一方造假,但它意味著:在 agentic coding 這種長時程任務上,廠商自報數字與你的實際體驗可能有一段距離。對照組也很有意思——連價格極低的 DeepSeek V4.1 Flash(27%)在獨立量測中都略勝 Grok 4.7,顯示「便宜」不等於「同級」。
價格與實價計算
| 計費情境 | 輸入 | 快取輸入 | 輸出 |
|---|---|---|---|
| 標準請求(prompt < 200K token) | $2.00/M | $0.50/M | $6.00/M |
| 長上下文(prompt ≥ 200K token) | $4.00/M | $1.00/M | $12.00/M |
| Fast 版本(2 倍輸出速度) | $4.00/M | $1.00/M | $12.00/M |
幾個容易踩到的細節:
- 長上下文的加價是「整段請求」都算,不是只有超過 200K 的那一段。一個 agent 任務如果每次請求都塞滿 220K token,成本會直接翻倍。
- 美國區域端點(US regional endpoint)加收 10%。
- Fast 版本目前主要透過 Cursor 與 Grok Build 提供,不在公開 API 上。
- 若與同級競品比輸出單價:GPT-5.6 Sol 的 max 級距是 $20/M、Claude Fable 5.1 是 $50/M。Grok 4.7 的輸出價大約是前者的三分之一、後者的八分之一。
安全與資安:新的防護堆疊
Grok 4.7 換上了全新的 safeguard stack,官方強調這是他們測過「拒絕率與抗越獄最強」的一版:
- LatchBio 生物安全基準:62.4%,官方稱是該基準最高分。
- HackerBench v0.3(自家資安風險基準):只放行 3.3% 的高風險 dual-use prompt,同時很少誤擋合法的安全工作。
- xAI 也開始對特定資安合作夥伴提供邀請制的 red-team 能力存取權,用於防禦研究。
這件事與本站先前追蹤的 AI 資安事件形成對照:從 OpenAI 代理軍團攻擊 RubyGems、到 Gemini 自主駭入真實企業,模型在「防禦」與「攻擊」兩端的界線愈來愈需要明確的雙用途政策。Grok 4.7 的做法是把「資安能力」留在模型裡、但把紅隊工具收進邀請制,屬於相對保守的一條路線。
為什麼晚了?Musk 的期待管理
Grok 4.7 其實從 7 月底起至少延遲了五次才正式上線,發表當天 Musk 在 X 上定調它是「智能、速度與低成本的強力組合」,但在發布前幾天就已經先降溫,表示 Grok 4.7 應該「大致與 Anthropic 的 Claude Opus 5.0 同級」,而不是更新的 Opus 5.1,並坦言多模態表現仍需加強。他同時預告 Grok 4.8、4.9 與 Grok 5 的目標是攻上前沿第一。
這種「先降低預期、再用價格取勝」的路線,和 xAI 一貫策略一致:用「夠好、便宜、到處都有」對抗「最強、但更貴」。
對台灣開發者的三個實際建議
- 先當「第二意見」而不是「預設模型」。如果你的主力是 Claude Code 或 Codex,Grok 4.7 很適合拿來跑批次、重複性高的修改與 CI 修錯——同樣的工作量下成本只有前沿競品的零頭。若要換預設,先用 3 個代表性任務(一個 bug fix、一份文件、一個長研究任務)測「是否通過、需要多少修正、耗時、總成本」再決定。
- 注意長上下文與 agent 迴圈的帳單。agent 的每一次請求都會重新計費,加上提示工具費與 200K 門檻的整段加價,一個「10 次請求」的 agent 任務,成本可能是單次請求的 10 倍以上。要看的是「完成一件工作的總成本」,不是每百萬 token 的單價。
- 對 agentic coding 的自報分數打折。Terminal-Bench 4.0 的官方 38% 對上獨立量測的 26% 就是最好的例子。廠商數字可以用來「篩選要測哪些候選模型」,但你自己的工作流實測才是決定性依據。
Grok 4.7 這次真正的新聞點,其實不是「它變強了」,而是**「它變強了、但沒有變貴」**。在 agentic coding 開始吃掉大量 token 的 2026 年,這種「同價換能力」的世代更新,對每天燒 token 的開發者來說,比排行榜第一名更有感。
資料來源
- Introducing Grok 4.7 — x.ai 官方發布頁(規格、官方 benchmark、價格、安全基準)
- xAI launches Grok 4.7 at bargain prices, but benchmarks reveal a wide gap to Claude and GPT-6 — The Decoder(Artificial Analysis 綜合指數 46 vs 53、Terminal-Bench 獨立量測 26%)
- xAI Launches Grok 4.7. It’s Bigger, But Late to the AI Frontier Party — Decrypt(2.1 兆參數、延遲五次、SpaceX 工程資料、Musk 說法)
- Grok 4.7 Brings Big Coding Upgrades to Challenge Claude AI at Unchanged Pricing — Android Headlines(各項 benchmark 細節、Copilot 上架)
- Grok 4.7 Is Out: Features, Pricing & How to Try It — kingy.ai(快取與長上下文計價、實價計算範例)
- SpaceX AI Unveils Grok 4.7 — Tiger Brokers/TradingKey(與 GPT-5.6 Sol、Fable 5.1 的單價對照)
- Grok 4.7, Explained in 5 Points — Basenor(500K 上下文、四段推理等級)
