Grok 4.7 發布:2.1 兆參數、50 萬上下文、價格維持 $2/$6 不漲,但第三方評測揭露與 GPT-6、Claude Fable 5.1 的實際落差(2026)

xAI(現名 SpaceXAI)在 2026 年 9 月 21 日正式發布 Grok 4.7,參數從 1.5 兆放大到 2.1 兆、上下文拉到 50 萬 token、新增四段推理強度,API 價格維持 $2/百萬輸入 token、$6/百萬輸出 token 不變,並同步上架 Cursor、Grok Build、Copilot 與多家模型路由。官方公布的 CursorBench 4.0 得分 46.3%(前代 40.4%)、Terminal-Bench 4.0 從 20.3% 跳到 38.0%,但獨立評測機構 Artificial Analysis 的綜合智能指數只給 46 分,落後 Claude Fable 5.1 與 GPT-6 的 53 分,Terminal-Bench 4.0 的獨立量測也只有 26%。本文整理完整規格、官方與第三方 benchmark 對照、實價計算範例、新安全防護堆疊,以及它對台灣開發者的實際意義。

  • Dennis
  • 7 分鐘閱讀
Grok 4.7 發布:2.1 兆參數、50 萬上下文、價格維持 $2/$6 不漲,但第三方評測揭露與 GPT-6、Claude Fable 5.1 的實際落差(2026)

Grok 4.7 在 2026 年 9 月 21 日上線:參數 2.1 兆、上下文 50 萬 token,API 價格維持 $2/$6 不漲,但第三方評測顯示它仍落後 GPT-6 與 Claude Fable 5.1。

這次發布的六個重點

xAI 在 2026 年 9 月 21 日(週一)正式推出 Grok 4.7,官方定位是「目前最強的 coding 與知識工作模型」。這不是一次小改版,而是一次架構級的更換;同時它也是 xAI 更名為 SpaceXAI(併入 SpaceX 之後的 AI 部門)之後的第一個旗艦模型發布。

項目Grok 4.7Grok 4.6(前代)
參數規模2.1 兆(Musk 公開數字)1.5 兆
上下文長度500,000 token未對外公布
推理強度等級low / medium / high / xhighhigh
輸入價格$2/百萬 token$2/百萬 token
輸出價格$6/百萬 token$6/百萬 token
推論速度與 4.6 相同;另有 2 倍速 Fast 版基準
上線平台Cursor、Grok Build、Grok App、xAI API、第三方 harness、模型路由、雲平台、GitHub Copilot同上

值得注意的是:這是旗艦模型世代交替時罕見的「不漲價」。過去兩年多數前沿模型換代都伴隨 token 單價上調,Grok 4.7 選擇把價格與推論速度壓在前代水準,另外提供一個 2 倍輸出速度、價格 2 倍的 Fast 版本,等於用「同價換能力」的方式搶開發者。

訓練與架構改了什麼

根據官方發布說明,Grok 4.7 的改動集中在三個方向:

  1. 更大的基礎模型:相較 Grok 4.6 使用新的、更大的 base model(2.1 兆參數,較前代增加約 40%)。
  2. 更長的強化學習(RL)訓練:這輪 RL 刻意加重「需要好幾小時才能完成」的難題比重,目標是讓模型在長任務上不要中途放棄、也不要胡亂收尾。
  3. 自我檢查與長上下文管理:官方強調 Grok 4.7 更擅長驗證自己的產出、管理更長的上下文,並且原生理解 Grok Bot 的 harness,因此在對話型任務與一般知識工作上表現更好。

另外,多家外媒報導指出,這一代模型在訓練時加入了 SpaceX 的工程資料作為補充訓練素材——這也是「SpaceXAI」這個新身分最直接的能力來源。官方同時提到 Grok 4.7 在產生文件與簡報上有明顯進步,這對「AI 幫你做投影片、寫報告」這類應用是關鍵。

官方 benchmark:幾乎全面進步

以下是官方公布的數據(皆為廠商自報,未經第三方驗證):

評測項目Grok 4.7Grok 4.6同期競品
CursorBench 4.0(長時程 coding)46.3%40.4%GPT-5.6 Sol Max 41.7%、Claude Fable 5.1 51.8%
DeepSWE v1.1(high effort)71.0%65.2%GPT-5.6 Sol Max 72.7%
Terminal-Bench 4.0(終端機長任務)38.0%20.3%GPT-5.6 Sol Max 37.3%、Fable 5.1 57.9%
EEBench(電子工程)64.0%53.0%GPT-5.6 Sol Max 39.4%
AA Briefcase v1.1(多小時辦公任務,Elo)1,6571,546Fable 5.1 1,678
GDPval(專業知識工作,Elo)1,695最高為 Fable 5.1 的 1,735
Harvey Legal Agent(法律工作)19.6%15.8%GPT-5.6 Sol Max 僅 2.5%
HealthBench Professional(臨床推理)56.7%48.5%GPT-5.6 Sol Max 60.5%

幾個判讀重點:

  • 進步幅度最大的是終端機與法律工作。Terminal-Bench 4.0 幾乎翻倍(20.3% → 38.0%),Harvey Legal Agent Benchmark 從 15.8% 跳到 19.6%,而且是這一組裡最高分——GPT-5.6 Sol Max 在法律代理任務上只有 2.5%。
  • CursorBench 4.0 的官方說法是「同價位區間的成本效益前緣」。官方公開的圖表把「平均每任務成本、平均輸出 token、平均步數」三個維度並排,基準點是 Claude Sonnet 5(high 預設):30.8% 分數、每任務 $3.48、約 61,000 輸出 token、85 步。Fable 5.1 分數最高但每任務成本接近 $18;Grok 4.7 落在兩者之間。
  • 但它沒有稱霸。官方自己的表格裡,AA Briefcase、GDPval 都輸給 Claude Fable 5.1,Clinical reasoning 輸給 GPT-5.6 Sol Max,DeepSWE 也小輸。

第三方評測:落差浮現

真正需要留意的是獨立評測與廠商數據之間的差距

指標廠商自報第三方(Artificial Analysis 等)
綜合智能指數(v4.3.2,10 項基準合成)未提供46 分,中段班;Claude Fable 5.1 與 GPT-6 各 53 分
Terminal-Bench 4.038.0%約 26%;GPT-6 Astra 60%、Claude Fable 5.1 55%、DeepSeek V4.1 Flash 27%

同一個 Terminal-Bench 4.0,官方 38.0%、第三方量到約 26%,兩者差了 12 個百分點。這類落差通常來自 harness 設定、工具可用性、reasoning effort 與重試策略的不同,不必然是任何一方造假,但它意味著:在 agentic coding 這種長時程任務上,廠商自報數字與你的實際體驗可能有一段距離。對照組也很有意思——連價格極低的 DeepSeek V4.1 Flash(27%)在獨立量測中都略勝 Grok 4.7,顯示「便宜」不等於「同級」。

價格與實價計算

計費情境輸入快取輸入輸出
標準請求(prompt < 200K token)$2.00/M$0.50/M$6.00/M
長上下文(prompt ≥ 200K token)$4.00/M$1.00/M$12.00/M
Fast 版本(2 倍輸出速度)$4.00/M$1.00/M$12.00/M

幾個容易踩到的細節:

  • 長上下文的加價是「整段請求」都算,不是只有超過 200K 的那一段。一個 agent 任務如果每次請求都塞滿 220K token,成本會直接翻倍。
  • 美國區域端點(US regional endpoint)加收 10%
  • Fast 版本目前主要透過 Cursor 與 Grok Build 提供,不在公開 API 上。
  • 若與同級競品比輸出單價:GPT-5.6 Sol 的 max 級距是 $20/M、Claude Fable 5.1 是 $50/M。Grok 4.7 的輸出價大約是前者的三分之一、後者的八分之一。

安全與資安:新的防護堆疊

Grok 4.7 換上了全新的 safeguard stack,官方強調這是他們測過「拒絕率與抗越獄最強」的一版:

  • LatchBio 生物安全基準:62.4%,官方稱是該基準最高分。
  • HackerBench v0.3(自家資安風險基準):只放行 3.3% 的高風險 dual-use prompt,同時很少誤擋合法的安全工作。
  • xAI 也開始對特定資安合作夥伴提供邀請制的 red-team 能力存取權,用於防禦研究。

這件事與本站先前追蹤的 AI 資安事件形成對照:從 OpenAI 代理軍團攻擊 RubyGems、到 Gemini 自主駭入真實企業,模型在「防禦」與「攻擊」兩端的界線愈來愈需要明確的雙用途政策。Grok 4.7 的做法是把「資安能力」留在模型裡、但把紅隊工具收進邀請制,屬於相對保守的一條路線。

為什麼晚了?Musk 的期待管理

Grok 4.7 其實從 7 月底起至少延遲了五次才正式上線,發表當天 Musk 在 X 上定調它是「智能、速度與低成本的強力組合」,但在發布前幾天就已經先降溫,表示 Grok 4.7 應該「大致與 Anthropic 的 Claude Opus 5.0 同級」,而不是更新的 Opus 5.1,並坦言多模態表現仍需加強。他同時預告 Grok 4.8、4.9 與 Grok 5 的目標是攻上前沿第一。

這種「先降低預期、再用價格取勝」的路線,和 xAI 一貫策略一致:用「夠好、便宜、到處都有」對抗「最強、但更貴」

對台灣開發者的三個實際建議

  1. 先當「第二意見」而不是「預設模型」。如果你的主力是 Claude Code 或 Codex,Grok 4.7 很適合拿來跑批次、重複性高的修改與 CI 修錯——同樣的工作量下成本只有前沿競品的零頭。若要換預設,先用 3 個代表性任務(一個 bug fix、一份文件、一個長研究任務)測「是否通過、需要多少修正、耗時、總成本」再決定。
  2. 注意長上下文與 agent 迴圈的帳單。agent 的每一次請求都會重新計費,加上提示工具費與 200K 門檻的整段加價,一個「10 次請求」的 agent 任務,成本可能是單次請求的 10 倍以上。要看的是「完成一件工作的總成本」,不是每百萬 token 的單價。
  3. 對 agentic coding 的自報分數打折。Terminal-Bench 4.0 的官方 38% 對上獨立量測的 26% 就是最好的例子。廠商數字可以用來「篩選要測哪些候選模型」,但你自己的工作流實測才是決定性依據。

Grok 4.7 這次真正的新聞點,其實不是「它變強了」,而是**「它變強了、但沒有變貴」**。在 agentic coding 開始吃掉大量 token 的 2026 年,這種「同價換能力」的世代更新,對每天燒 token 的開發者來說,比排行榜第一名更有感。

資料來源

延伸閱讀

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。

💬 有問題想討論?加 LINE 聯絡我

歡迎透過 LINE 官方帳號直接留言,我會盡快回覆你的問題。

加入 LINE 好友