Claude Opus 5.5 正式發布:Artificial Analysis 智力指數 58 分登頂、比 Opus 5 便宜 20%——同一天 OpenAI 把 GPT-6 Sol/Luna 價格砍半(2026)

Anthropic 在 2026 年 9 月 22 日發布 Claude Opus 5.5,官方定價每百萬 token 輸入 $4、輸出 $20,比 Opus 5 便宜 20%,快取讀取更降價 60%,並在 Artificial Analysis 智力指數以 58 分拿下 212 個模型中的第一名。同一天 OpenAI 推出 GPT-6 Sol 與 Luna,API 價格直接砍半。本文整理兩家旗艦的完整定價、benchmark 對照,以及第三方評測揭露的關鍵落差:在 max effort 下,Opus 5.5 因為輸出量太大,單一任務成本反而比 GPT-6 Astra 更貴。

  • Dennis
  • 8 分鐘閱讀
Claude Opus 5.5 正式發布:Artificial Analysis 智力指數 58 分登頂、比 Opus 5 便宜 20%——同一天 OpenAI 把 GPT-6 Sol/Luna 價格砍半(2026)

Anthropic 於 2026 年 9 月 22 日發布 Claude Opus 5.5,每百萬 token 輸入 $4、輸出 $20,比 Opus 5 便宜 20%,並在第三方 Artificial Analysis 智力指數以 58 分拿下 212 個模型中的第一名。同一天 OpenAI 也推出 GPT-6 Sol/Luna,API 價格直接砍半——這是一場發生在同一天的正面價格對決。

同一天,兩家實驗室同時出手

這一天很擠。Anthropic 端出 Claude 5.5 家族的第一個成員 Opus 5.5,OpenAI 則把 GPT-6 家族補上兩個小尺寸型號:GPT-6 Sol 與 GPT-6 Luna。兩邊發布時間只差約 20 分鐘,也各自宣布降價。

Anthropic 的官方說法很直接:Opus 5.5「在大多數工作上達到 Claude Fable 5.1 的水準,但執行成本比 Opus 5 低 40%」。這裡的 40% 不是單純的牌價降幅,而是把「每 token 更便宜」加上「完成同一個任務用更少 token」兩件事相乘後的結果;單純看牌價是降 20%。

OpenAI 那邊則是另一種打法。GPT-6 Astra 仍然是「最強」定位,Sol 與 Luna 負責把價格壓到日常可用的區間。官方公告寫得很清楚:Sol 與 Luna 的 API 價格比 GPT-5.6 的促銷價再降 50%

Opus 5.5 的規格與定價

先把硬數字列出來。

項目Claude Opus 5.5Claude Opus 5
輸入(每 1M tokens)$4$5
輸出(每 1M tokens)$20$25
快取讀取$0.20$0.50
快取寫入$5$6.25
上下文視窗1,000,000 tokens1,000,000 tokens
最大輸出128K(Batch 最高 300K)128K
知識截止2026 年 6 月
Fast mode$8/$40(最高 2.5 倍速)

幾個容易被忽略的重點:

  • 快取讀取降幅最大(-60%)。Anthropic 自己在公告裡強調,agentic coding 的成本大宗其實是 cache read 而不是 input/output,所以這一項降 60% 對實際帳單的影響遠大於牌價的 20%。
  • Fast mode 是加價選項。$8/$40 是標準價的兩倍,換來最高 2.5 倍生成速度,目前是研究預覽狀態。
  • 輸出速度比 Opus 5 快 30% 以上
  • 思考模式不能關。Opus 5.5 預設強制開啟 adaptive thinking,傳入 thinking: {"type": "disabled"} 會直接回 400 錯誤。開發者只能改用 effort 參數(low/medium/high/xhigh/max)來控制思考深度與成本,而官方預設值從 Opus 5 的 high 降為 medium

模型 ID 在 Claude API、Vertex AI、Microsoft Foundry 都是 claude-opus-5-5,Amazon Bedrock 上是 anthropic.claude-opus-5-5,發布當天已在 AWS、Google Cloud、Azure 三個雲同步上架。

Benchmark 對照:官方自報數字怎麼看

Anthropic 公布的對照表如下(除註明外皆為 adaptive thinking 的 max effort):

基準測試Opus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Terminal-Bench 4.066.4%55.8%52.3%57.9%37.3%
FrontierCode v1.1 (Main)54.4%50.3%48.0%53.3%47.5%
CursorBench 4.057.8%51.8%46.6%41.7%
GDPval-AA v2.1(Elo)18461735170815421588
AutomationBench(Zapier)40.0%31.4%26.9%41.4%28.8%
Terminal-Bench-Science 0.158.7%52.6%29.0%64.6%22.4%
Humanity’s Last Exam(含工具)67.7%65.6%63.6%57.2%
OSWorld 2.0(partial)81.8%80.7%74.0%
Chartography(含工具)89.0%88.4%83.4%

魔鬼藏在腳註裡。有三件事必須一起讀:

  1. Terminal-Bench 4.0 的比較不對等。Anthropic 自己在腳註說明:Opus 5.5 的 66.4% 是 xhigh effort,而 GPT-6 Astra 的 57.9% 是 high effort——而且 Astra 那個數字是 OpenAI 自己報告的,不是 Anthropic 實測。
  2. Astra 在兩項上仍然贏。Zapier 的 AutomationBench(41.4% vs 40.0%)與 Terminal-Bench-Science 0.1(64.6% vs 58.7%)都是 GPT-6 Astra 較高。Anthropic 也承認 AutomationBench 的跑分沒有 fallback、安全機制一介入就算失敗,實際使用會比這個分數好。
  3. Anthropic 自己說分數已經不太有參考價值。公告原文寫著:「在這種能力水準上,我們發現 benchmark 的差距已經不太能可靠反映真實世界的差異。」

第三方評測:58 分登頂,但「每個任務多少錢」是另一回事

Artificial Analysis 的獨立測試是目前最常被引用的第三方指標。它的 Intelligence Index v4.3.2 由 10 項評測組成(AA-Briefcase、GDPval-AA、AutomationBench-AA、Terminal-Bench 4.0、SciCode、HLE、GDP.pdf、CritPt、AA-Omniscience、AA-LCR)。

結果是:Opus 5.5 以 58 分排在 212 個模型第 1 名,第二名是 GPT-6 Astra 與 Claude Fable 5.1(皆 53 分)。

但在同一個頁面上,另一個數字更值得注意:Opus 5.5 在跑完整套智力評測時總共產出了 2.6 億個輸出 token,而同等價位區間的推理模型中位數是 8,800 萬。Artificial Analysis 把它的 verbosity 標示為「非常囉唆」。

這直接反映在成本上。多個第三方成本分析指出,在 max effort 下 Opus 5.5 平均每個任務要輸出約 11.9 萬個 token,GPT-6 Astra 則約 2.7 萬個——即使 Opus 5.5 每 token 牌價只有 Astra 的四成,換算下來 Opus 5.5 每個任務的輸出成本約 $2.38,反而比 Astra 的 $1.35 更貴

也就是說:「單價便宜」不等於「任務便宜」。這正是 2026 年選型最容易踩的坑。Anthropic 的 40% 成本降幅成立的前提是「維持預設的 medium effort」,一旦為了追分數開到 max,成本優勢會反轉。

OpenAI 同日的反擊:GPT-6 Sol 與 Luna

OpenAI 選擇在同一天把 GPT-6 家族補齊,並把價格戰打在「規模」上。

模型輸入(每 1M)輸出(每 1M)相對前代
GPT-6 Sol$2$10比 GPT-5.6 Sol 的 $4/$20 降 50%
GPT-6 Luna$0.10$0.50比 GPT-5.6 Luna 的 $0.20/$1.20 降 50%

換算下來,GPT-6 Luna 的輸出價格是 Opus 5.5 的四十分之一。這個級距差距不是同一個市場,而是兩種完全不同的用法:Sol 打複雜 coding 與專業工作,Luna 打高吞吐、目標明確的日常任務。

OpenAI 公布的幾個對比數字:

  • AutomationBench:GPT-6 Sol(xhigh)拿到 33.2%,每個任務 $0.27;Claude Opus 5(max)26.9%,每任務成本是 Sol 的 11.1 倍
  • Agents’ Last Exam:Sol(max)56.4%,OpenAI 稱每任務成本比 Claude Opus 5 低 60%。
  • DeepSWE v1.1:Sol(max)68.8%,與 Claude Fable 5(xhigh)的 69.9% 只差 1.1 個百分點,但每任務成本低約 80%。
  • 事實性:OpenAI 說 Sol 的錯誤率約為前代的一半。
  • 快取:GPT-6 世代改善 prompt caching,快取輸入讀取折扣 90%,並新增 Prompt Caching Dashboard 讓開發者檢查快取命中率。

可用性方面,Sol 與 Luna 先在 ChatGPT Work 與 Codex 上線(Plus、Pro、Business、Enterprise、Edu),Free 與 Go 用戶可在桌面版用到 Luna,但還沒進一般 ChatGPT 對話。API 型號是 gpt-6-solgpt-6-luna

安全、合規與那些「不能做」的事

Opus 5.5 是 Anthropic 在發表「我們必須為前沿配速(pacing the frontier)」主張之後的第一個模型,也是第一個在發布前交給外部評估機構測試的版本,包括 Frontier Design 與 METR。Anthropic 表示 Opus 5.5 在自家的自動化行為審計上拿到「歷來最高分」,比 Opus 5 更不容易做出難以回復的動作、也更抗 prompt injection。

但代價是一連串限制,這些對開發者比 benchmark 更重要:

  • 資安任務會被轉走。Anthropic 明確說多數 cybersecurity 任務會改由 Claude Opus 4.8 執行,生物學與前沿 LLM 開發任務則交給 Opus 5。也就是你要做資安研究,拿到的可能不是 Opus 5.5 的答案。
  • 強制工具調用不能用tool_choice 指定 any 或特定工具會回 400,必須改用 auto 搭配 Strict Tool Use 或 Structured Outputs。
  • 工具之間的敘述文字消失了。模型在工具調用之間的過渡文字現在被包進 thinking block,預設 display: "omitted" 會是空的,依賴這段文字顯示進度的前端會在工具調用期間「一片安靜」。
  • 思考區塊不能跨模型接力。Opus 5.5 的 thinking block 無法傳給 Sonnet/Haiku 繼續對話。
  • 反蒸餾機制。Opus 5.5 與 Fable 5.1 都啟用 preserved thinking,禁止 API 使用者修改 Claude 的既有 context 來抽取推理過程,適用於 2026 年 8 月 31 日之後建立的 API 帳號。
  • 歐盟 AI Act 浮水印。與 Fable 5.1 相同,輸出帶有浮水印措施。

另外官方宣布提高 Pro、Max、Team 與 seat-based Enterprise 方案的 5 小時用量上限,並提供「可儲存的 rate limit reset」(存起來,想用再用的重置額度)。Claude Sonnet 5.5 與 Haiku 5.5 會在接下來幾週跟上。

這一輪價格戰真正改變的事

把兩份公告放在一起看,訊號很清楚:前沿模型的定價權正在被快速侵蝕

  • Anthropic 用「智力登頂 + 降價 20%」鎖定高複雜度的 agentic coding 與知識工作。
  • OpenAI 用「價格砍半 + 快取 90% 折扣」鎖定高吞吐的自動化任務。
  • 兩邊的公告裡,最常見的計價單位已經不是「每百萬 token」,而是**「每個任務多少錢」(cost per solved task)**。OpenAI 的 AutomationBench 圖表直接把 x 軸畫成 cost per task,Anthropic 也改用「FrontierCode 每任務成本是 Astra 的五分之一」這種說法。

對繁體中文市場的開發者來說,實務結論有三條:

  1. 先量你自己的任務,再選模型。同一個任務在不同模型上的 token 消耗可以差 4 倍以上,只比牌價一定會算錯帳。
  2. 預設 effort 才是省錢關鍵。Opus 5.5 的官方成本優勢建立在 medium;要開到 xhighmax 之前,先用小樣本量一次每任務成本。
  3. 遷移前先看 breaking changestool_choice、thinking 無法關閉、thinking block 不可跨模型這三項,是既有系統升級最容易炸的地方。

延伸閱讀

原始來源

註:本文的官方 benchmark 數字來自 Anthropic 與 OpenAI 各自的公告(廠商自報),其中部分對照數據由對方引用、並非同一 harness 實測;Artificial Analysis 的智力指數與 token 用量為獨立第三方測量。文中已逐項標示來源類型,選型時建議以自家工作負載實測為準。

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。

💬 有問題想討論?加 LINE 聯絡我

歡迎透過 LINE 官方帳號直接留言,我會盡快回覆你的問題。

加入 LINE 好友