Anthropic 於 2026 年 9 月 22 日發布 Claude Opus 5.5,每百萬 token 輸入 $4、輸出 $20,比 Opus 5 便宜 20%,並在第三方 Artificial Analysis 智力指數以 58 分拿下 212 個模型中的第一名。同一天 OpenAI 也推出 GPT-6 Sol/Luna,API 價格直接砍半——這是一場發生在同一天的正面價格對決。
同一天,兩家實驗室同時出手
這一天很擠。Anthropic 端出 Claude 5.5 家族的第一個成員 Opus 5.5,OpenAI 則把 GPT-6 家族補上兩個小尺寸型號:GPT-6 Sol 與 GPT-6 Luna。兩邊發布時間只差約 20 分鐘,也各自宣布降價。
Anthropic 的官方說法很直接:Opus 5.5「在大多數工作上達到 Claude Fable 5.1 的水準,但執行成本比 Opus 5 低 40%」。這裡的 40% 不是單純的牌價降幅,而是把「每 token 更便宜」加上「完成同一個任務用更少 token」兩件事相乘後的結果;單純看牌價是降 20%。
OpenAI 那邊則是另一種打法。GPT-6 Astra 仍然是「最強」定位,Sol 與 Luna 負責把價格壓到日常可用的區間。官方公告寫得很清楚:Sol 與 Luna 的 API 價格比 GPT-5.6 的促銷價再降 50%。
Opus 5.5 的規格與定價
先把硬數字列出來。
| 項目 | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| 輸入(每 1M tokens) | $4 | $5 |
| 輸出(每 1M tokens) | $20 | $25 |
| 快取讀取 | $0.20 | $0.50 |
| 快取寫入 | $5 | $6.25 |
| 上下文視窗 | 1,000,000 tokens | 1,000,000 tokens |
| 最大輸出 | 128K(Batch 最高 300K) | 128K |
| 知識截止 | 2026 年 6 月 | — |
| Fast mode | $8/$40(最高 2.5 倍速) | — |
幾個容易被忽略的重點:
- 快取讀取降幅最大(-60%)。Anthropic 自己在公告裡強調,agentic coding 的成本大宗其實是 cache read 而不是 input/output,所以這一項降 60% 對實際帳單的影響遠大於牌價的 20%。
- Fast mode 是加價選項。$8/$40 是標準價的兩倍,換來最高 2.5 倍生成速度,目前是研究預覽狀態。
- 輸出速度比 Opus 5 快 30% 以上。
- 思考模式不能關。Opus 5.5 預設強制開啟 adaptive thinking,傳入
thinking: {"type": "disabled"}會直接回 400 錯誤。開發者只能改用effort參數(low/medium/high/xhigh/max)來控制思考深度與成本,而官方預設值從 Opus 5 的high降為medium。
模型 ID 在 Claude API、Vertex AI、Microsoft Foundry 都是 claude-opus-5-5,Amazon Bedrock 上是 anthropic.claude-opus-5-5,發布當天已在 AWS、Google Cloud、Azure 三個雲同步上架。
Benchmark 對照:官方自報數字怎麼看
Anthropic 公布的對照表如下(除註明外皆為 adaptive thinking 的 max effort):
| 基準測試 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| FrontierCode v1.1 (Main) | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — | 41.7% |
| GDPval-AA v2.1(Elo) | 1846 | 1735 | 1708 | 1542 | 1588 |
| AutomationBench(Zapier) | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| Humanity’s Last Exam(含工具) | 67.7% | 65.6% | 63.6% | 57.2% | — |
| OSWorld 2.0(partial) | 81.8% | 80.7% | 74.0% | — | — |
| Chartography(含工具) | 89.0% | 88.4% | 83.4% | — | — |
魔鬼藏在腳註裡。有三件事必須一起讀:
- Terminal-Bench 4.0 的比較不對等。Anthropic 自己在腳註說明:Opus 5.5 的 66.4% 是 xhigh effort,而 GPT-6 Astra 的 57.9% 是 high effort——而且 Astra 那個數字是 OpenAI 自己報告的,不是 Anthropic 實測。
- Astra 在兩項上仍然贏。Zapier 的 AutomationBench(41.4% vs 40.0%)與 Terminal-Bench-Science 0.1(64.6% vs 58.7%)都是 GPT-6 Astra 較高。Anthropic 也承認 AutomationBench 的跑分沒有 fallback、安全機制一介入就算失敗,實際使用會比這個分數好。
- Anthropic 自己說分數已經不太有參考價值。公告原文寫著:「在這種能力水準上,我們發現 benchmark 的差距已經不太能可靠反映真實世界的差異。」
第三方評測:58 分登頂,但「每個任務多少錢」是另一回事
Artificial Analysis 的獨立測試是目前最常被引用的第三方指標。它的 Intelligence Index v4.3.2 由 10 項評測組成(AA-Briefcase、GDPval-AA、AutomationBench-AA、Terminal-Bench 4.0、SciCode、HLE、GDP.pdf、CritPt、AA-Omniscience、AA-LCR)。
結果是:Opus 5.5 以 58 分排在 212 個模型第 1 名,第二名是 GPT-6 Astra 與 Claude Fable 5.1(皆 53 分)。
但在同一個頁面上,另一個數字更值得注意:Opus 5.5 在跑完整套智力評測時總共產出了 2.6 億個輸出 token,而同等價位區間的推理模型中位數是 8,800 萬。Artificial Analysis 把它的 verbosity 標示為「非常囉唆」。
這直接反映在成本上。多個第三方成本分析指出,在 max effort 下 Opus 5.5 平均每個任務要輸出約 11.9 萬個 token,GPT-6 Astra 則約 2.7 萬個——即使 Opus 5.5 每 token 牌價只有 Astra 的四成,換算下來 Opus 5.5 每個任務的輸出成本約 $2.38,反而比 Astra 的 $1.35 更貴。
也就是說:「單價便宜」不等於「任務便宜」。這正是 2026 年選型最容易踩的坑。Anthropic 的 40% 成本降幅成立的前提是「維持預設的 medium effort」,一旦為了追分數開到 max,成本優勢會反轉。
OpenAI 同日的反擊:GPT-6 Sol 與 Luna
OpenAI 選擇在同一天把 GPT-6 家族補齊,並把價格戰打在「規模」上。
| 模型 | 輸入(每 1M) | 輸出(每 1M) | 相對前代 |
|---|---|---|---|
| GPT-6 Sol | $2 | $10 | 比 GPT-5.6 Sol 的 $4/$20 降 50% |
| GPT-6 Luna | $0.10 | $0.50 | 比 GPT-5.6 Luna 的 $0.20/$1.20 降 50% |
換算下來,GPT-6 Luna 的輸出價格是 Opus 5.5 的四十分之一。這個級距差距不是同一個市場,而是兩種完全不同的用法:Sol 打複雜 coding 與專業工作,Luna 打高吞吐、目標明確的日常任務。
OpenAI 公布的幾個對比數字:
- AutomationBench:GPT-6 Sol(xhigh)拿到 33.2%,每個任務 $0.27;Claude Opus 5(max)26.9%,每任務成本是 Sol 的 11.1 倍。
- Agents’ Last Exam:Sol(max)56.4%,OpenAI 稱每任務成本比 Claude Opus 5 低 60%。
- DeepSWE v1.1:Sol(max)68.8%,與 Claude Fable 5(xhigh)的 69.9% 只差 1.1 個百分點,但每任務成本低約 80%。
- 事實性:OpenAI 說 Sol 的錯誤率約為前代的一半。
- 快取:GPT-6 世代改善 prompt caching,快取輸入讀取折扣 90%,並新增 Prompt Caching Dashboard 讓開發者檢查快取命中率。
可用性方面,Sol 與 Luna 先在 ChatGPT Work 與 Codex 上線(Plus、Pro、Business、Enterprise、Edu),Free 與 Go 用戶可在桌面版用到 Luna,但還沒進一般 ChatGPT 對話。API 型號是 gpt-6-sol 與 gpt-6-luna。
安全、合規與那些「不能做」的事
Opus 5.5 是 Anthropic 在發表「我們必須為前沿配速(pacing the frontier)」主張之後的第一個模型,也是第一個在發布前交給外部評估機構測試的版本,包括 Frontier Design 與 METR。Anthropic 表示 Opus 5.5 在自家的自動化行為審計上拿到「歷來最高分」,比 Opus 5 更不容易做出難以回復的動作、也更抗 prompt injection。
但代價是一連串限制,這些對開發者比 benchmark 更重要:
- 資安任務會被轉走。Anthropic 明確說多數 cybersecurity 任務會改由 Claude Opus 4.8 執行,生物學與前沿 LLM 開發任務則交給 Opus 5。也就是你要做資安研究,拿到的可能不是 Opus 5.5 的答案。
- 強制工具調用不能用。
tool_choice指定any或特定工具會回 400,必須改用auto搭配 Strict Tool Use 或 Structured Outputs。 - 工具之間的敘述文字消失了。模型在工具調用之間的過渡文字現在被包進 thinking block,預設
display: "omitted"會是空的,依賴這段文字顯示進度的前端會在工具調用期間「一片安靜」。 - 思考區塊不能跨模型接力。Opus 5.5 的 thinking block 無法傳給 Sonnet/Haiku 繼續對話。
- 反蒸餾機制。Opus 5.5 與 Fable 5.1 都啟用 preserved thinking,禁止 API 使用者修改 Claude 的既有 context 來抽取推理過程,適用於 2026 年 8 月 31 日之後建立的 API 帳號。
- 歐盟 AI Act 浮水印。與 Fable 5.1 相同,輸出帶有浮水印措施。
另外官方宣布提高 Pro、Max、Team 與 seat-based Enterprise 方案的 5 小時用量上限,並提供「可儲存的 rate limit reset」(存起來,想用再用的重置額度)。Claude Sonnet 5.5 與 Haiku 5.5 會在接下來幾週跟上。
這一輪價格戰真正改變的事
把兩份公告放在一起看,訊號很清楚:前沿模型的定價權正在被快速侵蝕。
- Anthropic 用「智力登頂 + 降價 20%」鎖定高複雜度的 agentic coding 與知識工作。
- OpenAI 用「價格砍半 + 快取 90% 折扣」鎖定高吞吐的自動化任務。
- 兩邊的公告裡,最常見的計價單位已經不是「每百萬 token」,而是**「每個任務多少錢」(cost per solved task)**。OpenAI 的 AutomationBench 圖表直接把 x 軸畫成 cost per task,Anthropic 也改用「FrontierCode 每任務成本是 Astra 的五分之一」這種說法。
對繁體中文市場的開發者來說,實務結論有三條:
- 先量你自己的任務,再選模型。同一個任務在不同模型上的 token 消耗可以差 4 倍以上,只比牌價一定會算錯帳。
- 預設 effort 才是省錢關鍵。Opus 5.5 的官方成本優勢建立在
medium;要開到xhigh/max之前,先用小樣本量一次每任務成本。 - 遷移前先看 breaking changes。
tool_choice、thinking 無法關閉、thinking block 不可跨模型這三項,是既有系統升級最容易炸的地方。
延伸閱讀
- OpenAI GPT-6 Astra 正式發布 — 這一輪所有比較的基準點,Astra 的完整規格與定價背景。
- Grok 4.7 發布:2.1 兆參數、價格維持 $2/$6 不漲 — 同一個月的另一場旗艦發布,可以看到三方定價策略的差異。
- DeepSeek V4.1-Flash 發布 — 開源側把 KV Cache 壓到 1/8、離峰快取輸入每百萬 token 只要 $0.003 的路線。
- AI 三巨頭罕見同桌談安全:AEF-1 第三方評估標準出爐 — 為什麼現在每一家發布都要先講外部評估機構。
- Anthropic 揭發工業級蒸餾攻擊 — 理解 preserved thinking 這類反蒸餾機制為什麼會出現。
原始來源
- Anthropic 官方公告:Introducing Claude Opus 5.5(2026-09-22)
- OpenAI 官方公告:Introducing GPT-6 Sol and Luna(2026-09-22)
- Artificial Analysis:Claude Opus 5.5 Intelligence, Performance & Price Analysis
- TechCrunch:Anthropic releases Opus 5.5 with lower prices and Fable-level performance
- TechCrunch:OpenAI launches GPT-6 Sol and Luna, boasting lower cost and fewer mistakes
- Reuters:OpenAI expands GPT-6 lineup with cheaper Sol and Luna models
註:本文的官方 benchmark 數字來自 Anthropic 與 OpenAI 各自的公告(廠商自報),其中部分對照數據由對方引用、並非同一 harness 實測;Artificial Analysis 的智力指數與 token 用量為獨立第三方測量。文中已逐項標示來源類型,選型時建議以自家工作負載實測為準。
