Claude Sonnet 5.5 正式發布:Terminal-Bench 4.0 拿 70.6% 反超 Opus 5.5、價格維持每百萬 $2/$10,Anthropic 宣稱每任務成本再降 30%(2026)

Anthropic 於 2026 年 9 月 28 日發布 Claude Sonnet 5.5,定價維持每百萬 token 輸入 $2、輸出 $10,只有 Opus 5.5 的一半,卻在 Terminal-Bench 4.0 以官方 70.6% 反超 Opus 5.5 的 66.4%,Artificial Analysis 智力指數 56 分排第 3。本文整理完整規格、benchmark 對照、$0.20 快取讀取與 Batch 半價等定價細節、官方「每任務成本降 30%」的三個機制,以及第三方實測揭露的最大陷阱:開到 Max effort 時單任務成本 $7.60,反而比 Opus 5.5 更貴。

  • Dennis
  • 8 分鐘閱讀
Claude Sonnet 5.5 正式發布:Terminal-Bench 4.0 拿 70.6% 反超 Opus 5.5、價格維持每百萬 $2/$10,Anthropic 宣稱每任務成本再降 30%(2026)

Anthropic 於 2026 年 9 月 28 日發布 Claude Sonnet 5.5:官方定價維持每百萬 token 輸入 $2、輸出 $10 不漲(僅 Opus 5.5 的一半),但在 Terminal-Bench 4.0 以官方公布的 70.6% 反超 Opus 5.5 的 66.4%,AI 寫程式與 Agent 任務的能力首次由中階型號拿下。這是 Claude 5.5 世代從旗艦往主力下放的第一張牌。

為什麼這次的 Sonnet 發布比以往重要

過去 Anthropic 的節奏是「Opus 先發、Sonnet 幾週後跟上」,Sonnet 的角色一直是「便宜的妥協版」。2026 年 9 月 22 日的 Opus 5.5 公告裡也埋了伏筆:「Claude Sonnet 5.5 與 Haiku 5.5 會在接下來幾週跟上」。

六天後,Sonnet 5.5 登場,但這次的定位不太一樣。在 Anthropic 歷來最強調「Agent 能不能自己完成一整段工作」的幾項評測上,Sonnet 5.5 不只是縮小了落差,而是在部分項目直接超車。對每天要跑 Claude Code、CI 審查、客服自動化的團隊來說,這代表「主力模型」的選擇可能整批要換。

規格:1M 上下文、128K 輸出、知識截止 2026 年 6 月

先把硬數字攤開。模型 ID 在 Claude API、Google Cloud、Microsoft Foundry 與 AWS Claude Platform 皆為 claude-sonnet-5-5;Amazon Bedrock 則為 anthropic.claude-sonnet-5-5。

項目Claude Sonnet 5.5Claude Sonnet 5Claude Opus 5.5
發布日2026-09-282026 年中2026-09-22
Context window1M tokens1M tokens1M tokens
最大輸出128K(Batch API 可到 300K)128K128K
知識截止2026 年 6 月較早2026 年 6 月
輸入(每 1M tokens)$2$2$4
輸出(每 1M tokens)$10$10$20

牌價上最值得注意的一點是「不漲價」。Sonnet 4.5/4.6 世代是輸入 $3、輸出 $15,Sonnet 5.5 相對它們便宜了約 33%;相對同一天世代的 Opus 5.5,則是剛好半價。

快取與 Batch:這次降在細節裡

真正影響長期帳單的,往往是快取門檻這種不起眼的參數。

計價項目單價(每 1M tokens)說明
輸入$2.00標準牌價
輸出$10.00標準牌價
快取讀取(cache read)$0.20輸入價的 10%
快取寫入(5 分鐘)$2.501.25 倍
快取寫入(1 小時)$4.002 倍
Batch API 輸入$1.00非同步批次 5 折
Batch API 輸出$5.00非同步批次 5 折

其中最有感的是最小可快取長度從 1,024 tokens 降到 512 tokens。這意味著過去「太短不值得快取」的系統提示詞與工具定義,現在也能吃到 90% 的快取折扣。對於每次請求都要塞一大包工具定義的 Agent 服務,這一項的省錢幅度常常比模型本身降價還大。

Benchmark:中階型號在多數 Agent 評測上追平旗艦

以下是官方公布數字與第三方 Artificial Analysis(AA)實測的對照,落差值得看清楚。

評測項目Sonnet 5.5Sonnet 5Opus 5.5備註
Terminal-Bench 4.070.6%(官方)/64%(AA)10.3%/14%66.4%(Xhigh)/60%(AA)Sonnet 反超旗艦
SWE-Bench Pro81.3%63.2%89.9%旗艦仍領先
SWE-Bench Multilingual90.3%78.3%93.9%多語言修 bug
SWE-Bench Multimodal54.3%28.1%61.4%看圖寫程式
OSWorld 2.1(partial)80.1%57.0%81.8%電腦操作
OSWorld 2.1(strict)43.5%25.6%48.7%嚴格通過
GDPval-AA v2.1(Elo)184414491846真實職業任務
AA-Briefcase v1.1(Elo)181113591822知識工作
HLE(有工具)64.5%54.9%67.7%專家級跨領域
FrontierCode 1.152.1%(Xhigh)42.4%54.4%贏過 GPT-6 Sol 的 49.3%
CursorBench 4.055.5%34.1%57.8%編輯器內實測

在 Artificial Analysis 的綜合智力指數(v4.3.2)上,Sonnet 5.5 拿到 56 分、216 個模型中排名第 3,僅次於 Opus 5.5 的 58 分,領先 GPT-6 Astra 與 Fable 5.1 的 53 分、GPT-6 Sol 的 48 分。Sonnet 5 只有 38 分——這一代的躍升幅度是本世代最大的。

附帶一個有趣紀錄:Sonnet 5.5 是第一個**只靠螢幕截圖就通關《寶可夢 紅》**的 Sonnet 型號(此前是 Opus 5.5 達成的)。

官方說「每任務成本降 30%」,原因有三個

VentureBeat 的標題寫得很直接:每任務成本降 30%。這個數字不是牌價折扣,而是三件事疊起來的結果:

  1. 輸出 token 變少。 完成同一件事所需的輸出量下降。Slackbot 類任務輸出 token 減少約 14%;Balyasny 的財務分析題,每次答案的 token 從 Sonnet 5 的 497,000 降到 121,000;Box 的測試顯示總 token 少 12%。
  2. 生成速度變快。 輸出速度比 Sonnet 5 快 30% 以上。客戶實測:Zendesk 工單處理快 20%、Atlassian Rovo Agents 快最多 30%、Box 端到端快 2.4 倍。
  3. 工具呼叫與步驟變少。 工具批次處理與判斷力改善後,無效的工具呼叫、Shell 執行大幅減少。Base44 的測試裡,每次 App 建置平均只需 3.6 次迭代(Opus 5 需要 7.7 次);Lovable 回報工具呼叫次數少了 三分之一。

⚠️ 最大的陷阱:開到 Max effort 反而更貴

這是第三方評測最值得開發者抄在牆上的一句話。官方強調的 30% 成本降低,主要發生在 Medium/High 這兩個層級。一旦把 effort 開到 Max,Artificial Analysis 實測 Sonnet 5.5 的平均每任務成本達 $7.60(單次產生高達 193K 輸出 token),反而高於 Opus 5.5 的 $5.98,更遠高於同價位的 GPT-6 Sol(約 $1.06)。

換句話說:Sonnet 5.5 的性價比來自「知道什麼時候該停」,而 effort 就是你手上那個煞車。官方建議日常與 Agent 任務以 Medium 或 High 執行效率最佳。

API 側的破壞性變更(升級前必讀)

這次改版有幾項會讓舊程式直接收到 400 錯誤:

  • Effort 五級制:low/medium/high/xhigh/max。Claude 應用程式與 Claude Code 預設 Medium,API 預設 High。
  • 思考不能關:思考預設開啟,傳入 thinking: {"type": "disabled"} 會直接回 400。
  • tool_choice 強制選擇廢除:指定 any 或特定工具名稱同樣回 400,改用 auto 搭配 strict: true 或結構化輸出。
  • 新增 between_tools:在工具呼叫之間保留簡短進度紀錄,同時關閉前置思考(適用 low/medium/high)。
  • Preserved Thinking:思考區塊與模型、對話、帳號綁定,無法跨帳號重放或寫入歷史後重播——這是對抗蒸餾攻擊的設計。
  • Context compaction:長對話歷史可按需壓縮。
  • 不支援非預設的 temperature/top_p/top_k,也沒有 Fast mode。
  • 工具系統提示詞從 Sonnet 5 的 354 tokens 瘦身到 286 tokens;電腦操作換到新工具集 computer_toolset_20260801。

安全:ExploitBench 從 1 個漏洞暴增到 178 個

能力提升的另一面是風險。第三方評測指出,Sonnet 5.5 在 ExploitBench 上能產生 178 個 ACE(任意程式碼執行)漏洞,前代 Sonnet 5 只有 1 個。

Anthropic 因此首度為 Sonnet 級型號導入 Cyber Safeguards(三階段安全防護),代價是良性資安任務的拒絕率上升;高風險請求會被自動退回 Sonnet 5 處理。對資安研究、滲透測試團隊來說,這是實務上必須先測一輪的相容性問題。

限制與批評:記憶與事實精確度仍是旗艦的護城河

  • AA-Omniscience(知識正確度):Sonnet 5.5 僅 32 分,落後 Opus 5.5 的 46 分;官方系統卡也承認它「答對總數較高,但自信陳述錯誤答案的機率略高於 Sonnet 5」。
  • 深度推理與超長文本重建:HLE 無工具測試落後 Opus 5.5 約 7.5 分,ProgramBench 重建測試落後約 11.5 分。
  • 需要持續嚴謹判斷、開放式長推理的任務,Opus 5.5 仍勝。

企業市場背景:Anthropic 首度超車 OpenAI

這不是單一模型的新聞。2026 年的市場數據(例如 Ramp 的企業支出指數)顯示,Anthropic 在美國企業 AI 支出的占比達 34.4%,首度超越 OpenAI 的 32.3%,主要推力就是 Claude Code 與 Sonnet/Opus 系列在程式開發與企業工作流的採用。

同一時間,Anthropic 也宣布提供 Zero Data Retention(零資料留存),以及美洲專用推論 inference_geo: "us"——後者需支付 1.1 倍 token 費用(加價 10%),適用 Claude API、AWS Claude Platform 與 Microsoft Foundry US Data Zone。

可用平台方面,Sonnet 5.5 同步登上 Claude.ai(網頁/桌面/行動)、Claude Code、Claude Platform、Amazon Bedrock、Google Cloud Vertex AI 與 Microsoft Foundry,並已在 GitHub Copilot、Cursor、Slack、Atlassian Rovo、Zendesk、Box 等工具鏈中出現。CodeRabbit 已表示把多數程式碼審查流量遷移到 Sonnet 5.5。

對台灣開發團隊的實務結論

  1. 「主力換 Sonnet 5.5、難題才丟 Opus 5.5」是這次改版後最合理的預設。 在 Agentic coding 與自動化流程上,Sonnet 5.5 的表現已經接近旗艦,價格只有一半。
  2. effort 要當成成本旋鈕,而不是效能旋鈕。 預設 High 已經足夠;把它一律開到 Max,單任務成本會比 Opus 5.5 更貴,這是本次最反直覺、也最容易踩到的坑。
  3. 升級前先跑 API 相容性測試。 不能關思考、不能強制工具選擇、不能調 temperature,這三項在既有程式碼裡很常見。
  4. 快取門檻降到 512 tokens 是隱形紅利。 若服務有大量短系統提示詞與工具定義,重新檢視快取策略可能比換模型更省。
  5. 需要模型混搭的團隊,可以搭配路由層動態分配。 例如把簡單請求導向便宜模型、只在必要時升級。

站內延伸閱讀

原始來源

  • Anthropic 官方公告與模型文件(模型 ID、Effort 參數、Preserved Thinking、Cyber Safeguards)
  • Mashable SEA:Anthropic releases Claude Sonnet 5.5, a faster and cheaper follow-up to Opus 5.5
  • VentureBeat:Anthropic launches Claude Sonnet 5.5 with 30% cost reduction per-task due to faster speeds and fewer tool calls
  • Unite.AI:Anthropic Releases Claude Sonnet 5.5 at Unchanged Sonnet 5 Pricing
  • Kingy AI:Claude Sonnet 5.5: Specs, Benchmarks, Pricing and the Real Cost per Task
  • Artificial Analysis:Intelligence Index v4.3.2、Terminal-Bench 4.0 與每任務成本實測
  • BenchLM.ai:Claude API Pricing(2026 年 9 月)

本文數據分為「廠商自報」與「第三方實測」兩類,表格中已標明來源差異。牌價與官方 benchmark 以 Anthropic 公告為準;每任務成本、AA 智力指數與 Terminal-Bench 實測值來自 Artificial Analysis 等第三方,兩者可能因設定(Effort 層級)不同而有明顯落差。

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。

訂閱即表示同意收到 most.tw 電子報,隨時可一鍵退訂。

💬 有問題想討論?加 LINE 聯絡我

歡迎透過 LINE 官方帳號直接留言,我會盡快回覆你的問題。

加入 LINE 好友