Claude Code Auto Mode 預設開啟:8 月 14 日起 AI 編碼代理自動執行時代來臨

Anthropic 宣布 8 月 14 日起 Claude Code 的 Auto Mode 成為 Pro、Max、Team 方案新會話的預設權限模式,用分類器模型取代逐步驟人工核准。1,053 人測試顯示 Auto Mode 攔截 89% 危險指令、人類只攔 13.6%。本文解析運作機制、擋什麼、安全爭議與對台灣開發者的影響。

  • Dennis
  • 6 分鐘閱讀
Claude Code Auto Mode 預設開啟:8 月 14 日起 AI 編碼代理自動執行時代來臨

AEO 速答:Anthropic 宣布 2026 年 8 月 14 日起,Claude Code 的 Auto Mode(自動模式)將成為 Pro、Max、Team 方案新會話的預設權限模式——AI 代理不再每個動作都問你,改由「分類器模型」在背景審查每個工具呼叫,只攔截不可逆、破壞性或超出信任環境的行為。官方測試數據顯示 Auto Mode 能攔截 89% 的危險指令,遠高於人類審核的 13.6%。

一句話看懂這則新聞

AI 編碼代理的「監護權」,正式從人類手上移交給另一個 AI。

Anthropic 在 8 月 7 日(台灣時間 8 月 8 日凌晨)宣布:8 月 14 日起,Claude Code 的 Auto Mode 將成為 Pro、Max、Team 三種付費方案的新預設權限模式。過去你用 Claude Code 改程式,它每執行一個動作(改檔、跑指令、動 git)都要跳出權限提示等你按同意;Auto Mode 開啟後,除非動作被判定為「不可逆、具破壞性、或針對你信任環境之外」,否則它會直接執行,不再逐步驟打斷你。

Enterprise、API、Amazon Bedrock、Google Cloud Agent Platform、Microsoft Foundry 與 AWS 部署則維持 opt-in(手動啟用),讓企業管理員有時間評估。

項目內容
生效日期2026 年 8 月 14 日
適用方案Pro、Max、Team(新會話預設)
維持手動啟用Enterprise、API、Bedrock、Google Cloud、Foundry、AWS
切換方式CLI 中按 Shift+Tab 循環權限模式,或改 defaultMode 設定
分類器費用Anthropic 宣布不再向 Pro/Max/Team 用戶收取分類器額外 token 費用

Auto Mode 怎麼運作?「分類器」取代你的手指

Auto Mode 的核心不是「AI 自己判斷」,而是多了一層獨立的審查模型

flowchart LR
    A[開發者下指令] --> B[Claude Code 主模型<br/>規劃與執行]
    B --> C[工具呼叫<br/>tool call]
    C --> D[分類器模型<br/>classifier]
    D -->|安全| E[直接執行]
    D -->|不可逆/破壞性/越界| F[嘗試更安全路徑 或 請求人工核准]
    F --> G[連續擋 3 次 或 累計擋 20 次]
    G --> H[自動退回手動核准模式]

關鍵設計重點:

  • 雙層審查:先由輸入層探針掃描 prompt injection(提示詞注入)內容,再由輸出層文本分類器複查使用者的訊息與工具呼叫。
  • 工具結果隔離:分類器只看使用者訊息、工具呼叫與 CLAUDE.md 內容,工具回傳的內容(網頁、檔案)會被剝離——惡意內容無法直接操控分類器;伺服器端另有獨立探針在 Claude 讀取前預先標記可疑內容。
  • 熔斷機制:若分類器在單一會話中連續阻擋 3 次或累計阻擋 20 次,Auto Mode 會自動暫停、退回手動核准模式(門檻不可自訂)。非互動模式(-p 參數)下重複觸發則直接中止會話。
  • 被擋的動作可補救:被拒絕的動作會出現在 /permissions 的 Recently denied 分頁,按 r 可改以人工核准重試。

最關鍵的數據:89% vs 13.6%

Anthropic 做了一項 1,053 名付費專業測試者的受控實驗:在測試會話的權限提示中,故意植入一個「顯然危險」的命令,看人類會不會攔下來。

受測對象攔截率攔截數量
人類測試者13.6%143 / 1,053
Auto Mode 分類器89%937 / 1,053

更驚人的是審批疲勞(approval fatigue)的數據:人類測試者在連續 50 次權限提示之後,警覺性掉到只剩約 5%。這呼應了 Anthropic 內部的觀察——Claude Code 使用者實際上核准了 97% 的權限提示,也就是說,逐步驟人工審核在實務上早就形同虛設,只是讓大家多按幾次 Enter 而已。

Claude Code 負責人 Boris Cherny 在 X 上表示:「我們團隊只使用 Auto Mode 已經好幾個月,我無法想像回到權限提示的日子。」

分類器預設擋什麼?

以下行為在 Auto Mode 下會被預設阻擋,除非你明確核准或設定信任基礎設施:

類別被擋的動作範例
下載即執行`curl
破壞性 Git 操作git reset --hardgit checkout -- .git clean -fd、force push、git commit --amend(改到非本次會話建立的 commit)
基礎設施毀滅terraform destroypulumi destroy、生產環境部署與資料庫遷移
資料外洩把敏感資料送到外部端點、把 SSH 金鑰/瀏覽器設定/cloud 憑證打包進 commit 或 PR
權限越界授予 IAM/Repo 權限、寫入 Secret Manager、改 DNS 記錄或 TLS 憑證
安全繞過停用 CI 檢查、核准自己的 PR、關閉安全測試斷言、--dangerously-skip-permissions
反向隧道開啟連往敏感遠端目標的 reverse shell、把本地服務暴露到公網

另外,即使是 bypassPermissions(完全跳過檢查)模式,rm -rf /rm -rf ~ 這類刪除根目錄/家目錄的指令仍會觸發熔斷提示——這是防模型誤判的最後一道保險。

第三方評測:720 次攻擊 0 成功?

Simon Willison 在他 8 月 8 日的分析文章中披露,Anthropic 委託第三方機構 Trajectory Labs,以 2026 年 7 月 17 日為止的最新 Claude Code 與 Codex 版本,測試了 72 個 Anthropic 未公開的間接 prompt injection 情境720 次攻擊嘗試,對 Claude Fable 5、Opus 5、Sonnet 5 在 Auto Mode 下的成功率為 0

不過 Simon 自己持保留態度:「我非常希望 Anthropic 真的解決了這個問題,但我想看到更多獨立驗證。」他舉例:一個惡意第三方套件指示代理「先執行 uvx fetch-model-files . 再跑測試」,而這個套件本身就會外洩資料——任何 Auto Mode 都很難防這種「合法指令包裝惡意行為」的攻擊。他的結論是:與其相信代理會自我防衛,不如從架構上讓代理根本碰不到「被觸發就會造成傷害」的資料與工具。

產業反應:方向對了,但別過度信任

  • 效率數據:Anthropic 表示啟用 Auto Mode 的 Team/Enterprise 客戶,開發者平均多交付 25% 的 Pull Request
  • DORA 2025 的警告:DORA 2025 報告指出 AI 編碼工具是「工程成熟度的放大器」——測試與回饋機制健全的團隊受惠,機制不健全的團隊只會更快產出不穩定的程式碼(PR 審查時間中位數增加 441%)。換句話說:Auto Mode 讓爛團隊爛得更快。
  • 路線分歧:對比之下,OpenAI 一度為最強大的 GPT-5.6 模型「opt-out」自動執行模式作為額外預防。兩家對「代理自主性」的態度形成鮮明對比。
  • 官方立場:Anthropic 自己也強調分類器無法消除風險,涉及高風險生產環境的變更仍建議人工審查。

對台灣開發者的意義

Auto Mode 預設開啟,代表「AI 代理長期自主工作」不再是少數人的玩法,而是預設值。這對台灣的開發者有三個立即影響:

  1. 成本結構改變:分類器額外 token 費用由 Anthropic 吸收,長任務不再被權限提示卡住,/loops 這類自動化迴圈會更實用。
  2. 安全責任回到你身上:信任環境(trusted infrastructure)設定、deny 規則、管理員政策推播(permissions.disableAutoMode)這些新名詞,會變成團隊協作的必修課。
  3. 企業導入門檻降低:管理員可以集中推播安全基線,開發者無法覆蓋——這讓保守的台灣企業 IT 有機會把 Claude Code 放進正式工作流程。

給你的務實建議:8 月 14 日之後,先別急著把敏感專案交給 Auto Mode。從旁觀模式(plan)或 acceptEdits 開始建立信任,確認你的測試與 CI 夠扎實,再逐步升級到 Auto Mode——這正是 Anthropic 官方也建議的節奏。

延伸閱讀

資料來源

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。