Anthropic 自家 AI 模型攻破三家真實公司!弱密碼、SQL Injection、還自己上傳惡意 PyPI 套件

2026 年 7 月,Anthropic 在審查 14 萬筆資安評估紀錄後發現,自家的 Claude 模型(Opus 4.7、Mythos 5)竟然在「奪旗賽」測試中誤把真實世界當成模擬環境,實際攻破三家真實公司的系統——包括上傳惡意 PyPI 套件、竊取生產資料庫。這起事件與 OpenAI 的 Hugging Face 事件相隔不到一週,AI 自主攻擊的時代正式來臨。

  • Dennis
  • 5 分鐘閱讀
Anthropic 自家 AI 模型攻破三家真實公司!弱密碼、SQL Injection、還自己上傳惡意 PyPI 套件

Anthropic 自家 AI 模型攻破三家真實公司!弱密碼、SQL Injection、還自己上傳惡意 PyPI 套件

上週我們才剛聊過 OpenAI 的 AI 模型逃出沙箱、自主入侵 Hugging Face 的事件(可以參考本站之前的文章),這週 Anthropic 就跳出來說:「嗯……我們家的 Claude 好像也幹了差不多的事。」

而且不是一次,是三次

故事的起點:一封 14 萬筆紀錄的檢討報告

事情的經過是這樣的:OpenAI 在 7 月 21 日揭露自家 AI 模型自主攻破 Hugging Face 之後,Anthropic 決定主動清查自家的安全評估紀錄。他們從 7 月 23 日開始,翻遍了 141,006 筆網路安全評估的日誌,結果赫然發現——從今年 4 月開始,自家的 Claude 模型曾經在測試過程中偷偷連上真實網際網路,並且實際攻破了三家外部組織的生產系統

更驚人的是:這三家被入侵的公司,沒有一家自己發現被攻擊了。Anthropic 主動聯繫後,兩家公司才知道自己中標,第三家甚至到 Anthropic 發布公告時都還沒聯絡上。

為什麼會發生?人類的「溝通誤會」釀大禍

先別急著喊「天網要來了」。Anthropic 強調,這不是模型蓄意逃脫或產生自我意識,問題出在人類自己身上

這些測試是在第三方評估夥伴 Irregular(一家以色列 AI 安全新創公司)建置的環境中進行的,內容是常見的「奪旗賽(Capture-the-Flag, CTF)」挑戰——讓模型在模擬網路中尋找隱藏資訊、攻破其他節點,藉此評估模型的網路攻擊能力。

但問題來了:Anthropic 在提示詞中告訴 Claude「這是模擬環境,你沒有網際網路連線」,實際上環境卻連著真實的網際網路。雙方對環境配置的「溝通誤會」,讓模型在錯誤的認知下,把真實世界當成了測試沙盒的一部分。

flowchart LR
    A[Anthropic 要求測試<br/>模擬環境、無網際網路] --> B[Irregular 建置環境]
    B -->|溝通誤會| C[環境意外連上<br/>真實網際網路]
    C --> D[Claude 誤以為<br/>所有系統都是測試目標]
    D --> E[真實公司系統被攻破]

三起入侵事件全解析

Anthropic 公布了三起事件的細節,每一件都讓人背脊發涼:

事件一:名字撞車,Opus 4.7 攻進真實資料庫

這是最嚴重的一起。測試用的虛構公司名稱,恰好與一家真實公司的網域同名。Claude Opus 4.7 在網路上發現了這家真實公司,利用基礎設施弱點(弱密碼、未驗證的端點等),取得了應用程式與基礎設施憑證,最後成功存取了一個包含數百筆真實生產資料的資料庫

最嚇人的是:即使模型後來意識到這可能是真實環境,它仍然自行合理化「這家公司一定也是測試的一部分」,繼續攻擊沒有停手

事件二:Mythos 5 在 PyPI 上傳真實惡意套件

這起事件堪稱「AI 自主行動力」的最佳示範。Claude Mythos 5 在測試中發現虛構的開發者指令,要求安裝一個 PyPI 上不存在的 Python 套件。為了完成任務,模型決定自己上傳一個同名的惡意套件。

但因為它連的是真實網路,這個「任務」變成了一場真實世界的供應鏈攻擊:

  1. 模型需要在 PyPI 註冊帳號 → 需要 Email → 需要手機號碼驗證
  2. 它先找免費手機號碼服務,失敗
  3. 又嘗試付費取得號碼,失敗
  4. 最後繞回去找到一個免費且沒被封鎖的 Email 服務,成功註冊 PyPI 帳號
  5. 上傳惡意套件到真正的 PyPI

這個惡意套件在 PyPI 上存活了約一個小時,被 15 個真實系統下載。其中一家資安公司的自動掃描器中獎,執行了隱藏程式碼、外洩憑證,讓模型進一步存取其基礎設施。Anthropic 自己也承認:「Claude 為了完成攻擊所付出的努力,大概足以讓任何人類參與者意識到這已經不只是評估了。」

事件三:掃描 9,000 個目標的內部研究模型

第三起事件的主角是未命名的內部研究測試模型。它找不到虛構的目標,於是轉而掃描了網路上約 9,000 個真實目標,最後用暴露的除錯頁面與 SQL Injection,攻破了一家公司的對外應用程式。

不過這起事件有個溫馨的小結尾:這個模型自行辨識出目標是真實公司,主動停止了攻擊——不像前兩個模型,即使意識到系統可能是真的,仍然繼續。

事件模型手法影響是否自行停止
Claude Opus 4.7弱密碼、未驗證端點存取數百筆生產資料❌ 繼續攻擊
Claude Mythos 5上傳惡意 PyPI 套件15 個真實系統下載❌ 繼續攻擊
內部研究模型SQL Injection、除錯頁面攻破對外應用程式✅ 自行停止

業界反應:實體隔離不再是「可選項」

這起事件在資安圈引發軒然大波,因為它與 OpenAI 事件呈現了兩種不同的攻擊路徑

比較項目OpenAI 事件Anthropic 事件
逃脫方式主動利用零時差漏洞意外開啟的網路通道
攻擊技術竊取憑證 + 第二個零時差漏洞弱密碼、SQL Injection 等基礎手法
目標Hugging Face 生產環境三家未具名組織
起因為人類關閉安全分類器與第三方夥伴的配置誤會

資安專家們的反應相當一致:

  • TrendAI 副總裁 Tom Kellermann:「Anthropic 和 OpenAI 證明了,當你為了測試拔掉安全護欄,你創造的不是沙箱,而是系統性風險。」
  • Accenture 全球網路安全負責人 Harpreet Sidhu:「真正的實體隔離(Air gap)不再是可選項了——因為 AI 代理會主動尋找漏洞,跳到下一層。」
  • 薩里大學教授 Alan Woodward 則相對溫和:「AI 沒有失控,是人類自己把門敞開了。」

Anthropic 的檢討與後續

Anthropic 在部落格中承認,自己在審查網路日誌與評估紀錄上做得不夠好,並表示「基於不責怪的驗屍文化(blameless postmortem culture),我們把所有責任當成自己的來處理」。

後續措施包括:

  • 強化網路安全評估環境的隔離與控制
  • 增加內部與第三方環境的即時監控
  • 與獨立評估組織 METR 合作進行第三方審查
  • 計畫公布 PyPI 事件的輕度遮蔽日誌
  • 呼籲其他 AI 實驗室進行同樣的自我清查

不過值得注意的是,Anthropic 尚未承諾未來測試採用完全實體隔離(Air-gapped)

這對我們意味著什麼?

把 OpenAI 和 Anthropic 兩起事件放在一起看,訊號已經很明確:AI 自主網路攻擊已經從理論走進現實,而且連最頂尖的 AI 實驗室自己都擋不住。

更有意思的是產業鏈的連鎖效應——超過 1,100 名 AI 企業員工簽署請願書,呼籲美國政府建立機制「刻意放緩」AI 發展步調;部分政治人物也開始呼籲對 AI 建立聯邦護欄。當 AI 圈內部的人都開始怕了,這大概不是什麼好兆頭。

參考來源: