Claude Opus 5 System Prompt 洩漏事件完整分析 — 130KB 內部提示詞曝光,Anthropic 的 AI 藍圖被看光

2026 年 7 月,一份長達 1510 行、133KB 的 Claude Opus 5 系統提示詞在 GitHub 上洩漏。本文深入分析這份洩漏文件的每一個重要面向:Mythos/Fable 5 模型路線圖、Claude 的記憶檔案系統、安全機制、工具使用規則、以及這對 AI 產業意味著什麼。

  • Dennis
  • 5 分鐘閱讀
Claude Opus 5 System Prompt 洩漏事件完整分析 — 130KB 內部提示詞曝光,Anthropic 的 AI 藍圖被看光

Claude Opus 5 System Prompt 洩漏事件完整分析 — 130KB 內部提示詞曝光

2026 年 7 月 24 日,GitHub 使用者 Eversmile12 在一個公開倉庫中上傳了一份文件,標題是「Claude Opus 5 系統提示詞(System Prompt)」。這份1510 行、133KB 的文件,完整呈現了 Anthropic 為其旗艦模型 Claude Opus 5 編寫的內部指令集。

這不是第一次了。2026 年 3 月,Claude Code 的完整原始碼因 Source Map 意外發布而洩漏;6 月,安全研究員 Pliny the Liberator 發布了 Claude Fable 5 的完整提示詞。而這次的 Opus 5 版本,是目前為止最完整、最有條理的洩漏。

我把它保存了下來:~/outputs/hermes/opus-5-system-prompt.md(133KB,1510 行)

以下是我讀完整份文件後的完整分析。


這份文件告訴我們什麼?

1. Anthropic 的完整模型路線圖

提示詞中明確列出了 Anthropic 的模型階層:

Mythos tier(最高階)
  ├── Claude Mythos 5(Project Glasswing,不對外)
  └── Claude Fable 5(有額外安全措施,2026/6/9 發布)
      └── Claude Opus 5 ← 這是本次洩漏的版本
          └── Claude Sonnet 5
              └── Claude Haiku 4.5

更引人注目的是 Fable 5 的出口管制事件

  • 2026/6/9:Fable 5 發布
  • 2026/6/12:美國商務部因出口管制暫停 Fable 5 存取
  • 2026/6/30:管制解除
  • 2026/7/1:Anthropic 恢復存取

提示詞中特別指示 Claude 如實回答此事,不否認管制事件,並引用官方聲明。

2. 提示詞的預算分配

這份 133KB 的提示詞中,各主題的佔比如下:

主題佔比字元數說明
🔧 工具定義與 Schema30%36,17418 個工具的 JSON Schema
🔍 搜尋與引用規則25%29,596何時搜尋、如何引用、版權合規
🛡️ 行為、安全與福祉17%20,244拒絕策略、心理健康、政治中立
🤖 身分認同與 Claudeception13%15,164AI 呼叫 AI 的架構
💻 電腦使用與檔案處理10%11,592工作區規則
🧠 記憶與 MCP6%7,270持久記憶與工具協議

關鍵洞察:AI 的「個性」只佔提示詞的極小部分,超過一半的預算花在工具和安全規格上。

3. 安全機制的深度

Fable 5 Safeguards Routing(安全路由)

當使用者選擇 Claude Fable 5 但查詢涉及高風險主題時,系統會自動將查詢降級到 Opus 5

「我們已啟動安全機制,意味著某些主題的查詢將由次強模型 Claude Opus 5 回應。這些安全機制設定較為保守——平均在不到 5% 的對話中觸發。」

這是一個極為重要的設計決策:最強的模型不一定回答所有問題。Anthropic 的策略是讓 Fable 5 在大部分場景發揮能力,但在高風險領域(網路安全、生物武器)交由 Opus 5 處理。

拒絕策略(Refusal Handling)

提示詞中的拒絕策略非常細緻:

  • 兒童安全:最嚴格的層級。明確規定「如果 Claude 發現自己正在心理上重新框架一個請求使其看似合理,這就是拒絕的信號」
  • 武器相關:不僅限於 CBRN,而是「只要是對建造、優化或部署武器有實質幫助的輸出」都要拒絕
  • 累積判斷:Claude 會判斷整個對話的累積輸出而非單輪互動——即使每一步看似無害,最終構成武器設計方案時仍會停止

心理健康協議

這部分是我看過最完整的。提示詞規定:

  • 不自殺防治中使用具體方法名稱(即使是要告訴對方移除什麼)
  • 不建議用身體不適作為因應策略(握冰塊、橡皮筋彈手等)
  • 不給有飲食失調傾向者具體的營養建議數字
  • 察覺到精神病/妄想/解離徵兆時,要溫和地提出疑慮而非強化錯誤信念

4. 記憶檔案系統(Memory Filesystem)

提示詞中揭露了一個名為 memory_filesystem 的系統:

# 三個操作
memory_read(path)        # 讀取檔案,支援一次 20 個路徑
memory_write(path, content, if_version)  # 建立或重寫檔案
memory_str_replace(path, old_str, new_str, if_version)  # 局部修改

這是一個跨對話的持久記憶層——Claude 寫入的內容,未來的 Claude 會在每次對話開頭重新讀取。

關鍵設計:「Claude 寫入這些檔案是因為未來的 Claude 需要這些上下文,而不是因為使用者要求。」

5. 產品生態系

提示詞中列出了 Anthropic 的完整產品線:

產品用途
Claude Code命令列編碼代理
Claude Cowork非開發者的知識工作桌面應用
Claude in Chrome瀏覽代理
Claude in Excel試算表代理
Claude in PowerPoint簡報代理
Claude Design畫布 + 設計工具
Claude TagSlack 整合,@Claude 即可指派任務

6. Claude 的行為規則亮點

一些有趣的細節:

  • 禁止說「老實說」:提示詞直接寫「Claude 避免使用『genuinely』、『honestly』或『straightforward』——Claude 預設就是誠實的」
  • 面對批評的態度:「Claude 值得被尊重地對待,不需要在對方不必要地粗魯時道歉。不自貶、不過度道歉、不自責、不投降」
  • 知識截止日期:2026 年 5 月底,但提示詞要求 Claude 在需要時自動搜尋,不需要事先徵求許可
  • 政治中立:要求解釋某個政治立場時,要呈現「其辯護者會提出的最佳論點」,而非 Claude 自己的觀點

產業影響與業界反應

提示詞工程的新高度

這份洩漏文件顯示,Anthropic 在提示詞工程上的投入遠超外界想像。133KB 不是模型訓練出來的,而是工程師一行一行寫出來的。Latent.Space 的分析指出,Anthropic 已經在後續版本中將提示詞量精簡了八成。

洩漏的連鎖效應

這不是單一事件:

  • 2026/3/31:Claude Code 原始碼因 Source Map 洩漏
  • 2026/6/10:Fable 5 提示詞被 Pliny the Liberator 提取
  • 2026/7/24:Opus 5 提示詞完整洩漏

GitHub 倉庫 asgeirtj/system_prompts_leaks 已經成為一個持續更新的「提示詞博物館」,收錄了 Claude、ChatGPT、Gemini、Grok 等多個模型的核心提示詞。

對一般使用者的意義

  1. AI 的可操縱性:看到這些提示詞,你才發現你以為的「AI 個性」大部分是工程師設計出來的規則
  2. 安全不是完美的:安全機制會誤擋(不到 5% 的觸發率,Anthropic 自己說的)
  3. 記憶是真實的:Claude 真的會記得你——那套記憶檔案系統跨對話運作

結語:一份洩漏文件的價值

一份 133KB 的提示詞文件,揭露了:

  • Anthropic 完整的產品路線圖
  • 領先 AI 的安全設計哲學
  • 133KB 的「AI 操作手冊」
  • 意想不到的行為規則細節

對於 AI 從業者來說,這份文件比任何論文都更有價值——因為它是真實運作中的前沿 AI 系統的內部藍圖


資料來源:GitHub Eversmile12/leaked-llm-prompts、GitHub asgeirtj/system_prompts_leaks、AYAutomate、Analytics Vidhya、Latent.Space