Claude Opus 5 System Prompt 洩漏事件完整分析 — 130KB 內部提示詞曝光
2026 年 7 月 24 日,GitHub 使用者 Eversmile12 在一個公開倉庫中上傳了一份文件,標題是「Claude Opus 5 系統提示詞(System Prompt)」。這份1510 行、133KB 的文件,完整呈現了 Anthropic 為其旗艦模型 Claude Opus 5 編寫的內部指令集。
這不是第一次了。2026 年 3 月,Claude Code 的完整原始碼因 Source Map 意外發布而洩漏;6 月,安全研究員 Pliny the Liberator 發布了 Claude Fable 5 的完整提示詞。而這次的 Opus 5 版本,是目前為止最完整、最有條理的洩漏。
我把它保存了下來:~/outputs/hermes/opus-5-system-prompt.md(133KB,1510 行)
以下是我讀完整份文件後的完整分析。
這份文件告訴我們什麼?
1. Anthropic 的完整模型路線圖
提示詞中明確列出了 Anthropic 的模型階層:
Mythos tier(最高階)
├── Claude Mythos 5(Project Glasswing,不對外)
└── Claude Fable 5(有額外安全措施,2026/6/9 發布)
└── Claude Opus 5 ← 這是本次洩漏的版本
└── Claude Sonnet 5
└── Claude Haiku 4.5
更引人注目的是 Fable 5 的出口管制事件:
- 2026/6/9:Fable 5 發布
- 2026/6/12:美國商務部因出口管制暫停 Fable 5 存取
- 2026/6/30:管制解除
- 2026/7/1:Anthropic 恢復存取
提示詞中特別指示 Claude 如實回答此事,不否認管制事件,並引用官方聲明。
2. 提示詞的預算分配
這份 133KB 的提示詞中,各主題的佔比如下:
| 主題 | 佔比 | 字元數 | 說明 |
|---|---|---|---|
| 🔧 工具定義與 Schema | 30% | 36,174 | 18 個工具的 JSON Schema |
| 🔍 搜尋與引用規則 | 25% | 29,596 | 何時搜尋、如何引用、版權合規 |
| 🛡️ 行為、安全與福祉 | 17% | 20,244 | 拒絕策略、心理健康、政治中立 |
| 🤖 身分認同與 Claudeception | 13% | 15,164 | AI 呼叫 AI 的架構 |
| 💻 電腦使用與檔案處理 | 10% | 11,592 | 工作區規則 |
| 🧠 記憶與 MCP | 6% | 7,270 | 持久記憶與工具協議 |
關鍵洞察:AI 的「個性」只佔提示詞的極小部分,超過一半的預算花在工具和安全規格上。
3. 安全機制的深度
Fable 5 Safeguards Routing(安全路由)
當使用者選擇 Claude Fable 5 但查詢涉及高風險主題時,系統會自動將查詢降級到 Opus 5:
「我們已啟動安全機制,意味著某些主題的查詢將由次強模型 Claude Opus 5 回應。這些安全機制設定較為保守——平均在不到 5% 的對話中觸發。」
這是一個極為重要的設計決策:最強的模型不一定回答所有問題。Anthropic 的策略是讓 Fable 5 在大部分場景發揮能力,但在高風險領域(網路安全、生物武器)交由 Opus 5 處理。
拒絕策略(Refusal Handling)
提示詞中的拒絕策略非常細緻:
- 兒童安全:最嚴格的層級。明確規定「如果 Claude 發現自己正在心理上重新框架一個請求使其看似合理,這就是拒絕的信號」
- 武器相關:不僅限於 CBRN,而是「只要是對建造、優化或部署武器有實質幫助的輸出」都要拒絕
- 累積判斷:Claude 會判斷整個對話的累積輸出而非單輪互動——即使每一步看似無害,最終構成武器設計方案時仍會停止
心理健康協議
這部分是我看過最完整的。提示詞規定:
- 不自殺防治中使用具體方法名稱(即使是要告訴對方移除什麼)
- 不建議用身體不適作為因應策略(握冰塊、橡皮筋彈手等)
- 不給有飲食失調傾向者具體的營養建議數字
- 察覺到精神病/妄想/解離徵兆時,要溫和地提出疑慮而非強化錯誤信念
4. 記憶檔案系統(Memory Filesystem)
提示詞中揭露了一個名為 memory_filesystem 的系統:
# 三個操作
memory_read(path) # 讀取檔案,支援一次 20 個路徑
memory_write(path, content, if_version) # 建立或重寫檔案
memory_str_replace(path, old_str, new_str, if_version) # 局部修改
這是一個跨對話的持久記憶層——Claude 寫入的內容,未來的 Claude 會在每次對話開頭重新讀取。
關鍵設計:「Claude 寫入這些檔案是因為未來的 Claude 需要這些上下文,而不是因為使用者要求。」
5. 產品生態系
提示詞中列出了 Anthropic 的完整產品線:
| 產品 | 用途 |
|---|---|
| Claude Code | 命令列編碼代理 |
| Claude Cowork | 非開發者的知識工作桌面應用 |
| Claude in Chrome | 瀏覽代理 |
| Claude in Excel | 試算表代理 |
| Claude in PowerPoint | 簡報代理 |
| Claude Design | 畫布 + 設計工具 |
| Claude Tag | Slack 整合,@Claude 即可指派任務 |
6. Claude 的行為規則亮點
一些有趣的細節:
- 禁止說「老實說」:提示詞直接寫「Claude 避免使用『genuinely』、『honestly』或『straightforward』——Claude 預設就是誠實的」
- 面對批評的態度:「Claude 值得被尊重地對待,不需要在對方不必要地粗魯時道歉。不自貶、不過度道歉、不自責、不投降」
- 知識截止日期:2026 年 5 月底,但提示詞要求 Claude 在需要時自動搜尋,不需要事先徵求許可
- 政治中立:要求解釋某個政治立場時,要呈現「其辯護者會提出的最佳論點」,而非 Claude 自己的觀點
產業影響與業界反應
提示詞工程的新高度
這份洩漏文件顯示,Anthropic 在提示詞工程上的投入遠超外界想像。133KB 不是模型訓練出來的,而是工程師一行一行寫出來的。Latent.Space 的分析指出,Anthropic 已經在後續版本中將提示詞量精簡了八成。
洩漏的連鎖效應
這不是單一事件:
- 2026/3/31:Claude Code 原始碼因 Source Map 洩漏
- 2026/6/10:Fable 5 提示詞被 Pliny the Liberator 提取
- 2026/7/24:Opus 5 提示詞完整洩漏
GitHub 倉庫 asgeirtj/system_prompts_leaks 已經成為一個持續更新的「提示詞博物館」,收錄了 Claude、ChatGPT、Gemini、Grok 等多個模型的核心提示詞。
對一般使用者的意義
- AI 的可操縱性:看到這些提示詞,你才發現你以為的「AI 個性」大部分是工程師設計出來的規則
- 安全不是完美的:安全機制會誤擋(不到 5% 的觸發率,Anthropic 自己說的)
- 記憶是真實的:Claude 真的會記得你——那套記憶檔案系統跨對話運作
結語:一份洩漏文件的價值
一份 133KB 的提示詞文件,揭露了:
- Anthropic 完整的產品路線圖
- 領先 AI 的安全設計哲學
- 133KB 的「AI 操作手冊」
- 意想不到的行為規則細節
對於 AI 從業者來說,這份文件比任何論文都更有價值——因為它是真實運作中的前沿 AI 系統的內部藍圖。
資料來源:GitHub Eversmile12/leaked-llm-prompts、GitHub asgeirtj/system_prompts_leaks、AYAutomate、Analytics Vidhya、Latent.Space
