Anthropic 未發布的 Claude 研究版模型,以 60 個子代理協作、耗費 3100 萬 token,在約 36 小時內將黎曼 zeta 函數落在臨界線上的零點比例下界從 41.6% 推進到 67.2%,並通過 Lean 4 形式化驗證——解析數論 37 年來人類只前進了 0.8 個百分點,AI 一次跳了 25.6 個百分點。
一句話結論
黎曼猜想(Riemann Hypothesis)至今未被證明,但人類數學家一直在退而求其次:證明「至少有百分之多少」的 zeta 函數零點落在臨界線上。Anthropic 一個未發布的 Claude 研究版模型,用多代理協作把這個「臨界線零點比例下界」從 41.6% 大幅推升到 67.2%,被學者形容為自 2013 年張益唐證明質數間距以來,解析數論領域最重大的進展。
黎曼猜想是什麼?為什麼 67.2% 很了不起
黎曼猜想於 1859 年提出,是數學界最著名的未解難題之一,也是 Clay 數學研究所七大「千禧年大獎難題」之一(懸賞一百萬美元)。它主張:黎曼 zeta 函數的所有非平凡零點,實部都等於 1/2——也就是全部落在複數平面上的一條垂直線上,數學家稱之為「臨界線」(Critical Line)。
由於直接證明「100% 零點都在臨界線上」太困難,解析數論學家長期採用一個「累積式」策略:先證明至少有一定比例的零點在臨界線上,再逐年拉高這個比例。這個數字在過去半世紀進步極其緩慢:
| 年份 | 研究者 | 臨界線零點比例下界 |
|---|---|---|
| 1974 | Levinson | 約 1/3(33%) |
| 1989 | Conrey | 約 2/5(40%) |
| 2020 | Pratt、Robles、Zaharescu、Zeindler | 約 41.6%(5/12) |
| 2026 | Claude(未發布研究版) | 67.250% |
看出重點了嗎?從 1974 到 2020 的 46 年間,人類數學家平均每年只把這個數字推高 0.18 個百分點;2020 年之後的 6 年,幾乎原地踏步。而 Claude 在短短 36 小時內,把下界一舉推高了 25.6 個百分點——超過人類半世紀的總進度。
⚠️ 必須澄清:這不代表證明了 67.2% 的黎曼猜想。67.2% 是「漸近下界」(asymptotic lower bound),表示在極大高度範圍內,至少有 67.2% 的零點經嚴格證明落在臨界線上;其餘 32.8% 只是「尚未被分類」,並非不在臨界線上。Claude 距離完整證明黎曼猜想,還差得遠。
這不是「問一句話」——60 個 AI 子代理的大型研究計畫
這項成果並非單次提示詞的靈光一現,而是 Anthropic 內部一場多代理協同研究實驗的產物:
graph TD
A[Claude 研究版模型] --> B[2 個關鍵點子 Agent<br/>提出核心數學猜想]
B --> C[13 個支持點子 Agent<br/>補齊細節]
C --> D[30 個探索 Agent<br/>走死胡同被淘汰]
D --> E[13 個驗證 Agent<br/>檢查邏輯、找反例、數值驗證]
E --> F[2 個寫作 Agent<br/>草擬學術論文]
F --> G[Lean 4 形式化驗證<br/>Eric Easley 協作]
G --> H[數學家審查<br/>Conrey & Goldston]實驗在兩個 Claude Code 會話中進行,歷時 36 至 54 小時,總共消耗約 3100 萬個輸出 token、執行了 2400 個 shell 指令、撰寫數百個 Python 腳本,並進行數千次數值驗證。系統動用了約 60 個子代理,分工如下:
- 2 個關鍵點子 Agent:提出核心數學方向
- 13 個支持點子 Agent:為關鍵概念補充細節
- 30 個探索 Agent:負責嘗試各種路徑,多數走入死胡同被淘汰(最初模型生成了 650 個失敗想法)
- 13 個驗證 Agent:審查證明邏輯一致性、尋找反例、做數值檢查
- 2 個寫作 Agent:把結果起草成學術論文
最有趣的細節:人類主持人是「啦啦隊」
主持這個項目的,是 Anthropic 研究員 Jarred Sumner——對,就是 JavaScript 執行環境 Bun 的創辦人,本身並非專業數學家。Sumner 幾乎沒有提供任何數學方向的實質指導,他的主要工作是:提供運算資源、擔任管理與精神支柱,以及在模型自我懷疑(模型起初高度懷疑自己能否在這種難題上有進展)時,反覆發送「繼續前進」「再試一次」「相信自己」這類指令激勵模型。
換句話說,數學突破是 AI 自己想出來的,人類負責喊加油。
數學上它到底做了什麼?
根據 NotebookLM 對多篇報導與論文摘要的交叉比對,Claude 並非憑空捏造,而是把既有數學工具做了漂亮的組合:
- 建立新橋樑:將 Montgomery(1973)的經典方法,與 Bombieri(約 2000 年)、Baluyot 等人(2023/2024)關於「無條件雙相關」的最新成果結合
- 二次型與慣性定理:構建適當的函數空間,利用 Weil 顯式公式誘導出不定厄米特二次型,再透過 Sylvester 慣性定理,把臨界線上的零點與線外零點分別映射到正定與負定方向
- 秩-跡不等式:發明了一條全新的 rank–trace 不等式,利用 Gram 矩陣的跡與 Frobenius 範數的關係,在不必確定單個零點位置的情況下,算出臨界線上零點數量的整體下界
可信度:Lean 4 機器驗證 + 頂尖數學家背書
AI 給出的數學,最怕的是幻覺。這項成果在驗證上做得很足:
- 自主文獻檢查:Claude 自行下載了 54 篇 arXiv 論文,確認成果未被他人發表,並指派獨立代理從頭重新推導
- Lean 4 形式化證明:Claude 主動提議撰寫論文並進行專家驗證,與 Anthropic 員工 Eric Easley 合作,把關鍵定理轉化為 Lean 4 形式化語言,通過標準編譯與驗證工具(Comparator),沒有任何
sorry佔位符——也就是機器可置信的證明 - 數學家人工審查:內部由數學家 Levent Alpöge(哈佛大學)與 Ralph Furman 審查;外部邀請了兩位解析數論權威——1989 年 2/5 臨界線紀錄保持者 Brian Conrey 與 Dan Goldston——審閱並提供反饋
專家怎麼說?
Menlo Ventures 合夥人兼研究員 Deedy Das 稱這項成果「超乎想像地卓越(extraordinary)」,認為這可能是自 2013 年張益唐在有界質數間距取得突破以來,解析數論領域最重大的進展。
當然,學界態度依然審慎:目前成果處於高證據力的預印本(preprint)階段,尚未完成期刊同儕評議;Anthropic 公布了論文、Lean 代碼與部分對話紀錄,但未公開模型權重與完整思考元數據,外部研究員暫時無法獨立重現這場 3100 萬 token 的搜索實驗。
對 AI 數學能力的意義
graph LR
A[過去:IMO 競賽題<br/>AlphaProof、Gemini Deep Think] --> B[答案已知、追求解題]
C[現在:Claude 研究版<br/>黎曼 zeta 67.2%] --> D[完全開放、人類無解的科研問題]
B --> E[AI 數學新時代]
D --> E過去 DeepMind 的 AlphaProof、Google 的 Gemini Deep Think 等數學 AI,主要是在 IMO 奧林匹亞競賽這類「已有既定解答」的問題上大放異彩。Claude 這次證明的是:前沿大模型已經有能力處理真正開放、人類尚無解答的科學研究問題——自主導航文獻、發現新理論連結、自我糾錯,最後還懂得用 Lean 4 給自己上保險。
這也呼應了近期另一個震撼數學界的事件:Anthropic 員工 Levent Alpöge 用 Claude Fable 5,在 2026 年 7 月推翻了存在 87 年的雅可比猜想(Jacobian Conjecture),找到的反例公式極簡到只有 216 個字元。兩起事件接連發生,宣告「AI 作為數學研究夥伴」的時代正式來臨。
延伸閱讀
- Karpathy 新專案 LLM Council:讓 GPT、Gemini、Claude、Grok 組委員會投票回答你的問題 —— 多模型協作提升推理品質的另一種玩法
- Claude Code Auto Mode 預設開啟:8 月 14 日起 AI 編碼代理自動執行時代來臨 —— 這次實驗正是用 Claude Code 完成的,自動化代理的極致展現
- Meta Muse Glimmer 開源了!30B 本地 AI Agent 模型,Apache 2.0 授權、24GB 顯示卡就能跑(2026) —— 開放模型生態持續壯大,AI 研究門檻持續降低
- 2026 精選 350+ AI 開源專案完整地圖:Agent、LLM、RAG 工具實戰推薦 —— 想自己動手玩多代理系統,從這份地圖開始
參考來源
- TechCrunch:An unreleased Anthropic model made progress on one of math’s biggest unsolved problems
- Ground News:An Unreleased Anthropic Model Made Progress on One of Math’s Biggest Unsolved Problems
- ScienceDaily:Claude Fable 5 AI finds a tiny formula that topples an 87-year-old math conjecture
- AI Weekly:Anthropic: Unreleased Claude Improves Zeta Bound to 67.2%
本文數據經 NotebookLM 多來源交叉驗證(10 個來源),數學細節以論文預印本與 Lean 4 代碼為準;研究成果尚未經期刊同儕評議,請讀者留意。
