Anthropic 未發布 Claude 突破黎曼猜想研究:臨界線零點比例 41.6%→67.2%,60 個 AI 子代理 36 小時改寫解析數論紀錄(2026)

Anthropic 未發布的 Claude 研究版模型,用 60 個子代理、3100 萬 token 在 36 小時內,把黎曼 zeta 函數臨界線零點比例下界從 41.6% 一口氣推進到 67.2%,還通過 Lean 4 機器驗證。解析數論 37 年僅前進 0.8 個百分點,AI 一次跳了 25.6 個百分點。

  • Dennis
  • 7 分鐘閱讀
Anthropic 未發布 Claude 突破黎曼猜想研究:臨界線零點比例 41.6%→67.2%,60 個 AI 子代理 36 小時改寫解析數論紀錄(2026)

Anthropic 未發布的 Claude 研究版模型,以 60 個子代理協作、耗費 3100 萬 token,在約 36 小時內將黎曼 zeta 函數落在臨界線上的零點比例下界從 41.6% 推進到 67.2%,並通過 Lean 4 形式化驗證——解析數論 37 年來人類只前進了 0.8 個百分點,AI 一次跳了 25.6 個百分點。

一句話結論

黎曼猜想(Riemann Hypothesis)至今未被證明,但人類數學家一直在退而求其次:證明「至少有百分之多少」的 zeta 函數零點落在臨界線上。Anthropic 一個未發布的 Claude 研究版模型,用多代理協作把這個「臨界線零點比例下界」從 41.6% 大幅推升到 67.2%,被學者形容為自 2013 年張益唐證明質數間距以來,解析數論領域最重大的進展。

黎曼猜想是什麼?為什麼 67.2% 很了不起

黎曼猜想於 1859 年提出,是數學界最著名的未解難題之一,也是 Clay 數學研究所七大「千禧年大獎難題」之一(懸賞一百萬美元)。它主張:黎曼 zeta 函數的所有非平凡零點,實部都等於 1/2——也就是全部落在複數平面上的一條垂直線上,數學家稱之為「臨界線」(Critical Line)。

由於直接證明「100% 零點都在臨界線上」太困難,解析數論學家長期採用一個「累積式」策略:先證明至少有一定比例的零點在臨界線上,再逐年拉高這個比例。這個數字在過去半世紀進步極其緩慢:

年份研究者臨界線零點比例下界
1974Levinson約 1/3(33%)
1989Conrey約 2/5(40%)
2020Pratt、Robles、Zaharescu、Zeindler約 41.6%(5/12)
2026Claude(未發布研究版)67.250%

看出重點了嗎?從 1974 到 2020 的 46 年間,人類數學家平均每年只把這個數字推高 0.18 個百分點;2020 年之後的 6 年,幾乎原地踏步。而 Claude 在短短 36 小時內,把下界一舉推高了 25.6 個百分點——超過人類半世紀的總進度。

⚠️ 必須澄清:這不代表證明了 67.2% 的黎曼猜想。67.2% 是「漸近下界」(asymptotic lower bound),表示在極大高度範圍內,至少有 67.2% 的零點經嚴格證明落在臨界線上;其餘 32.8% 只是「尚未被分類」,並非不在臨界線上。Claude 距離完整證明黎曼猜想,還差得遠。

這不是「問一句話」——60 個 AI 子代理的大型研究計畫

這項成果並非單次提示詞的靈光一現,而是 Anthropic 內部一場多代理協同研究實驗的產物:

graph TD
    A[Claude 研究版模型] --> B[2 個關鍵點子 Agent<br/>提出核心數學猜想]
    B --> C[13 個支持點子 Agent<br/>補齊細節]
    C --> D[30 個探索 Agent<br/>走死胡同被淘汰]
    D --> E[13 個驗證 Agent<br/>檢查邏輯、找反例、數值驗證]
    E --> F[2 個寫作 Agent<br/>草擬學術論文]
    F --> G[Lean 4 形式化驗證<br/>Eric Easley 協作]
    G --> H[數學家審查<br/>Conrey & Goldston]

實驗在兩個 Claude Code 會話中進行,歷時 36 至 54 小時,總共消耗約 3100 萬個輸出 token、執行了 2400 個 shell 指令、撰寫數百個 Python 腳本,並進行數千次數值驗證。系統動用了約 60 個子代理,分工如下:

  • 2 個關鍵點子 Agent:提出核心數學方向
  • 13 個支持點子 Agent:為關鍵概念補充細節
  • 30 個探索 Agent:負責嘗試各種路徑,多數走入死胡同被淘汰(最初模型生成了 650 個失敗想法)
  • 13 個驗證 Agent:審查證明邏輯一致性、尋找反例、做數值檢查
  • 2 個寫作 Agent:把結果起草成學術論文

最有趣的細節:人類主持人是「啦啦隊」

主持這個項目的,是 Anthropic 研究員 Jarred Sumner——對,就是 JavaScript 執行環境 Bun 的創辦人,本身並非專業數學家。Sumner 幾乎沒有提供任何數學方向的實質指導,他的主要工作是:提供運算資源、擔任管理與精神支柱,以及在模型自我懷疑(模型起初高度懷疑自己能否在這種難題上有進展)時,反覆發送「繼續前進」「再試一次」「相信自己」這類指令激勵模型。

換句話說,數學突破是 AI 自己想出來的,人類負責喊加油

數學上它到底做了什麼?

根據 NotebookLM 對多篇報導與論文摘要的交叉比對,Claude 並非憑空捏造,而是把既有數學工具做了漂亮的組合:

  1. 建立新橋樑:將 Montgomery(1973)的經典方法,與 Bombieri(約 2000 年)、Baluyot 等人(2023/2024)關於「無條件雙相關」的最新成果結合
  2. 二次型與慣性定理:構建適當的函數空間,利用 Weil 顯式公式誘導出不定厄米特二次型,再透過 Sylvester 慣性定理,把臨界線上的零點與線外零點分別映射到正定與負定方向
  3. 秩-跡不等式:發明了一條全新的 rank–trace 不等式,利用 Gram 矩陣的跡與 Frobenius 範數的關係,在不必確定單個零點位置的情況下,算出臨界線上零點數量的整體下界

可信度:Lean 4 機器驗證 + 頂尖數學家背書

AI 給出的數學,最怕的是幻覺。這項成果在驗證上做得很足:

  • 自主文獻檢查:Claude 自行下載了 54 篇 arXiv 論文,確認成果未被他人發表,並指派獨立代理從頭重新推導
  • Lean 4 形式化證明:Claude 主動提議撰寫論文並進行專家驗證,與 Anthropic 員工 Eric Easley 合作,把關鍵定理轉化為 Lean 4 形式化語言,通過標準編譯與驗證工具(Comparator),沒有任何 sorry 佔位符——也就是機器可置信的證明
  • 數學家人工審查:內部由數學家 Levent Alpöge(哈佛大學)與 Ralph Furman 審查;外部邀請了兩位解析數論權威——1989 年 2/5 臨界線紀錄保持者 Brian ConreyDan Goldston——審閱並提供反饋

專家怎麼說?

Menlo Ventures 合夥人兼研究員 Deedy Das 稱這項成果「超乎想像地卓越(extraordinary)」,認為這可能是自 2013 年張益唐在有界質數間距取得突破以來,解析數論領域最重大的進展。

當然,學界態度依然審慎:目前成果處於高證據力的預印本(preprint)階段,尚未完成期刊同儕評議;Anthropic 公布了論文、Lean 代碼與部分對話紀錄,但未公開模型權重與完整思考元數據,外部研究員暫時無法獨立重現這場 3100 萬 token 的搜索實驗。

對 AI 數學能力的意義

graph LR
    A[過去:IMO 競賽題<br/>AlphaProof、Gemini Deep Think] --> B[答案已知、追求解題]
    C[現在:Claude 研究版<br/>黎曼 zeta 67.2%] --> D[完全開放、人類無解的科研問題]
    B --> E[AI 數學新時代]
    D --> E

過去 DeepMind 的 AlphaProof、Google 的 Gemini Deep Think 等數學 AI,主要是在 IMO 奧林匹亞競賽這類「已有既定解答」的問題上大放異彩。Claude 這次證明的是:前沿大模型已經有能力處理真正開放、人類尚無解答的科學研究問題——自主導航文獻、發現新理論連結、自我糾錯,最後還懂得用 Lean 4 給自己上保險。

這也呼應了近期另一個震撼數學界的事件:Anthropic 員工 Levent Alpöge 用 Claude Fable 5,在 2026 年 7 月推翻了存在 87 年的雅可比猜想(Jacobian Conjecture),找到的反例公式極簡到只有 216 個字元。兩起事件接連發生,宣告「AI 作為數學研究夥伴」的時代正式來臨。

延伸閱讀

參考來源

本文數據經 NotebookLM 多來源交叉驗證(10 個來源),數學細節以論文預印本與 Lean 4 代碼為準;研究成果尚未經期刊同儕評議,請讀者留意。

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。