Inherent Faraday 論文複製測試勝過 Claude Opus 4.8 與 GPT-5.5:27B 小模型用強化學習打贏前沿大模型(2026)

倫敦 AI 實驗室 Inherent(DeepMind 校友創辦、5000 萬美元種子輪)宣稱其 Faraday agent 在獨立複製科學論文任務上,以僅 27B 參數的 Qwen 3.6 擊敗 Claude Opus 4.8 與 GPT-5.5。本文解析 Faraday 的強化學習方法、PaperBench 複製研究基準現況,以及 AI 科學代理的下一步。

  • Dennis
  • 6 分鐘閱讀
Inherent Faraday 論文複製測試勝過 Claude Opus 4.8 與 GPT-5.5:27B 小模型用強化學習打贏前沿大模型(2026)

倫敦 AI 實驗室 Inherent 宣稱其 Faraday agent 在「獨立複製科學論文」任務上,以僅 27B 參數的 Qwen 3.6 擊敗 Claude Opus 4.8 與 GPT-5.5 等前沿大模型,靠的不是模型大小,而是強化學習訓練出的「研究品味」。這家由 DeepMind 校友創辦、五月才以 5000 萬美元種子輪脫離隱形的新創,正在用「方法論勝過模型規模」的路線,挑戰 AI 科學代理的既有想像。

事件背景:低調的 DeepMind 校友團隊,突然端出實作

在 Google DeepMind 校友創辦的眾多新創裡,Inherent 原本相對低調。但根據 TechCrunch 8 月 22 日的報導,這家倫敦團隊在脫離隱形模式幾週後,就開始公開展示他們正在建造的東西:剛發布的 AI agent「Faraday」,在特定任務上勝過了 Anthropic 和 OpenAI 更大、更有名的模型——在沒有事先被告知答案的情況下,獨立重現已發表科學論文的發現

共同創辦人兼首席科學家 Edward Hughes 對 TechCrunch 表示,論文複製其實是科學家養成的標準訓練:「很多博士生都是從做這件事開始的。」

關鍵數據一覽

項目內容
公司Inherent(倫敦,Public Benefit Corporation)
創辦人Tantum Collins、Edward Hughes、Louis Kirsch(皆 DeepMind 校友)+ Kaloyan Aleksiev(Reka AI / Microsoft)
融資5000 萬美元種子輪(Index Ventures + Radical Ventures 共同領投,NVentures 等參投)
產品Faraday:AI 科學代理(跑在 Qwen 3.6,27B 參數)
對比對象Claude Opus 4.8(Anthropic)、GPT-5.5(OpenAI)
方法強化學習(reward-based)、「研究品味」訓練

Faraday 怎麼贏的?不是比模型大,是比「方法」

Hughes 說,贏過那些前沿 agent 本身不是重點——「怎麼做到的」才是。Faraday 的關鍵設計有三個:

第一,跑在很小的模型上。 Faraday 的底層是 Qwen 3.6,只有 27B 參數,對比 Claude Opus 4.8 和 GPT-5.5 這種「前沿規模」的系統,體積小了一個量級。這意味著 Inherent 證明的不是「再堆一個大模型」,而是「訓練方法可以讓小模型在特定任務上打贏大模型」。

第二,用強化學習教「品味」。 一般 agent 是靠規則或範例學習「科學怎麼做」,Inherent 反過來,用獎勵機制訓練 agent 什麼是「好結果」——不只是一次複製成功,而是要展現「研究品味」:直覺判斷哪些實驗值得跑、怎麼設計實驗才好。Hughes 說這是他們的最北極星:「打造一個 AI 科學家 agent,並把品味注入其中。」

第三,不自建工具,直接用 Codex。 Inherent 刻意不開發自己的 coding 工具,而是讓 Faraday 使用 OpenAI 的 GPT-5.5 Codex 來寫程式——就像人類科學家會用現成軟體,而不是自己造一套。這個「聚焦於科學決策、把工程外包」的取捨,其實就是 Agent Harness 思維的極致版:模型與框架的分工比單一模型的能力更重要

flowchart LR
    A[科學論文] --> B[Faraday agent<br/>Qwen 3.6 27B]
    B --> C[提出複製策略]
    C --> D[GPT-5.5 Codex<br/>寫實驗程式]
    D --> E[執行實驗]
    E --> F{結果符合<br/>論文數據?}
    F -- 否 --> B
    F -- 是 --> G[獎勵 + 更新<br/>研究品味]
    G --> B

為什麼「複製論文」是硬指標:人類也才 41%

你可能會想:複製別人的研究有什麼難?事實上是極難。OpenAI 在 2025 年發布的 PaperBench 基準,要求 AI 在 12 小時內重現 20 篇 ICML 2024 頂尖論文,不能看原作者程式碼,要自己從零寫完整程式庫,總共 8300 多個評估檢查點。結果:

系統成功率
人類 PhD 學生(8 人、48 小時)41.4%
OpenAI o1 + IterativeAgent 框架24.4%
Claude 3.5 Sonnet21%
OpenAI o1(預設)13.2%
DeepSeek-R16%
GPT-4o4.1%
Gemini 2.0 Flash3.2%

換句話說,兩年前最強 AI 的複製成功率只有人類博士生的六成,而且還得靠 IterativeAgent 這種框架加持才辦得到。Faraday 能在這個任務上贏過 Claude Opus 4.8 和 GPT-5.5,代表這一年 agent 方法論的進步,遠比模型本身的進步更可觀。

背景:AI 科學論文 59% 是假的,複製測試更顯重要

為什麼大家這麼看重「複製」?2026 年發表的 MLReplicate 基準(評估 AI Scientist V1/V2、Agent Laboratory 等 6 個自主科學系統)給出了警訊:AI 寫的論文能騙過自動審稿(37 篇有 10 篇被接受),但人類專家評審把所有系統的論文全部打到 Borderline-Reject 或 Reject——其中 59% 被自動審稿接受的論文含有捏造數據。AI 評審與人類評審的整體評分相關性只有 r = +0.29。

這解釋了 Inherent 的戰略:如果連「複製已知結果」都做不好,談何「發現新知」?複製測試是衡量 AI 是否真的懂科學的試金石——Faraday 先證明自己在這關比大模型強,再往「提出值得問的問題」這個終極目標推進。

團隊與資金:倫敦的 DeepMind 血統

Inherent 的四位創辦人:

  • Tantum Collins:DeepMind 合作博弈(Cooperative AI)研究出身,曾在拜登白宮負責 AI 政策
  • Edward Hughes:DeepMind Cooperative AI 研究,現任首席科學家
  • Louis Kirsch:DeepMind 校友
  • Kaloyan Aleksiev:來自 Reka AI 與微軟

種子輪由 Index VenturesRadical Ventures 共同領投,NVIDIA 旗下 NVentures、Ex/Ante、Metaplanet 等參投;天使陣容包括 Charlie Songhurst、Dwarkesh PatelThomas Wolf(Hugging Face 共同創辦人)、Max Jaderberg 等人。公司註冊為 益責公司(Public Benefit Corporation)——法律上要求同時考慮社會影響與股東利益,創辦團隊把「治理」視為競爭優勢。

Hughes 還呼籲取消英國的 garden leave(離職員工數個月內不得加入或創辦競爭公司的條款),認為這讓美國新創在挖角上佔盡優勢。Inherent 目前 12 人、全員在倫敦 King’s Cross 辦公室實體辦公,年底預計擴到 20-25 人,並有**世界模型(world models)**的野心——在 Demis Hassabis 新職位讓部分 DeepMind 員工不安之際,這家公司可能成為 DeepMind 人才的下一個落腳處。

對台灣讀者的意義:Agent 方法論時代來臨

Faraday 這則新聞最值得留意的,不是「又一家 AI 新創融資」,而是它與過去一週的主流論述完全同頻:

  • Nvidia 上週才發布研究,證明 Harness(框架)比模型更重要——同一顆 Claude Opus 5 接上 AVO 框架後 ARC-AGI-3 從 30% 衝到 100%;
  • 如今 Inherent 用 27B 小模型在論文複製上贏過前沿大模型,再次印證**「模型 × 方法」的乘數效應**。

對正在選擇 AI 工具、評估 agent 框架的開發者來說,訊號很明確:別再只看模型 benchmark,Agent 的架構、訓練方法與工具鏈才是差異化所在。 這也解釋了為什麼 Stripe 願意花 70 億美元買下 OpenRouter——模型會越來越像商品,真正有價值的在於讓模型「會做事」的那一層。

Faraday 還沒有公布具體的複製成功率數字,也還沒有第三方複測——這點值得持續觀察。但方向已經很清楚:AI 科學代理的下一個戰場,不是誰的模型大,而是誰的方法教得出「品味」。

參考資料

  • TechCrunch:Inherent, founded by DeepMind alumni, says its AI ’teammate’ just outperformed Anthropic and OpenAI at replicating research(2026-08-22)
  • The Next Web:Ex-DeepMind researchers raised $50M to build AI that figures out which scientific questions are worth asking(2026-05-30)
  • OpenAI PaperBench 基準測試(2025)
  • MLReplicate: Benchmarking Autonomous Research Systems for Machine Learning Reproducibility(2026)

延伸閱讀

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。

💬 有問題想討論?加 LINE 聯絡我

歡迎透過 LINE 官方帳號直接留言,我會盡快回覆你的問題。

加入 LINE 好友