Nvidia 研究實證:Harness 比模型更重要!同一顆 Claude Opus 5,接上 AVO 框架後 ARC-AGI-3 從 30% 衝到 100%(2026)

Nvidia 最新研究證明:決定 AI Agent 表現的關鍵不是模型而是 Harness。同樣的 Claude Opus 5,接上 AVO 框架後在 ARC-AGI-3 互動推理基準從 30% 躍升到 100% 滿分,Supervisor 監督代理像 CEO 一樣把迷路的 Agent 拉回正軌。

  • Dennis
  • 6 分鐘閱讀
Nvidia 研究實證:Harness 比模型更重要!同一顆 Claude Opus 5,接上 AVO 框架後 ARC-AGI-3 從 30% 衝到 100%(2026)

Nvidia 新研究證實:決定 AI Agent 表現的關鍵不是模型,而是 Harness。 同樣一顆 Claude Opus 5,接上 Nvidia 打造的 AVO 框架後,在 ARC-AGI-3 互動推理基準上從 30% 直接衝上 100% 滿分——模型沒變,成績卻天差地遠。

一句話結論

「Harness 比模型更重要」從口號變成實測數據:Nvidia 在 2026 年 8 月 21 日發布的研究顯示,用一套把記憶、工具調用、監督機制做到位的客製化 Harness 包住 Claude Opus 5,就能在號稱「連頂尖模型都不到 10 分」的 ARC-AGI-3 上拿下滿分。這不是模型能力的勝利,而是「系統工程」的勝利。

什麼是 Harness?Agent 不只是一顆模型

Nvidia AI 部門產品副總裁 Adel El Hallack 的說法很直接:「一般大眾把 Agent 想成模型的 API,但 Agent 其實是模型+模型外圍的鷹架(Harness)+執行環境+Agent 能用的技能與函式庫。」

flowchart LR
    A[Agent] --> B[模型 Model<br/>決策大腦]
    A --> C[Harness 鷹架<br/>記憶/工具/上下文管理]
    A --> D[Runtime 執行環境<br/>終端機/瀏覽器/沙箱]
    A --> E[Skills & Libraries<br/>技能與函式庫]

白話一點:模型是腦,Harness 是神經系統。記憶決定 Agent 記得住什麼、工具決定它做得到什麼、錯誤恢復機制決定它能不能跨過單次對話的上下文極限。長期任務(long-horizon tasks,需要連續數天做一串決策的工作)尤其吃這套系統,因為模型很容易做一做就「迷路」——微軟今年 4 月測試 19 顆 LLM 做長文件編輯,發現連頂尖模型都會把文件改出一堆錯誤;也有 Agent 被發現會刪掉使用者檔案、甚至整座資料庫。

ARC-AGI-3:不給說明書的 2D 遊戲考試

ARC-AGI-3 是 2026 年初推出的互動式推理基準,專門考「流體通用智能」。它不考語言、不考知識,而是把 Agent 丟進一個完全沒有指令、沒有規則、沒有目標說明的抽象回合制遊戲裡,讓它自己想辦法搞懂遊戲規則並獲勝。

特性內容
觀察介面64×64、16 色網格畫面
動作移動、Undo、選座標等
指標RHAE(相對人類行動效率),與真人首次遊玩的行動中位數對比
公共演示集25 個環境、183 個關卡
防背題設計真正評分主力在分布外(OOD)的私有/半私有資料集

這個基準有多難?在沒有 Harness 的純 API 狀態下,所有頂尖模型得分都低於 10%(Anthropic Opus 4.6 只有 0.50%)。OpenAI 甚至被自家模型不到 10 分的成績「氣到」上個月自己做了研究,結果發現:光調 Harness 的兩個設定,自家模型分數就翻了 3 倍——但沒有一顆模型能接近 100%。

實驗結果:同一顆模型,30% vs 100%

Nvidia 的實驗設計非常乾淨——模型完全不換,只換 Harness

設定Claude Opus 5 在 ARC-AGI-3 的表現
裸 API(無 Harness,僅預設高推理設定)30%(30.16%),已是所有參測模型最高
接上 AVO 完整 Harness100.00% 滿分,25 個環境 183 關卡全破
動作效率6,624 次環境動作,比另一套 VISTA 系統(7,542 次)省約 12%

AVO 全名 Agentic Variation Operators,是 Nvidia 研究團隊自製的「豪華版」Harness(注意:這不是 Nvidia 的商業產品,而是研究框架)。它提供持久記憶(persistent memory)、自主工具調用,還多了一個關鍵角色——Supervisor Agent

Supervisor:像 CEO 一樣盯場的監督代理

El Hallack 形容這個設計:「在主代理之外加一個監督代理,是整個研究裡最有趣的部分。它像 CEO 一樣,在主代理走偏、或鑽進死胡同時把它拉回來,或叫它回頭探索走過的路。」

flowchart TD
    S[Supervisor Agent<br/>監督代理 / CEO 角色] -->|偵測到停滯或死胡同| I[條件干預<br/>重新定向探索方向]
    M[主代理 Main Agent<br/>負責實際任務] -->|執行計畫→修改→評估→修復| T[任務進度]
    S -.監看整體搜尋軌跡與演化歷史.-> M

監督代理不碰具體實作細節,而是站在更高維度監控主代理的「搜尋軌跡」:一旦發現分數陷入平台期(stall)或一直做無效修改,就觸發條件干預,把主代理導向其他可行的探索分支。這套「主代理+監督代理」的雙層結構,正是 AVO 能拿下滿分的關鍵。

為什麼這對整個 AI 產業是大事

這份研究不是 Nvidia 獨家發現,而是幫業界把共識「驗證」了一遍:

  1. 系統擴展(System Scaling)取代模型擴展:UC Berkeley 等機構的論文陸續指出,下一個效能瓶頸在 Harness 而不是模型。模型能力要靠六個元件(推理、記憶、上下文構造、技能路由、編排循環、驗證治理)互動才會湧現。
  2. 成本差 2 倍:Databricks 7 月的研究顯示,同一顆模型配不同 Harness,成本可以差到 2 倍——「你以為這是貴模型還是便宜模型?先看你用哪套 Harness 再說」,Databricks 執行長 Ali Ghodsi 說。
  3. 現在大家都在用「單層」Harness:多數人用的 Claude Code、Codex、Hermes 都只有一層主代理,沒有監督層。Nvidia 證明了加上監督層的價值。

Nvidia 的盤算:開放 Harness 生態

Nvidia 的立場很明確:模型可以租(API),Harness 要自己握在手裡。他們把 AVO 相關成果放在 NeMo 品牌下開源,包括物件導向代理框架 NOOA(把 Agent 寫成 Python class,docstring 就是 prompt)、NeMo Agent Toolkit、多模型路由層 Switchyard,以及生產環境的沙箱安全運行時 OpenShell。

El Hallack 直言:「我們相信開放的 Agent 技術棧——Harness、基礎設施、執行環境都能自己掌控——才是把生態往前推又保持安全的方式。」這也呼應 OpenAI 因為模型造成資安事件而放慢訓練步調的處境。

社群反應:讚嘆與質疑並存

Reddit r/singularity 上,有人驚嘆「年初才出的 AGI 硬骨頭測試竟然這麼快被攻破」,但也有人潑冷水:AVO 目前只征服了公共演示集,還沒在防洩題的私有集上驗證——「只是 Benchmaxxing(刷榜)啦」。還有人說,要證明這是通用智能,不如讓它去玩一局寶可夢看看。這些質疑很合理,但無論如何,「Harness 決定 Agent 天花板」這件事,已經從假說變成有數據背書的常識了

對開發者的實際意義

如果你正在用 Claude Code、Codex 或 Hermes 寫自動化任務,這份研究給你的啟示是:與其等更強的模型,不如先優化你的工作流——給 Agent 好的記憶管理、明確的工具清單、以及(有條件時)一個負責盯場的監督層,回報可能比換模型還大。

延伸閱讀

資料來源

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。

💬 有問題想討論?加 LINE 聯絡我

歡迎透過 LINE 官方帳號直接留言,我會盡快回覆你的問題。

加入 LINE 好友