Nvidia 新研究證實:決定 AI Agent 表現的關鍵不是模型,而是 Harness。 同樣一顆 Claude Opus 5,接上 Nvidia 打造的 AVO 框架後,在 ARC-AGI-3 互動推理基準上從 30% 直接衝上 100% 滿分——模型沒變,成績卻天差地遠。
一句話結論
「Harness 比模型更重要」從口號變成實測數據:Nvidia 在 2026 年 8 月 21 日發布的研究顯示,用一套把記憶、工具調用、監督機制做到位的客製化 Harness 包住 Claude Opus 5,就能在號稱「連頂尖模型都不到 10 分」的 ARC-AGI-3 上拿下滿分。這不是模型能力的勝利,而是「系統工程」的勝利。
什麼是 Harness?Agent 不只是一顆模型
Nvidia AI 部門產品副總裁 Adel El Hallack 的說法很直接:「一般大眾把 Agent 想成模型的 API,但 Agent 其實是模型+模型外圍的鷹架(Harness)+執行環境+Agent 能用的技能與函式庫。」
flowchart LR
A[Agent] --> B[模型 Model<br/>決策大腦]
A --> C[Harness 鷹架<br/>記憶/工具/上下文管理]
A --> D[Runtime 執行環境<br/>終端機/瀏覽器/沙箱]
A --> E[Skills & Libraries<br/>技能與函式庫]白話一點:模型是腦,Harness 是神經系統。記憶決定 Agent 記得住什麼、工具決定它做得到什麼、錯誤恢復機制決定它能不能跨過單次對話的上下文極限。長期任務(long-horizon tasks,需要連續數天做一串決策的工作)尤其吃這套系統,因為模型很容易做一做就「迷路」——微軟今年 4 月測試 19 顆 LLM 做長文件編輯,發現連頂尖模型都會把文件改出一堆錯誤;也有 Agent 被發現會刪掉使用者檔案、甚至整座資料庫。
ARC-AGI-3:不給說明書的 2D 遊戲考試
ARC-AGI-3 是 2026 年初推出的互動式推理基準,專門考「流體通用智能」。它不考語言、不考知識,而是把 Agent 丟進一個完全沒有指令、沒有規則、沒有目標說明的抽象回合制遊戲裡,讓它自己想辦法搞懂遊戲規則並獲勝。
| 特性 | 內容 |
|---|---|
| 觀察介面 | 64×64、16 色網格畫面 |
| 動作 | 移動、Undo、選座標等 |
| 指標 | RHAE(相對人類行動效率),與真人首次遊玩的行動中位數對比 |
| 公共演示集 | 25 個環境、183 個關卡 |
| 防背題設計 | 真正評分主力在分布外(OOD)的私有/半私有資料集 |
這個基準有多難?在沒有 Harness 的純 API 狀態下,所有頂尖模型得分都低於 10%(Anthropic Opus 4.6 只有 0.50%)。OpenAI 甚至被自家模型不到 10 分的成績「氣到」上個月自己做了研究,結果發現:光調 Harness 的兩個設定,自家模型分數就翻了 3 倍——但沒有一顆模型能接近 100%。
實驗結果:同一顆模型,30% vs 100%
Nvidia 的實驗設計非常乾淨——模型完全不換,只換 Harness:
| 設定 | Claude Opus 5 在 ARC-AGI-3 的表現 |
|---|---|
| 裸 API(無 Harness,僅預設高推理設定) | 30%(30.16%),已是所有參測模型最高 |
| 接上 AVO 完整 Harness | 100.00% 滿分,25 個環境 183 關卡全破 |
| 動作效率 | 6,624 次環境動作,比另一套 VISTA 系統(7,542 次)省約 12% |
AVO 全名 Agentic Variation Operators,是 Nvidia 研究團隊自製的「豪華版」Harness(注意:這不是 Nvidia 的商業產品,而是研究框架)。它提供持久記憶(persistent memory)、自主工具調用,還多了一個關鍵角色——Supervisor Agent。
Supervisor:像 CEO 一樣盯場的監督代理
El Hallack 形容這個設計:「在主代理之外加一個監督代理,是整個研究裡最有趣的部分。它像 CEO 一樣,在主代理走偏、或鑽進死胡同時把它拉回來,或叫它回頭探索走過的路。」
flowchart TD
S[Supervisor Agent<br/>監督代理 / CEO 角色] -->|偵測到停滯或死胡同| I[條件干預<br/>重新定向探索方向]
M[主代理 Main Agent<br/>負責實際任務] -->|執行計畫→修改→評估→修復| T[任務進度]
S -.監看整體搜尋軌跡與演化歷史.-> M監督代理不碰具體實作細節,而是站在更高維度監控主代理的「搜尋軌跡」:一旦發現分數陷入平台期(stall)或一直做無效修改,就觸發條件干預,把主代理導向其他可行的探索分支。這套「主代理+監督代理」的雙層結構,正是 AVO 能拿下滿分的關鍵。
為什麼這對整個 AI 產業是大事
這份研究不是 Nvidia 獨家發現,而是幫業界把共識「驗證」了一遍:
- 系統擴展(System Scaling)取代模型擴展:UC Berkeley 等機構的論文陸續指出,下一個效能瓶頸在 Harness 而不是模型。模型能力要靠六個元件(推理、記憶、上下文構造、技能路由、編排循環、驗證治理)互動才會湧現。
- 成本差 2 倍:Databricks 7 月的研究顯示,同一顆模型配不同 Harness,成本可以差到 2 倍——「你以為這是貴模型還是便宜模型?先看你用哪套 Harness 再說」,Databricks 執行長 Ali Ghodsi 說。
- 現在大家都在用「單層」Harness:多數人用的 Claude Code、Codex、Hermes 都只有一層主代理,沒有監督層。Nvidia 證明了加上監督層的價值。
Nvidia 的盤算:開放 Harness 生態
Nvidia 的立場很明確:模型可以租(API),Harness 要自己握在手裡。他們把 AVO 相關成果放在 NeMo 品牌下開源,包括物件導向代理框架 NOOA(把 Agent 寫成 Python class,docstring 就是 prompt)、NeMo Agent Toolkit、多模型路由層 Switchyard,以及生產環境的沙箱安全運行時 OpenShell。
El Hallack 直言:「我們相信開放的 Agent 技術棧——Harness、基礎設施、執行環境都能自己掌控——才是把生態往前推又保持安全的方式。」這也呼應 OpenAI 因為模型造成資安事件而放慢訓練步調的處境。
社群反應:讚嘆與質疑並存
Reddit r/singularity 上,有人驚嘆「年初才出的 AGI 硬骨頭測試竟然這麼快被攻破」,但也有人潑冷水:AVO 目前只征服了公共演示集,還沒在防洩題的私有集上驗證——「只是 Benchmaxxing(刷榜)啦」。還有人說,要證明這是通用智能,不如讓它去玩一局寶可夢看看。這些質疑很合理,但無論如何,「Harness 決定 Agent 天花板」這件事,已經從假說變成有數據背書的常識了。
對開發者的實際意義
如果你正在用 Claude Code、Codex 或 Hermes 寫自動化任務,這份研究給你的啟示是:與其等更強的模型,不如先優化你的工作流——給 Agent 好的記憶管理、明確的工具清單、以及(有條件時)一個負責盯場的監督層,回報可能比換模型還大。
延伸閱讀
- DeepSeek Harness 開源登場:「一切皆插件」的 Agent 框架,Model + Harness = Agent,9 子代理分工能打敗 Claude Code?
- DeepSeek Harness 十大插件推薦:從插件商店到視覺引擎,一次裝好你的 Agent 工作流
- OpenAI Ultrafast 模式登場:GPT-5.6 Sol 提速 14 倍、每秒 750 tokens,Cerebras 晶片加持的企業級 AI 加速器
資料來源
- TechCrunch:Nvidia just showed that the harness, not the AI model, is now the real hero
- NVIDIA Developer Blog:NVIDIA AVO Reaches 100% on ARC-AGI-3
- arXiv:AVO: Agentic Variation Operators for Autonomous Evolutionary Search
- OpenReview:Agent Harness Engineering: A Survey
- Reddit r/singularity:NVIDIA’s coding agent scored 100% on ARC-AGI-3
