首頁 / 資訊 / Nvidia 的 Harness 框架將 Claude Opus 5 在 ARC-AGI-3 上的得分從 30% 提升至 100%
AI 代理

Nvidia 的 Harness 框架將 Claude Opus 5 在 ARC-AGI-3 上的得分從 30% 提升至 100%

2026年8月22日4 分鐘閱讀
Nvidia 的 Harness 框架將 Claude Opus 5 在 ARC-AGI-3 上的得分從 30% 提升至 100%

新聞摘要

2026 年 8 月 21 日,Nvidia 發表研究指出,AI 代理效能的最大提升現在來自包覆模型的軟體層,而非模型本身。該公司將這種封裝稱為「harness」——包含編排程式碼、記憶體系統、工具存取權限及監督邏輯,能將原始語言模型轉化為可長時間自主運作的代理。

核心主張:驅動效能的是 harness,而非模型

Nvidia 代理 AI 產品副總裁 Adel El Hallak 表示,業界對代理的思考方式一直有誤,幾乎將代理視為「模型的 API」,而非由多個互動組件構成的系統。在 Nvidia 的架構中,代理是模型加上其周邊的支架——即 harness——其中包括模型可呼叫的工具、記憶體的儲存與檢索方式、約束其行為的規則,以及在漫長的多步驟任務中防止其偏離軌道的檢查機制。

為了具體說明這一點,Nvidia 研究人員使用了 Anthropic 的 Claude Opus 5 並在 ARC-AGI-3 上進行測試。ARC-AGI-3 是由非營利組織 ARC Prize Foundation 推出的基準測試,它將 AI 代理置於陌生的類遊戲環境中,不提供任何指令或明確目標。代理必須透過探索、建立規則的運作模型,並在多個回合中純粹依靠試錯與觀察來完成目標,這使其成為對規劃與記憶能力的嚴格考驗,而非單次問答測試。

從 30% 到 100%:AVO 實驗

僅使用預設設定時,Claude Opus 5 完成了 ARC-AGI-3 公開關卡中約 30% 的任務。隨後,Nvidia 將同一模型封裝在其自研的 harness 框架「Agentic Variation Operators (AVO)」中,加入了跨回合的持久化記憶體以及一個「監督者」元件。Nvidia 描述該元件的功能類似執行長——負責審查代理的進度、發現死路,並在浪費更多動作之前重新調整策略。在導入 AVO 且未對底層模型進行任何其他更改的情況下,該系統完成了基準測試 25 個公開環境中的所有 183 個關卡,在 ARC-AGI-3 的相對人類動作效率 (RHAE) 指標上達到了滿分 100.00,並且所使用的環境動作比該排行榜上先前表現最佳的系統(名為 VISTA 的 harness)少了約 12%。

Nvidia 自 2026 年 3 月下旬將 AVO 作為通用程式設計代理系統推出以來,一直在開發此框架,最初是為了優化 CUDA GPU 核心而建構。值得注意的是,這項 ARC-AGI-3 結果來自 Nvidia 團隊自行執行並報告的基準測試公開任務介面重實作版本,並非經過 ARC Prize Foundation 官方排行榜獨立驗證的結果,且僅涵蓋 25 個公開釋出的環境,不包括用於官方排名的半私人或完全私人競賽集。

來自業界的佐證

根據報導,Nvidia 的演示與其他組織在過去幾個月中的一系列類似發現不謀而合。2026 年 4 月,Microsoft 針對真實世界的文件編輯任務測試了 19 個大型語言模型,發現若沒有精心設計的 harness 圍繞,每個模型產出的結果都充滿錯誤。2026 年 7 月,OpenAI 報告稱,僅透過調整模型周圍 harness 內的兩個設定,無需更改模型本身,就能使其自有模型在 ARC-AGI-3 上的得分大致提高至三倍。同月,Databricks 發表的研究發現,harness 的選擇對執行代理任務總成本的影響,約為底層模型選擇的兩倍。

Nvidia 自家的技術部落格也另行詳細介紹了一個相關框架,內部稱為 NOOA,該框架列出了工程師可用於提升模型效能的六項 harness 設計能力:輸入與輸出需經過型別驗證而非作為自由文字傳遞;允許模型透過參照操作即時物件而非序列化資料;將撰寫的程式碼視為動作本身,並包含完整的控制流程;使編排迴圈成為清晰、可編輯的程式碼,而非隱藏的黑盒子;在代理物件上保持持久化的型別狀態,而非將其埋藏在對話歷史中;以及將上下文與事件歷史公開為 API,供模型自身檢查與管理。Nvidia 報告指出,這種方法在 SWE-bench Verified 軟體工程基準測試中達到了 82.2% 的準確率,且每個任務所需的模型呼叫次數與 token 數量明顯少於同类系統。

為何這很重要

這些發現重塑了 AI 產業對自主代理進展的看法。Nvidia 的研究表明,不應將每一次的能力躍升都歸因於更新、更大或更昂貴的底層模型,位於模型之上的工程層——包括其記憶方式、監督方式以及被允許採取行動的方式——可能是實際任務完成(特別是在涉及多個步驟的長期問題上)更強大的槓桿。對於正在建構 AI 代理的開發者與企業而言,這意味著投資於 harness 設計、記憶體架構與監督邏輯所帶來的回報,可能不亞於甚至超過升級至最新發布的模型。

AI 代理Nvidia