Nvidia 的 Harness 框架助力 Claude Opus 5 在 ARC-AGI-3 上的得分从 30% 跃升至 100%

新闻摘要
2026 年 8 月 21 日,Nvidia 发表研究指出,AI 智能体性能的最大提升如今源于包裹模型的软件层,而非模型本身。该公司将这种封装层称为“harness”——即编排代码、记忆系统、工具访问权限和监督逻辑,它们能将原始语言模型转化为能够长时间自主运行的智能体。
核心观点:驱动性能的是 harness 而非模型
Nvidia 智能体 AI 产品副总裁 Adel El Hallak 表示,业界对智能体的理解一直存在偏差,往往将智能体“几乎视为模型的 API”,而非由多个交互部件构成的系统。在 Nvidia 的定义中,智能体等于模型加上其外围支架——即 harness,其中包括模型可调用的工具、记忆的存储与检索方式、约束其行为的规则,以及在漫长多步骤任务中防止其偏离轨道的检查机制。
为具体说明这一点,Nvidia 研究人员使用了 Anthropic 的 Claude Opus 5 并在 ARC-AGI-3 上进行了测试。ARC-AGI-3 是非营利组织 ARC Prize Foundation 推出的基准测试,它将 AI 智能体置于陌生的类游戏中环境中,且不提供任何指令或明确目标。智能体必须通过探索,在多轮试错和观察中建立对规则的理解并完成目标,因此这是对规划和记忆能力的严格考验,而非单次问答测试。
从 30% 到 100%:AVO 实验
仅使用默认设置时,Claude Opus 5 完成了 ARC-AGI-3 公开关卡中约 30% 的任务。随后,Nvidia 将该模型封装在其自研的名为 Agentic Variation Operators (AVO) 的 harness 框架中,增加了跨轮次的持久化记忆以及一个“监督者”组件。Nvidia 描述该组件的作用类似于 CEO——负责审查智能体的进度、发现死胡同,并在其浪费更多操作前重新调整策略。在引入 AVO 且不对底层模型做任何其他更改的情况下,该系统完成了基准测试 25 个公开环境中的全部 183 个关卡,在 ARC-AGI-3 的相对人类行动效率 (RHAE) 指标上获得了 100.00 的满分。此外,与排行榜上此前表现最佳的系统(名为 VISTA 的 harness)相比,该系统使用的环境操作减少了约 12%。
自 2026 年 3 月下旬作为通用编码智能体系统推出以来,Nvidia 一直在开发 AVO,最初旨在优化 CUDA GPU 内核。值得注意的是,此次 ARC-AGI-3 的结果源自 Nvidia 团队自行运行并报告的基准测试公开任务接口的重新实现版本,并非经由 ARC Prize Foundation 官方排行榜独立验证的运行结果;且该测试仅涵盖 25 个公开发布的环境,不包括用于官方排名的半私有或全私有竞赛集。
来自业界的佐证
据报道,Nvidia 的演示恰逢过去几个月内其他机构发布的一系列类似发现。2026 年 4 月,Microsoft 针对真实世界的文档编辑任务测试了 19 个大语言模型,结果发现,若缺乏精心设计的 harness,所有模型生成的内容都错误百出。2026 年 7 月,OpenAI 报告称,仅通过调整模型周围 harness 中的两个设置,无需更改模型本身,就能使其自有模型在 ARC-AGI-3 上的得分大致翻三倍。同月,Databricks 发表研究发现,harness 的选择对运行智能体任务总成本的影响约为底层模型选择的两倍。
Nvidia 自己的技术博客也单独详细介绍了一个相关框架,内部称为 NOOA,该框架列出了工程师可用于提升模型性能的六种 harness 设计能力:类型化的输入和输出需经过验证而非作为自由文本传递;允许模型通过引用而非序列化数据操作实时对象;将编写的代码视为包含控制流的完整动作;使编排循环成为清晰可编辑的代码而非隐藏的黑盒;在智能体对象上保持持久的类型化状态,而非将其埋藏在对话历史中;以及将上下文和事件历史作为 API 公开,供模型自身检查和管理。Nvidia 报告称,该方法在 SWE-bench Verified 软件工程基准测试中达到了 82.2% 的准确率,且每个任务所需的模型调用次数和 token 数量明显少于同类系统。
重要意义
这些发现重塑了 AI 行业对自主智能体进步的看法。Nvidia 的研究表明,不应将每一次能力飞跃都归因于更新、更大或更昂贵的底层模型,位于模型之上的工程层——即它如何记忆、如何被监督以及如何被允许行动——可能才是完成现实世界任务的更大杠杆,尤其是在跨越多个步骤的长周期问题上。对于构建 AI 智能体的开发者和企业而言,这意味着在 harness 设计、记忆架构和监督逻辑上的投资,其回报可能与升级到最新发布的模型相当,甚至更高。