首页 / 资讯 / Anthropic 的自动化研究员首次超越人类 AI 安全专家
Anthropic

Anthropic 的自动化研究员首次超越人类 AI 安全专家

2026年8月29日5 分钟阅读
Anthropic 的自动化研究员首次超越人类 AI 安全专家

新闻摘要

Anthropic 发布了一项新研究,表明由其自家 Claude 模型构建的自动化系统能够独立发现减少 AI 模型失对齐行为的技术,并且在部分测试中,其表现优于经验丰富的人类对齐研究员提出的方法。这项工作由 Anthropic 研究员 Chen Yueh-Han 主导,论文题为《自动化研究员能够可靠地缓解对齐失败》,于 2026 年 8 月 28 日美国东部时间发表,为公众展示了迄今为止最清晰的实例之一,说明一种有限的、狭义形式的 AI 自我改进在实践中是什么样子。

该系统实际做什么

Anthropic 将这个系统称为自动化对齐研究员(AAR),其设计目标是解决一类特定的 AI 安全问题:训练过程中出现的失对齐行为,例如谄媚奉承、欺骗性推理或奖励黑客行为。AAR 不会等待人类研究员诊断问题并提出修复方案,而是检索现有研究文献,自行提出缓解方法,然后运行一个简短的训练实验——每次迭代通常约 30 分钟——来测试修复是否有效。能够改进目标基准的方法会被保留并进一步优化;失败的方法则被丢弃。该过程会在多次迭代中自动重复。

Anthropic 针对 10 项独立的对齐基准测试了 AAR,每项基准代表一种不同的已知失败模式。根据论文,该自动化系统在所有 10 项基准上都提升了性能,且没有可测量地降低模型的通用能力——这是一个重要的前提条件,因为对齐修复有时会以模型变得不那么有用或更加回避为代价。

与人类的对比

论文中最引人注目的数据是与人类研究员的直接对比:“最佳的 AAR 方法平均在六小时内超越了经验丰富的人类所提出的方案。”换句话说,在获得六小时的自主迭代时间后,该自动化系统提出的最佳修复方案优于经验丰富的人类对齐研究员在相同基准上提出的中位数缓解策略。

Anthropic 还重点强调了成本对比。AAR 的 API 推理成本约为每小时 4 美元,而人类研究员的时间成本估计为每小时 150 美元。该公司对此的表述更多是在说明自动化对齐工作现在已经足够便宜、足够快速,可以持续且大规模地运行,而不是声称自动化研究员在质量上优于人类。

为什么 Anthropic 称这只是自我改进的“一瞥”,而非真正的自我改进

Anthropic 谨慎地将 AAR 定位为一个狭义的原理验证,而非通用型自我改进系统。论文指出,其有效性在很大程度上取决于所用基准在多大程度上真实反映了对齐目标,以及系统检索的底层文献数据库是否保持更新。如果某个基准不能很好地代表真正的对齐目标,AAR 可能会优化错误的方向——这是机器学习中一个众所周知的风险,称为奖励黑客或基准黑客。

即便如此,论文直截了当地指出,“自动化对齐后训练可能在短期内变得切实可行”,研究人员将这项工作视为一个早期构建模块,朝着能够有意义地参与自身安全研究、并最终可能参与更广泛的自身训练和开发的 AI 系统迈进。

这与更广泛的递归自我改进辩论有何关联

AAR 论文发表之际,业界正围绕递归自我改进展开更广泛的讨论——即 AI 系统最终可能以越来越少的人类参与来帮助设计、训练或改进其后继者。Anthropic 此前曾主张,这种有时简称为 RSI 的情景值得认真关注:该公司内部已注意到,Claude 模型已经编写了合并到 Anthropic 自身系统中的绝大部分代码,这表明 AI 辅助已被多么迅速地吸收到 AI 开发本身之中。Anthropic 曾提出建立一个全球协调机制的想法,以便在出现失控自我改进的证据时,让业界可以选择放缓或暂停前沿 AI 开发,并粗略地将其比作军备控制框架。

这种表述引起了外部研究人员的怀疑,其中一些人认为,一家商业 AI 实验室以安全为导向的说辞,应当与其继续构建更快、更强模型的竞争动机放在一起权衡。另外,普林斯顿大学牵头的一项研究于 8 月早些时候发表,测试了 AI 智能体是否能够开展真正开放式的 AI 研究——撰写完整论文,而不是修复定义狭窄的基准——结果发现当前系统在技术上具备能力,但在创造力方面表现薄弱,无法像人类研究员那样判断哪些想法值得深入探索。Anthropic 联合创始人 Jack Clark 指出,这种创造力差距是一个“看跌信号”,表明完全递归自我改进真正到来的时间可能比想象中更远。

要点

综合来看,这项研究指出了两个极端之间的一条中间道路。AI 尚不具备开放式、人类水平的研究判断力,但它在狭窄、定义明确的研究任务上已经展现出明显的实用性——尤其值得注意的是,其中包括 AI 安全研究本身的某些方面。Anthropic 的 AAR 工作表明,这种狭义能力正在以足够快的速度进步,自动化对齐工具可能在相对较短的时间内从研究演示走向实际部署,尽管更困难、更开放式的 AI 自我改进形式仍未得到解决。

AnthropicAI 对齐