27B小型AI模型在科学复现任务中击败Claude Opus 4.8和GPT-5.5

新闻摘要
一家名为Inherent的伦敦AI实验室于美东时间2026年8月22日宣布,其AI研究智能体Faraday在一项高难度的新基准测试中,表现优于Anthropic和OpenAI的前沿级系统:该测试要求智能体在未被告知答案的情况下,独立复现已发表科学论文的结果。这一声明之所以引人注目,不仅在于其获胜本身,更在于背后的规模差距——Faraday运行在一个相对较小的270亿参数模型上,而被它击败的系统Claude Opus 4.8和GPT-5.5都是体量庞大得多的通用前沿模型。Inherent由一群前Google DeepMind研究人员创立。
Inherent是谁
Inherent于2026年5月结束隐身模式,完成了5000万美元的种子轮融资。该公司由四位联合创始人创立,其中三位曾在Google DeepMind工作:担任首席科学家的Edward Hughes,以及Louis Kirsch和Kaloyan Aleksiev,另一位是Tantum Collins。团队位于伦敦国王十字区,目前约有十几名员工,计划到年底将团队规模扩大至20到25人。Inherent没有从零开始构建自己的编程工具,而是依靠OpenAI的GPT-5.5 Codex来处理基础编码任务,选择将研究精力集中在一个更窄、但在创始人看来更重要的问题上。
核心理念:传授“科研品味”
Hughes将公司的核心赌注描述为向AI系统传授“科研品味”——即判断哪些实验值得做、如何设计好实验以及何时结果可信的本能。在Inherent的框架中,大多数现有的AI编程智能体擅长执行明确定义的指令,但在执行前后的判断环节上较弱:形成假设、决定先测试什么以及评估结果是否合理。据该公司称,Faraday旨在填补这一空白,它充当“指挥者”,将机械性的编码工作委派给单独的编码模型,而自己则专注于更高层次的科学推理。
Faraday的测试方式:Replica基准测试
为了验证这一理念,Inherent构建了一个名为Replica的新基准测试,包含310个任务,这些任务源自100篇机器学习和AI for Science论文,涵盖自然语言处理、材料科学和天气预报等领域。每个任务选取一篇已发表的论文,移除其中一个结果图表,并要求智能体通过实际运行底层实验来重现该结果,且无法访问原始图表,时间和计算预算也有限。由于研究论文通常只描述最终成功的方案,而省略了导致成功的失败尝试、缺失的超参数和预处理步骤,因此该基准测试旨在检验智能体能否找回Inherent团队所称的“99%的汗水”——那些从未出现在最终论文中的内容。
Faraday在242个复现任务上进行了训练,然后在68个训练期间未见过的保留任务上进行了评估。在该保留集上,Faraday得分为0.791,领先于Claude Opus 4.8的0.748分和GPT-5.5的0.729分,并在60%的单项任务中完胜。Inherent报告称,在Replica套件的所有类别中,Faraday产生的复现结果都比这两个更大的模型更忠实,其中在元学习、结构生物学和材料科学任务中的优势最为明显。
训练方法
Faraday采用长周期强化学习进行训练,通用编程智能体作为其指挥的工具而非被替代的组件。为了保持训练的稳定性,Inherent的研究人员使用了针对每个任务的评分标准,而不是仅依赖AI评判员对结果打分,因为基于标准的评分产生了更一致且噪声更少的奖励信号。团队还在训练期间聚合了多个样本,并应用了回合级信用分配,这有助于模型从长序列动作中学习,而不仅仅是从单一的最终结果中学习。值得注意的是,Inherent表示Faraday是在指挥早期较小的编码模型GPT-5.4-mini时进行训练的,但在测试时仍能将其技能泛化以指挥更强大的GPT-5.5 Codex,无需额外重新训练——该公司认为,这证明了其所传授的“指挥者”技能在一定程度上独立于底层可用的编码工具。
背景及其信号意义
Inherent将Replica基准测试及Faraday在其中的表现视为其更宏大愿景的早期佐证:构建能够切实加速科学发现的AI系统,而不仅仅是自动化编码任务。追求这一方向的不止该公司一家——自动化AI研究过程本身的部分环节已成为整个领域的活跃关注点,各实验室正在探索可以将多少实验设计、执行和评估工作交给AI系统。Inherent的具体贡献是一个专门针对研究中难以用简单指令明确的重判断环节的基准测试和训练方案,以及一项早期成果,表明一个更小、训练更专注的模型可以在该特定技能上匹敌甚至超越大得多的通用系统。