Google DeepMind 首次对前沿 AI 模型进行双盲评估

新闻摘要
Google DeepMind 于 2026 年 8 月 27 日(太平洋时间)表示,其已试点对专有前沿级 AI 模型进行首次双盲评估,利用硬件加密计算环境,使模型内部权重与外部评估方的测试提示词在同一时间内彼此不可见。此次试点测试的是 Gemini 家族中的轻量级成员 Gemini 2.5 Flash Lite,参与方包括新加坡 AI 安全研究所(AISI)、隐私计算非营利组织 OpenMined、AI 基准测试联盟 MLCommons 以及评估公司 AVERI。
问题所在:AI 测试中的结构性权衡
独立评估本应是对大语言模型真实能力和安全性的主要检验手段之一。但据 DeepMind 及其合作伙伴称,这一过程长期以来都建立在一个尴尬的权衡之上。要进行严格的第三方测试,评估方传统上有两种选择:要么把自己的保密基准问题交给模型开发者,由开发者在内部运行模型作答;要么要求开发者把模型的专有权重暴露给评估方自己的基础设施。两种选择都不理想。提前共享基准提示词存在“污染”风险——即担心模型或其开发者可能有意或无意地围绕已经见过的题目调整表现,使高分反映的是对测试的熟悉程度,而非真实能力。而共享模型权重则会暴露公司的核心知识产权,并给双方带来安全和数据主权方面的顾虑。从历史上看,评估一直依赖合同、保密协议和机构间信任来管控这种风险,而非任何技术层面的保障。
双盲机制如何运作
此次试点的解决方案是把信任从等式中移除,代之以密码学强制手段。DeepMind 在 Confidential Space 中运行评估,这是 Google Cloud 机密计算产品组合中的一款产品,利用基于硬件的可信执行环境(TEE)封存数据,使连基础设施运营方都无法查看内部运行的内容。在这一设置中,Gemini 2.5 Flash Lite 的模型权重和评估方的基准提示词被同时加载到同一个密封的可信执行环境中,双方的数据彼此加密隔离。评估方的问题在可信执行环境内对模型运行,最终只有得分结果——而非底层权重或提示词——被释放到环境之外。根据技术设计的相关说明,OpenMined 的 PySyft 框架被用于强制确保在可信执行环境内运行的代码无法发起未经授权的对外网络调用,其目的是防止任何一方的受保护数据通过侧信道被复制出去。密码学远程证明使双方都能独立验证可信执行环境是否配置正确,以及模型提供方和评估方都无法看到对方的受保护材料,从而把“双盲”属性变成由硬件强制实现的属性,而非由政策承诺维系的属性。
测试内容
在这一框架下进行了两项评估。第一项由 AVERI、MLCommons 和 OpenMined 主导,在不向对方暴露提示词或模型内部结构的前提下,用一套保密测试集对 Gemini 2.5 Flash Lite 进行基准测试。第二项由新加坡 AI 安全研究所单独运行,使用其自有的保密提示词,针对与新加坡监管和文化背景相关的内容,探查模型对有害内容的处理方式,同样确保双方都无法查看对方的受保护数据。DeepMind 将 Gemini 2.5 Flash Lite 描述为 Gemini 模型家族中轻量、高效的成员,使其成为在将该方法可能扩展到更大前沿模型之前,进行此类首创试点的相对低成本候选对象。
为何重要
随着公开排行榜和评估套件被发布、抓取,并在某些情况下被无意或有意地纳入训练数据,基准污染已成为整个 AI 行业日益引人关注的问题。独立验证机构、安全研究所和研究人员已多次指出,模型在广为人知的基准上的得分,可能更多反映的是该基准有多少内容泄漏进了训练数据,而非真实能力。密码学强制的双盲方法提供了一种途径,既能让评估内容对开发者保密,又能让开发者确信其专有模型权重不会被复制或暴露给外部评估方。DeepMind 及其合作伙伴将此次试点视为迈向让独立组织(包括政府安全研究所)能够严格测试先进模型的一步,而无需任何一方在数据主权、安全或知识产权方面做出妥协。
下一步
DeepMind 和 MLCommons 同时公布了试点的细节,将其定位为早期概念验证,而非成熟的评估标准。参与的相关公司和机构已表示有兴趣将保密双盲方法扩展到更广泛的基准集,并最终扩展到比本次首轮使用的轻量级 Gemini 2.5 Flash Lite 更大、能力更强的前沿模型。更广泛的采用可能取决于其他 AI 开发者和评估方是否同意通过类似的硬件安全环境运行各自的模型和基准,以及对于可信执行环境在实践中能否完全封堵侧信道的持续审视。