OpenAI在达到自身最高网络风险阈值后锁定Astra模型

新闻摘要
OpenAI本周表示,其内部代号为Astra的下一代模型可能已跨越该公司自身准备框架定义的“严重”网络能力等级——这是OpenAI首次对其模型做出这一判定。该披露于2026年8月7日星期五(美国东部时间)公开,触发了一系列内部保障措施,包括暂停不符合新强化安全要求的开发活动,并将进一步测试转移到隔离的沙盒环境中。
OpenAI框架中“严重”的含义
OpenAI的准备框架定义了多个风险类别,涵盖生物、化学、核能和网络安全能力等领域。当内部评估无法排除模型可能自主发现并利用严重的、先前未知的软件漏洞(通常称为零日漏洞),或在没有有意义的人类指导的情况下独立对防御良好的目标实施复杂的多阶段网络攻击时,该模型被归类为达到网络安全的“严重”阈值。达到这一等级并不确认模型确实具备这些能力;而是意味着评估者无法排除这种可能性,这根据OpenAI自身的政策足以要求在更广泛的开发或发布继续之前采取额外预防措施。
已实施的保障措施
据OpenAI称,Astra团队已暂停任何尚未符合更高安全标准的内部活动。今后,该模型的开发和测试将在具有受限网络访问的隔离环境中进行,对模型可调用的工具有更严格的控制,对模型权重进行额外的加密和保护,并扩大监控以捕捉风险或不当行为。该公司表示,它还增加了对模型内部推理轨迹(有时称为思维链)的自动审查,以便可疑的规划活动能够在导致现实世界行动之前被标记并中断。
外部审查与政府协调
OpenAI表示,它打算与外部团体合作,独立验证模型的实际能力,而不是仅仅依赖内部测试。这包括与相关政府网络安全机构以及少数专门评估进攻性安全能力的外部AI安全组织进行协调。该公司还表示,计划与第三方评估者分享推荐的安全控制措施,以便任何对模型能力的实际操作测试都能在不实质性增加现实世界风险的情况下进行。
为何这一披露引人注目
前沿AI实验室多年来一直发布能力阈值和安全框架,但实际为一个已命名且即将发布的模型启动框架的最高等级并不常见。追踪AI安全政策的研究人员指出,此举既表明了模型能力在进攻性网络安全等专业技术领域进步的速度,也表明至少有一个主要实验室愿意公开放缓发布,而不是按固定时间表推出。这一事件可能会在AI研究社区重新引发关于能力评估如何进行、应公开披露多少细节以及政府和独立研究人员如何有意义地验证构建这些系统的实验室所声称的内容的讨论。
接下来会发生什么
OpenAI尚未给出Astra完成额外审查过程或更广泛可用的确切日期。该公司表示,暂停仅适用于未达到新安全要求的活动,而不是停止所有模型工作,Astra的最终发布将取决于上述扩展的内部和外部评估的结果。