首页 / 资讯 / OpenAI 全新“循环深度”技术引发思维链监控担忧
AI 安全

OpenAI 全新“循环深度”技术引发思维链监控担忧

2026年9月3日6 分钟阅读
OpenAI 全新“循环深度”技术引发思维链监控担忧

新闻摘要

据报道,OpenAI 的下一代模型代号为 Astra。有消息称该模型依赖一种被称为“循环深度”的推理技术,即在循环中重复使用内部计算层,而不是生成完全按顺序排列、人类可读的思维链——后者已成为监控高级 AI 系统的标准工具。这一消息引发了 AI 安全研究人员的强烈批评。相关报道最早由 The Information 于 2026 年 9 月 2 日上午(美国东部时间)详细披露,随后得到 TechCrunch 等媒体的证实。报道将这一方法描述为与主流推理模型迄今为止运行方式的重大偏离,安全研究人员表示,这可能会大幅增加检测模型是否出现意外或欺骗性行为的难度。

什么是循环深度

循环深度有时被称为“不透明循环”,或被描述为“循环 Transformer”架构。它允许模型通过一组共享的核心内部层多次重新处理同一查询,而不是严格按照线性推理步骤向前推进。支持者认为,该技术可以在不增加额外参数或内存的情况下提升模型性能和计算效率,因为相同的层会被反复复用,模型无需不断堆叠更多独立层来获得更深的推理能力。

据审阅过早期技术细节的研究人员介绍,其代价是大量重复的内部处理发生在模型的隐藏状态中,而非以可读文本的形式呈现出来。传统的推理模型(包括 OpenAI 早期的“o 系列”系统)会生成思维链:即模型在给出最终答案前逐步解决问题的文字记录。尽管这种记录并不完美,但它为研究人员提供了一种窥探模型决策过程的途径,使其能够在问题出现在面向用户的回复之前,标记出对齐偏差、欺骗或不安全推理的迹象。

安全研究人员为何担忧

核心担忧并不一定在于 Astra 当前的表现,因为多份报道显示,该模型目前对该技术的使用似乎较为有限,其思维链在很大程度上依然清晰可读。相反,令研究人员感到警惕的是,如果未来模型更激进地采用这项技术,将会带来怎样的后果。

AI 安全研究机构 Redwood Research 首席执行官 Buck Shlegeris 表示,如果 OpenAI 扩大循环深度的使用范围,公司将有可能“大幅增加循环次数”,他警告这会“彻底摧毁思维链的可监控性”。Redwood Research 首席科学家 Ryan Greenblatt 也表达了同样的担忧,称不透明的推理技术最终可能发展到模型几乎完全在隐藏的内部通道中进行推理,而不再以任何外部可观察的形式呈现。

AI 评论员 Zvi Mowshowitz 将这一转变形容为“玩火”。他认为,保持忠实且可监控的思维链一直被视为近乎行业准则的做法,OpenAI 和 Anthropic 此前都曾表示会努力维护这一点。他提出,如果各实验室在没有明确安全保障的情况下开始背离这一准则,那么随着模型能力不断增强,最终可能需要通过监管来维持可监控性。

独立 AI 研究员 Gary Marcus 更进一步,发表文章称这一进展跨越了他所谓的 AI 安全“红线”。他将思维链监控描述为观察原本不透明的大语言模型内部运作机制的少数可靠工具之一,并认为即使是逐步削弱它,也会让该领域失去一项已高度依赖的安全保障。

OpenAI 如何回应

OpenAI 首席科学家 Jakub Pachocki 反驳了将该技术视为公司全面背离安全承诺的说法。他指出,Astra 的实际计算深度仍接近 GPT-4 时代的模型水平,并表示 OpenAI 继续将思维链监控作为了解模型如何得出结论的重要安全洞察来源。Pachocki 的言论表明,从 OpenAI 的角度来看,当前循环深度的实现是一项有针对性的效率提升,而非试图掩盖模型推理过程以逃避监督。

但这一说法并未完全说服外部研究人员。他们指出,即使只是有限或实验性地使用该技术,也已经开创了先例。他们的担忧与其说针对今天的 Astra,不如说针对它所形成的激励结构:如果循环深度被证明能有效提升性能并降低计算成本,竞争压力可能会促使 OpenAI 或其他实验室在未来模型中扩大其使用范围,而这可能会以牺牲透明度为代价。

AI 监督的更广泛背景

过去几年间,思维链监控与可解释性研究及红队测试一起,逐渐成为研究人员理解和审计大型推理模型行为的较实用工具之一。由于这些模型是在海量数据集上训练的,其得出结论的过程甚至连开发者都无法完全理解,因此一段清晰可读的推理记录提供了一个难得(尽管并不完美)的窗口,让人们得以了解系统是如何得出结论的。

包括 Redwood Research 在内的多个机构的安全研究人员以及独立评论员此前曾呼吁前沿 AI 实验室在模型能力不断提升的同时,保留并强化思维链的忠实度,而不是为了性能提升而将其舍弃。围绕 Astra 循环深度技术的争论,反映出该领域在追求构建更快、更便宜、更强大的模型,与希望保持模型推理过程可供审查之间存在的更广泛矛盾。OpenAI 及其同行在未来模型发布中将如何应对这一矛盾,很可能继续成为关注 AI 安全与治理的研究人员密切追踪的议题。

AI 安全OpenAI