Anthropic 研究员因担忧 AI 失控自我进化而辞职

新闻摘要
一位过去三年先后在 OpenAI 和 Anthropic 参与构建 AI 模型的研究员已宣布辞职,并公开发出直白警告:这两家公司正“径直冲向具备自我改进能力的超级智能,拿我们的生命做赌注”。这一离职消息于 2026 年 9 月 8 日(美国东部时间)周二晚间通过社交媒体发布,随后迅速得到 Anthropic 资深安全人员的公开证实——他们表示公司内部同样怀有这些深层忧虑。此事再度引发外界讨论:AI 实验室究竟该如何在商业推进速度与长期安全之间取得平衡。
谁辞职了,辞去了什么职务
这位研究员是 27 岁的 Jacob Coxon,他曾在 OpenAI 的预训练与模型构建团队工作,随后于 2026 年初加入 Anthropic 从事同类工作。Coxon 在辞职声明中表示,他将彻底离开 AI 行业,而不是跳槽到竞争对手公司。他把这次退出定义为向仍留在前沿实验室的同事发出的刻意警示,而非一次普通的职业变动。
Coxon 说了什么
Coxon 的核心观点是,他曾任职的两家公司在追求能力日益强大、可自我改进的 AI 系统时,都没有采取负责任的做法。他写道,即将问世的系统可能成为“能够入侵任何目标、一夜之间颠覆任何领域,并掌握真实权力与资源的超人系统”,并指出整个行业对这种结果缺乏足够的安全防护措施。
他对两家实验室的内部文化作出了鲜明对比。他表示,在 OpenAI,员工“并未真正从内心深处认识到”他们所研发技术背后的文明级风险。而在 Anthropic,员工虽然详细了解相关风险,却依然“被困在一场争夺首发优势的竞赛中”,其依据的理论是:如果任由各家自行决定节奏,没有任何竞争对手会像他们一样谨慎行事。
Coxon 在接受《华尔街日报》单独采访时说:“我们正朝着许多最激进的情景发展,到明年年底,局面可能就已经失控。”他还将其与核武器研发的历史作了对比:“这简直有些疯狂——如此重大的事情竟然发生在住在旧金山的几位工程师的 MacBook 上,而不是像当年曼哈顿计划那样在沙漠地堡中进行。”他认为,影响深远的 AI 研究如今是在普通商业办公室里推进的,而没有像过去那些高风险科研项目一样接受专门且隔离的监管。
核心隐忧:自我改进型 AI
Coxon 提出的具体技术担忧集中在“自我改进型” AI 上——这类系统能够参与设计或训练自己的后续版本,从而可能让能力提升的速度远超安全研究与人类监督机制所能跟上的节奏。这一阵营的研究人员认为,一旦系统能够实质性地协助改进自身,其能力就会迅速叠加放大,留给人类验证模型目标与行为是否始终符合人类意图的时间窗口将急剧收窄。
Anthropic 内部的反应
Coxon 的警告之所以引人关注,部分原因在于它得到了 Anthropic 自家安全研究人员的呼应,而非反驳。负责公司对齐科学工作的 Evan Hubinger 公开回应道:“Jacob 说得没错——我们确实真心认为 AI 可能会杀死所有人类!我个人认为,未来十年内发生这种情况的概率超过 10%。”Hubinger 还补充说,Anthropic 目前还没有一套完整方案来安全地对齐超级智能系统。
在公司领导认知监督研究团队的 Samuel Marks 发布了一系列支持性帖文,承认 AI 开发者普遍认为自己正在构建的技术可能带来人类灭绝的风险,并指出越是资深的研究人员越了解当前系统的局限性,因此对这类风险的担忧往往也越高。
截至发稿时,Anthropic 和 OpenAI 均未就 Coxon 的辞职发表官方回应声明。
更广阔的背景:离职潮已成模式
Coxon 的离开延续了过去一年前沿 AI 实验室接连出现类似辞职事件的趋势。曾领导 Anthropic 安全护栏研究的 Mrinank Sharma 于 2026 年 2 月辞职,并在告别信中表示“世界正处于危险之中”。此外,OpenAI 首席科学家 Jakub Pachocki 也曾发表文章承认,即便研发仍在继续,AI 实验室目前仍无法可靠地保证人类对其最先进模型的控制权。
综合来看,这些事件表明商业 AI 开发的推进速度与研究人员对安全把控的信心之间,差距正在不断扩大。随着前沿实验室不断迈向更自主、更强大的系统,这种矛盾很可能会持续浮现。
接下来会发生什么
Coxon 表示,他将彻底退出 AI 研究领域,而不是加入另一家实验室。他把自己的离职定位为呼吁全行业反思,而非试图影响某一家公司的路线图。他的警告能否促使 Anthropic、OpenAI 或其他机构调整政策仍有待观察,但 Anthropic 在职员工的公开认同表明,关于自我改进型 AI 安全的讨论如今已经走向台前,不再局限于内部交流。