首頁 / 資訊 / Anthropic 研究員因擔憂 AI 自我改進失控而辭職
AI 安全

Anthropic 研究員因擔憂 AI 自我改進失控而辭職

2026年9月10日5 分鐘閱讀
Anthropic 研究員因擔憂 AI 自我改進失控而辭職

新聞摘要

一位過去三年先後在 OpenAI 與 Anthropic 參與打造 AI 模型的研究員已宣布辭職,並發表直言不諱的警告,指出這兩家公司「正一路狂奔、競相開發具備自我改進能力的超級智慧,拿我們的性命當賭注」。這項離職消息於美國東部時間 2026 年 9 月 8 日(星期二)晚間透過社群媒體貼文公布後,迅速獲得 Anthropic 資深安全團隊成員的公開證實,表示公司內部確實存在相同擔憂,也再度引發外界討論:AI 實驗室究竟該如何權衡商業發展速度與長期安全性。

誰辭職了?離開的是哪家公司?

這位研究員是 27 歲的 Jacob Coxon,他曾在 OpenAI 負責預訓練與模型建構團隊,隨後於 2026 年初加入 Anthropic 擔任相同職務。Coxon 在辭職聲明中表示,他將徹底離開 AI 產業,而非轉投競爭對手陣營;他將自己的離去定位為向仍留在前沿實驗室的同事發出的刻意訊號,而非單純的職涯轉換。

Coxon 說了什麼

Coxon 的核心主張是,他曾任職的這兩家公司在追求功能日益強大、能自我改進的 AI 系統時,都未展現出應有的責任感。他寫道,即將問世的系統可能成為「能入侵任何事物、一夜之間顛覆任何領域,並取得實質權力與資源的超人系統」,並認為整個產業對這種結果缺乏足夠的安全防護。

他也鮮明對比了兩家實驗室的內部文化。他表示,在 OpenAI,員工「並未真正深刻體認到」他們所開發技術背後攸關文明存亡的風險;而在 Anthropic,員工雖然清楚了解各項風險細節,卻仍「深陷搶先達標的競賽中」,其背後的邏輯是:若任由其他競爭實驗室自行決定步調,沒有任何一家會像他們一樣謹慎行事。

Coxon 另在接受《華爾街日報》採訪時表示:「我們正朝著許多最激進的情境發展,到明年年底,情況可能就已經失控。」他還以核武研發作為歷史對照,說道:「這麼重大的事,竟然發生在幾位住在舊金山的工程師的 MacBook 上,而不是像當年曼哈頓計畫那樣在沙漠裡的掩體中進行,實在有點瘋狂。」他藉此強調,影響深遠的 AI 研究正在一般商業辦公室裡推進,而非像過去高風險科學計畫那樣,接受專責且隔離的監督管理。

核心隱憂:自我改進式 AI

Coxon 提出的具體技術疑慮,聚焦於「自我改進式」AI——也就是能夠參與設計或訓練自身後繼版本的系統。這類系統可能讓能力提升的速度,超越安全研究與人類監督機制所能跟上的腳步。這一阵營的研究人員認為,一旦系統能實質協助改善自身,能力便會快速複利成長,進而壓縮人類驗證模型目標與行為是否持續符合人類意圖的時間窗口。

Anthropic 內部的回應

Coxon 的警告之所以備受關注,部分原因在於 Anthropic 自家的安全研究員並未反駁,反而呼應了他的說法。負責該公司對齊科學研究的 Evan Hubinger 公開回應:「Jacob 說得沒錯——我們真的打從心底相信 AI 可能會殺光全人類!我個人認為,未來十年內發生的機率超過 10%。」Hubinger 補充指出,Anthropic 目前尚未制定出安全對齊超級智慧系統的完整方案。

在公司內領導認知監督研究團隊的 Samuel Marks 則發布了一篇支持性長文,承認 AI 開發者普遍認為他們所打造的技術可能帶來人類滅絕的風險,並指出越是深入理解現有系統局限性的資深研究員,對這些風險的擔憂往往越強烈。

截至本文發布時,Anthropic 與 OpenAI 皆未針對 Coxon 辭職一事發表官方聲明。

更廣泛的背景:離職潮成形

Coxon 的離開,是過去一年來前沿 AI 實驗室一連串類似辭職事件中的最新一例。曾任 Anthropic 安全防護研究負責人的 Mrinank Sharma 於 2026 年 2 月辭職,並在告別信中寫道「世界正處於危險之中」。此外,OpenAI 首席科學家 Jakub Pachocki 也曾發表文章,承認即便開發工作持續推進,AI 實驗室目前仍無法可靠地確保人類能掌控其最先進的模型。

綜合來看,這些事件顯示商業 AI 開發的速度,與負責確保開發安全的研究人員的信心水準之間,落差正不斷擴大。隨著前沿實驗室持續朝更自主、更強大的系統邁進,這種緊張關係很可能會一再浮現。

接下來會如何發展

Coxon 表示,他將完全退出 AI 研究,不會加入其他實驗室;他將自己的離去定位為呼籲整個產業反思,而非試圖影響特定公司的發展藍圖。他的警告能否促使 Anthropic、OpenAI 或其他機構調整政策仍有待觀察,但 Anthropic 現職員工的公開認同顯示,關於自我改進式 AI 安全的辯論如今已走向檯面,不再侷限於內部討論。

AI 安全Anthropic