首頁 / 資訊 / OpenAI 全新「循環深度」技術引發思維鏈監控疑慮
AI 安全

OpenAI 全新「循環深度」技術引發思維鏈監控疑慮

2026年9月3日6 分鐘閱讀
OpenAI 全新「循環深度」技術引發思維鏈監控疑慮

新聞摘要

據報導代號為 Astra 的 OpenAI 次世代模型,近日遭到 AI 安全研究人員的嚴厲批評。消息指出,該模型依賴一種稱為「循環深度」的推理技術,會以迴圈方式重複使用內部運算層,而非產生完整、循序且人類可讀的思維鏈——後者已成為監控先進 AI 系統的標準工具。相關報導最早由 The Information 於 2026 年 9 月 2 日上午(美國東部時間)詳細披露,隨後獲得 TechCrunch 等媒體證實。報導形容此方法與目前主流推理模型的運作方式有顯著差異,安全研究人員則表示,這可能讓偵測模型是否出現非預期或欺騙性行為變得更加困難。

什麼是循環深度

循環深度有時被稱為「不透明遞迴」,或被描述為「循環 Transformer」架構。它允許模型透過一組共享的核心內部層,多次重新處理同一個查詢,而非嚴格地沿著線性的推理步驟向前推進。支持者認為,這項技術能在不增加額外參數或記憶體的情況下提升模型效能與運算效率,因為相同的層會被反覆使用,模型不需要不斷堆疊更多獨特的層來提升推理深度。

然而,根據審閱過早期技術細節的研究人員指出,其代價是這些重複的內部處理大多發生在模型的隱藏狀態中,而非外化為可讀的文字。傳統的推理模型(包括 OpenAI 早期的「o 系列」系統)會產生思維鏈:也就是模型在給出最終答案前,逐步解決問題的書面軌跡。這條軌跡雖然並不完美,但讓研究人員得以窺探模型的決策過程,並在問題顯現於使用者可見的回應之前,標記出對齊失敗、欺騙或不安全推理的跡象。

安全研究人員為何擔憂

主要的擔憂並不一定在於 Astra 目前的行為,因為多份報導顯示,該技術目前的應用似乎相當有限,且其思維鏈大致上仍可閱讀。相反地,研究人員擔心的是,若未來的模型更積極地採用這項技術,可能會帶來什麼後果。

AI 安全研究機構 Redwood Research 執行長 Buck Shlegeris 表示,如果 OpenAI 擴大使用循環深度,該公司將有能力「大幅提升遞迴程度」,他警告這會「徹底摧毀思維鏈的可監控性」。Redwood 首席科學家 Ryan Greenblatt 也呼應了這項擔憂,指出不透明的推理技術最終可能發展到模型幾乎完全在隱藏的內部通道中進行推理,而非以任何外部可觀察的形式呈現。

AI 評論家 Zvi Mowshowitz 將這項轉變形容為「玩火」,他認為維持忠實且可監控的思維鏈一直被視為近乎產業規範的做法,而 OpenAI 與 Anthropic 過去都曾表示會努力維護這一點。他指出,如果各實驗室開始在缺乏明確防護措施的情況下偏離這項規範,隨著模型能力日益強大,最終可能需要透過監管來確保可監控性。

獨立 AI 研究人員 Gary Marcus 則更進一步發表文章,形容這項發展跨越了他所稱的 AI 安全「紅線」。他將思維鏈監控描述為少數可用於觀察原本不透明的大型語言模型內部運作的可靠工具之一,並主張即使是逐步削弱這項機制,也會移除整個領域已逐漸依賴的一道防線。

OpenAI 如何回應

OpenAI 首席科學家 Jakub Pachocki 反駁了將此技術視為全面背離公司安全承諾的說法。他指出,Astra 的有效運算深度仍與 GPT-4 時代的模型相當接近,並表示 OpenAI 持續將思維鏈監控視為了解模型如何得出結論的重要安全洞察來源。Pachocki 的發言暗示,從 OpenAI 的角度來看,目前循環深度的實作是一項針對性的效率提升,而非試圖讓模型推理逃避監督。

這樣的說法並未完全說服外部研究人員,他們指出,即使只是有限度或實驗性地使用這項技術,也已樹立了先例。他們的擔憂較少針對今日的 Astra,而是它所創造的誘因結構:如果循環深度確實能有效提升效能並降低運算成本,競爭壓力可能會促使 OpenAI 或其他實驗室在未來模型中擴大使用,而這可能以犧牲透明度為代價。

AI 監督的更大背景

過去幾年來,思維鏈監控已與可解釋性研究及紅隊測試並列,成為研究人員理解與稽核大型推理模型行為時較為實用的工具之一。由於這些模型是在龐大的資料集上訓練而成,且其得出答案的過程連開發者都未能完全理解,因此一條可讀的推理軌跡提供了一個難得(儘管不完美)的窗口,讓人得以了解系統如何得出結論。

包括 Redwood Research 在內的多個組織的安全研究人員,以及獨立評論家,過去都曾呼籲前沿 AI 實驗室在模型能力提升的同時,應保留並強化思維鏈的忠實度,而非為了效能提升而將其犧牲。圍繞 Astra 循環深度技術的爭論,反映出該領域中一股更大的張力:一方面追求打造更快、更便宜、更強大的模型,另一方面又希望這些模型的推理過程能保持公開受檢。OpenAI 及其同業在未來發布模型時如何權衡這股張力,很可能持續成為關注 AI 安全與治理的研究人員密切追蹤的議題。

AI 安全OpenAI