OpenAI 在達到自身最高網路風險門檻後鎖定 Astra 模型

新聞摘要
OpenAI 本週表示,其內部代號為 Astra 的下一代模型可能已跨越該公司自家「準備框架」所定義的「嚴重」網路能力等級——這是 OpenAI 首次對其模型做出此判斷。這項於 2026 年 8 月 7 日(星期五)美國東部時間公開的揭露,觸發了一系列內部安全措施,包括暫停不符合新強化安全要求的開發活動,並將進一步測試移至隔離的沙盒環境中。
OpenAI 框架中「嚴重」的含義
OpenAI 的「準備框架」定義了涵蓋生物、化學、核子與網路安全能力等領域的多個風險類別。當內部評估無法排除模型可能自主發現並利用嚴重且先前未知的軟體漏洞(通常稱為零日漏洞),或在沒有重大人為指導的情況下,獨立對防禦良好的目標執行複雜的多階段網路攻擊時,該模型即被歸類為達到網路安全的「嚴重」門檻。達到此等級並不確認模型確實具備這些能力;而是表示評估者無法排除這種可能性,這在 OpenAI 自身的政策下已足以要求在進一步開發或發布前採取額外預防措施。
已實施的安全措施
根據 OpenAI 的說法,負責 Astra 的團隊已暫停任何尚未符合提高後安全標準的內部活動。今後,該模型的開發與測試將在網路存取受限的隔離環境中進行,對模型可呼叫的工具實施更嚴格的控制,對模型權重進行額外的加密與保護,並擴大監控以捕捉有風險或偏離預期的行為。該公司表示,他們也已新增對模型內部推理軌跡(有時稱為思維鏈)的自動審查,以便在可疑的規劃活動導致現實世界行動之前將其標記並中斷。
外部審查與政府協調
OpenAI 表示,計畫與外部團體合作,獨立驗證模型的實際能力,而非僅依賴內部測試。這包括與相關政府網路安全機構以及少數專門評估攻擊性安全能力的外部 AI 安全組織進行協調。該公司也表示,計畫與第三方評估者分享建議的安全控制措施,以便任何對模型能力的實際測試都能在不實質增加現實世界風險的情況下進行。
為何此揭露備受關注
前沿 AI 實驗室多年來一直發布能力門檻與安全框架,但實際針對一個已命名且即將發布的模型援引框架的最高等級並不常見。追蹤 AI 安全政策的研究人員指出,此舉既顯示了模型在攻擊性網路安全等專業技術領域的能力推進速度,也顯示至少有一家主要實驗室願意公開放慢發布速度,而非按照固定時間表推出。此事件可能會在 AI 研究社群中重新引發關於能力評估如何進行、應公開多少細節,以及政府和獨立研究人員如何有意義地驗證建構這些系統的實驗室所提出之主張的討論。
接下來會發生什麼
OpenAI 尚未給出 Astra 完成額外審查程序或更廣泛推出的確切日期。該公司表示,暫停僅適用於未達新安全要求的活動,而非停止所有模型工作,且 Astra 的最終發布將取決於上述擴大的內部和外部評估結果。