深入 Astra:OpenAI 內部模型破解十道存在數十年的數學謎題

新聞摘要
OpenAI 公開將其下一代主要模型家族命名為「Astra」,並發布了其內部能力的首批證據,於 2026 年 8 月 1 日(美東時間)透露該模型的內部版本在數學與理論計算機科學的十個長期開放問題上產生了新結果。這份由 OpenAI 研究員 Noam Brown 分享的聲明,標誌著該公司對仍在內部測試中的模型進行了最詳細的公開預覽之一,並將 Astra 定位為一個為長期、多代理推理而建構的系統,而非單輪對話回應。
Astra 的設計目標
與先前強調對話流暢度或短任務準確性的 OpenAI 發布版本不同,Astra 在內部被描述為一個為持續、自主工作而建構的通用模型。根據 OpenAI 的說法,該架構旨在讓多個 AI 代理在單一複雜問題上協調運作一段時間,跨越數小時甚至數天,而不是完成孤立的提示與回應交換。這種長期、多代理的定位被視為該模型家族的核心技術賭注,使其有別於早期的 OpenAI 系統。
解決的十個存在數十年的問題
此次披露的核心是一組十個數學與理論計算機科學問題,OpenAI 表示這些問題在核心層面上已保持開放狀態且無實質進展至少十年,部分案例甚至更久。這些問題涵蓋高維幾何、編碼理論、算術電路複雜度、群論、算子代數、量子複雜度、格密碼學與極值組合學。最被廣泛引用的結果是 OpenAI 所稱的首次明確構造出非索菲克群,解決了自數學家 Mikhail Gromov 於 1999 年提出索菲克性概念以來一直存在的群論問題。
結果如何被驗證
OpenAI 強調,這些結果並非僅由模型斷言。人類研究員審查並將模型的論證整理成完整的手稿,隨後模型本身將每個證明形式化為 Lean 證書,這是一種用於形式化數學中以驗證證明邏輯步驟有效性的機器可檢查格式。這個形式化驗證步驟旨在為外部數學家提供一種獨立確認每個解決方案正確性的方法,而不是僅依賴模型自身的解釋。
工作的成本與規模
OpenAI 表示,按照業界標準,生成這十個解決方案的計算成本相當適中,按目前的 API 費率估計,總 token 使用量約為 2,000 美元。Noam Brown 在評論這些結果時,謹慎地保守界定聲明的範圍,指出實驗室並未將大量資源投入任何單一問題,且這些結果也不包含任何數學千禧年大獎難題。他將這次披露描述為 AI 系統在科學推理方面向前邁出的有意義一步,而非一次單一的突破時刻。
公開發布前的政府審查
Astra 尚未公開發布。OpenAI 表示該模型家族仍在進行內部測試,並將成為首批通過新設立的美國政府審查流程的系統之一,該流程要求在此類能力等級的模型廣泛提供之前必須獲得官方批准。OpenAI 尚未公布該審查何時結束或 Astra 何時可能達到全面可用狀態的具體日期。
為何這對全球 AI 社群至關重要
對於關注 AI 輔助科學發展軌跡的學生、教育工作者和研究人員來說,Astra 的披露之所以引人注目,與其說是因為任何單一證明,不如說是因為它揭示了前沿模型發展的方向:轉向旨在長期維持複雜、多步驟推理的系統,並將形式化驗證內建於工作流程中,而非事後添加。如果長期、多代理架構被證明可靠,它們可以將 AI 的實用性擴展到起草文本或編寫程式碼之外,進入開放式的科學問題解決領域,而這個領域傳統上需要數年的專業人類專業知識。預計世界各地的觀察家將密切關注未來幾週獨立數學家對這些 Lean 驗證證明的檢視。
後續發展
OpenAI 表示,隨著模型完成內部測試與政府審查,將會公布關於 Astra 架構、訓練方法與發布時間表的更多細節。在此之前,預計數學界將仔細審查發布的 Lean 證書,而產業分析師將關注其他前沿實驗室是否會以類似的長期、多代理系統作為回應。