首頁 / 資訊 / 27B 小型 AI 模型在科學重現任務中擊敗 Claude Opus 4.8 與 GPT-5.5
AI 研究

27B 小型 AI 模型在科學重現任務中擊敗 Claude Opus 4.8 與 GPT-5.5

2026年8月23日6 分鐘閱讀
27B 小型 AI 模型在科學重現任務中擊敗 Claude Opus 4.8 與 GPT-5.5

新聞摘要

總部位於倫敦的 AI 實驗室 Inherent 由一群 Google DeepMind 前研究員創立,該實驗室於美東時間 2026 年 8 月 22 日宣布,其 AI 研究代理 Faraday 在一項極具挑戰性的新基準測試中,表現優於 Anthropic 和 OpenAI 的前沿規模系統:這項測試要求在未事先獲知答案的情況下,獨立重現已發表科學論文的結果。這項成就之所以引人注目,不僅在於獲勝本身,更在於背後的規模差距——Faraday 僅基於相對較小的 270 億參數模型運行,而被它擊敗的 Claude Opus 4.8 和 GPT-5.5 則是規模龐大得多的通用前沿模型。

Inherent 是誰

Inherent 於 2026 年 5 月結束隱身模式,並完成 5000 萬美元的種子輪融資。該公司由四位聯合創始人創立,其中三位曾在 Google DeepMind 任職:擔任首席科學家的 Edward Hughes、Louis Kirsch 和 Kaloyan Aleksiev,以及 Tantum Collins。團隊駐紮在倫敦國王十字區,目前約有十幾名員工,並計劃在年底前擴充至 20 到 25 人。Inherent 並未從頭開發自己的程式碼工具,而是依賴 OpenAI 的 GPT-5.5 Codex 來處理基礎編程任務,轉而將研究精力集中在一個更狹窄、但在創始人看來更為重要的問題上。

核心理念:教導「研究品味」

Hughes 將公司的核心賭注描述為教導 AI 系統「研究品味」——即判斷哪些實驗值得進行、如何妥善設計實驗,以及何時結果可信的直覺。根據 Inherent 的觀點,現有的大多數 AI 編程代理擅長執行明確定義的指令,但在執行前後所需的判斷力方面卻較為薄弱:例如形成假設、決定優先測試項目,以及評估結果是否合理。該公司表示,Faraday 旨在填補這一空白,它扮演「總監」的角色,將機械式的編程工作委派給獨立的編程模型,自己則專注於更高層次的科學推理。

Faraday 的測試方式:Replica 基準測試

為了驗證這一理念,Inherent 建構了一個名為 Replica 的新基準測試,包含 310 個任務,這些任務取自 100 篇涵蓋自然語言處理、材料科學和天氣預報等領域的機器學習與科學 AI 論文。每個任務會取用一篇已發表的論文,移除其中一張結果圖表,並要求代理在無法查看原始圖表且時間與運算資源有限的情況下,透過實際運行底層實驗來重現該結果。由於研究論文通常只描述最終成功的做法,而省略了失敗的嘗試、缺失的超參數以及達成結果前的預處理步驟,因此該基準測試旨在檢驗代理能否找回 Inherent 團隊所稱的「99% 的汗水」,也就是那些從未出現在最終論文中的過程。

Faraday 在 242 個重現任務上進行訓練,隨後在 68 個訓練期間未曾接觸過的保留任務上進行評估。在該保留測試集中,Faraday 取得了 0.791 的分數,領先 Claude Opus 4.8 的 0.748 和 GPT-5.5 的 0.729,並在 60% 的個別任務中完勝。Inherent 報告指出,Faraday 在 Replica 套件的所有類別中,產出的重現結果都比兩個更大的模型更為忠實,其中在元學習、結構生物學和材料科學任務中的領先幅度最大。

訓練方法

Faraday 採用長週期強化學習進行訓練,並將通用編程代理作為其指揮的工具,而非取代的組件。為了保持訓練穩定,Inherent 的研究員使用了針對每個任務的評分標準,而非單純依賴 AI 評審來對結果打分,因為基於標準的評分能產生更一致且雜訊更少的獎勵信號。團隊還在訓練期間聚合了多個樣本,並應用了回合級別的貢獻分配機制,這有助於模型從長序列的動作中學習,而不僅僅是從單一的最終結果中學習。值得注意的是,Inherent 表示 Faraday 在訓練時指揮的是較早期、規模較小的編程模型 GPT-5.4-mini,但在測試時無需額外重新訓練,便能將其技能泛化以指揮更強大的 GPT-5.5 Codex——該公司認為這證明了其所教導的「總監」技能在一定程度上獨立於底層可用的編程工具。

背景與意義

Inherent 將 Replica 基準測試及 Faraday 在其中的表現定位為其實現更宏大目標的早期驗證:建構能夠實質加速科學發現的 AI 系統,而不僅僅是自動化編程任務。追求這一方向的不止 Inherent 一家——自動化 AI 研究過程本身已成為整個領域的熱門研究方向,各實驗室正探索有多少實驗設計、執行和評估工作可以交由 AI 系統完成。Inherent 的具體貢獻在於提出了一套專門針對研究中難以用簡單指令規範、高度依賴判斷力的環節所設計的基準測試與訓練配方,而其初步結果也顯示,規模較小、訓練更聚焦的模型在這項特定技能上,足以匹敵甚至超越規模大得多的通用系統。

AI 研究DeepMind 前成員