首頁 / 資訊 / Google DeepMind 對前沿 AI 模型進行首次雙盲評估
AI 評估

Google DeepMind 對前沿 AI 模型進行首次雙盲評估

2026年8月29日5 分鐘閱讀
Google DeepMind 對前沿 AI 模型進行首次雙盲評估

新聞摘要

Google DeepMind 於 2026 年 8 月 27 日(太平洋時間)表示,已試行首個針對專有前沿級 AI 模型的雙盲評估,利用硬體加密的運算環境,讓模型內部權重與外部評估方的測試提示詞在同一時間彼此隔絕。這次試行測試的是 Gemini 家族中的輕量成員 Gemini 2.5 Flash Lite,合作對象包括新加坡 AI 安全研究所(AISI)、隱私運算非營利組織 OpenMined、AI 基準測試聯盟 MLCommons,以及評估公司 AVERI。

問題所在:AI 測試中的結構性取捨

獨立評估本應是檢驗大型語言模型實際能力與安全性的主要機制之一。但根據 DeepMind 及其合作夥伴的說法,這個流程長期以來都建立在一個棘手的取捨之上。要進行嚴謹的外部測試,評估方傳統上有兩種選擇:把機密的基準測試題目交給模型開發商,讓模型在內部執行測試;或者要求開發商把模型的專有權重暴露給評估方自己的基礎設施。兩種選項都不理想。提前分享基準測試提示詞有「污染」的風險——也就是擔心模型或其開發商可能有意或無意地針對已經看過的題目調整表現,讓高分反映的是對測試的熟悉程度,而非真正的能力。另一方面,分享模型權重會暴露公司的核心智慧財產權,並為雙方帶來安全性與資料主權方面的疑慮。歷來評估工作都依賴合約、保密協議與機構間的信任來管理這類風險,而非任何技術上的保證。

雙盲機制的運作方式

這次試行的做法是將信任從等式中移除,改以加密強制執行來取代。DeepMind 在 Confidential Space 中執行評估,這是 Google Cloud 機密運算產品組合中的一項產品,使用基於硬體的可信執行環境(TEE)來封存資料,讓即使是基礎設施營運方也無法檢視內部正在執行的內容。在這套設定中,Gemini 2.5 Flash Lite 的模型權重與評估方的基準測試提示詞同時載入同一個密封的隔離區,雙方的資料彼此加密隔離。評估方的題目在隔離區內對模型執行,最終只有得出的分數——而非底層的權重或提示詞——會被釋出到隔離區之外。根據技術設計的相關說明,系統使用 OpenMined 的 PySyft 框架來強制確保隔離區內執行的程式碼無法進行未經授權的對外網路呼叫,目的是防止任何一方受保護的資料透過側通道被複製出去。加密驗證讓雙方都能獨立確認隔離區設定正確,且模型提供方與評估方都無法看到對方受保護的資料,使「雙盲」特性成為由硬體強制執行的屬性,而非僅靠政策承諾來維持。

測試內容

在此框架下執行了兩項評估。第一項由 AVERI、MLCommons 與 OpenMined 主導,以機密測試集對 Gemini 2.5 Flash Lite 進行基準測試,同時不向對方暴露提示詞或模型內部結構。第二項由新加坡 AI 安全研究所獨立執行,使用其自有的機密提示詞,針對與新加坡監管及文化背景相關的面向,檢視模型如何處理有害內容,同樣不讓任何一方看到對方受保護的資料。DeepMind 將 Gemini 2.5 Flash Lite 描述為 Gemini 模型家族中輕量且高效的成員,使其成為這類首創試行中成本相對較低的候選對象,之後這套做法有可能擴展到更大型的前沿模型。

為何重要

基準測試污染已成為 AI 產業中日益受到關注的問題,因為公開排行榜與評估套題不斷被發布、被爬取,有時還被無意或蓄意地納入訓練資料。獨立驗證機構、安全研究所與研究人員一再指出,模型在廣為人知的基準測試上的分數,可能反映的不是真正的能力,而是有多少基準測試內容洩漏進了訓練資料。以加密強制執行的雙盲方法提供了一種方式,既能讓評估內容對開發商保密,同時又能向開發商保證其專有模型權重不會被複製或暴露給外部評估方。DeepMind 及其合作夥伴將這次試行定位為向前邁出的一步,讓包括政府安全研究所在內的獨立組織,能夠在不犧牲資料主權、安全性或智慧財產權的前提下,嚴格測試先進模型。

下一步

DeepMind 與 MLCommons 同步公布了這次試行的細節,將其定位為早期的概念驗證,而非最終的評估標準。參與的公司與機構已表示有興趣將這套機密雙盲方法擴展到更廣泛的基準測試,最終應用於比本次首輪使用的輕量級 Gemini 2.5 Flash Lite 更大型、能力更強的前沿模型。更廣泛的採用可能取決於其他 AI 開發商與評估方是否願意透過類似的硬體安全環境執行各自的模型與基準測試,以及外界持續檢視可信執行環境在實務上能否完全封堵側通道。

AI 評估Google DeepMind