Google DeepMind 試行全球首創的雙盲 AI 模型評估
重點速覽
- •此試點使用 Google Cloud 的 Confidential Space,防止任一方在測試期間看到對方的敏感輸入。
- •Google 表示此設置有助降低基準污染,即模型事先接觸考題可能推高評估分數的問題。
- •評估與新加坡 AI 安全研究院、OpenMined、AVERI 及 MLCommons 合作進行。
- •Google 表示此方法對網路安全與政府使用等領域的高風險評估尤其重要。
- •該公司將此計畫視為邁向更可靠、更廣受信任的 AI 模型監督的一步。

撰文:William Isaac、Sol Messing 與 Kristian Lum
Google DeepMind 已推出全球首個針對專有前沿級 AI 模型的雙盲評估,此方法將外部評估限制於一個密碼學「箱子」內,使模型無法事後利用這些內容在測試前優化效能。
該計畫旨在利用密碼學安全環境,為專有模型基準建立信任。設想一名學生即將參加高風險考試:若學生不慎提前看到考題,滿分便會受到該知識影響,成為毫無意義的成就。要真正衡量其所知,學生在應考前必須完全看不到考題。
這正是產業在評估先進 AI 模型時面臨的確切挑戰。若模型已事先看過考題——即所謂的基準污染(benchmark contamination)問題——結果便只能在一定程度上被信任。這項疑慮在研究文獻中已有充分記載,研究發現公開基準測試集曾外洩至用於訓練大型模型的網路規模語料庫,促使資料集維護者加入金絲雀字串(canary strings)等工具,讓開發者偵測基準是否出現在訓練資料中。
此試點計畫與新加坡 AI 安全研究院(Singapore AI Safety Institute)、OpenMined、AVERI 及 MLCommons 合作進行。合作夥伴將在保護隱私的環境中,以機密基準測試 Gemini Flash Lite 模型,提升評估的完整性。
Google 表示,其在模型開發與部署的各個階段皆採用廣泛多元的評估來檢驗 AI 系統,但並不僅依賴內部測試。為找出潛在盲點,公司與多元化的外部夥伴合作——包括專業研究實驗室、公民社會團體,以及各國 AI 安全研究院(AISI)——借助其獨特專業知識對模型進行壓力測試。AISI 本身也是近年的制度發展:2024 年底,包括美國、英國、日本、新加坡、南韓與歐盟在內的政府 AI 安全研究院組成國際網絡,協調先進 AI 系統的評估工作。
隨著 AI 模型能力日益增強,確保模型未事先看過考題或提示詞至關重要,因為事先接觸可能使結果失真。政策制定者、研究人員與企業需要信任 AI 基準能準確反映模型的真實能力與安全性,但若模型能提前「偷看」評估題目,分數可能被人為推高,這份信任也會隨之受損。
儘管零紀錄(zero-logging)協議與嚴謹的合約保障長期以來已使外部測試提示詞保持機密,加入技術與密碼學防護措施仍是安全模型評估的一大進展。
雙盲評估如何運作
歷來,高風險的外部評估必須有所取捨:不是評估方交出測試提示詞(承擔模型供應商提前看到考題的風險),就是模型供應商交出模型權重(承擔其智慧財產權外洩的風險)。
雙盲評估消除了這種妥協。透過在 Google Cloud 機密運算(Confidential Computing)產品組合中使用 Confidential Space,雙方都能以密碼學方式驗證外部評估資料與專有模型各自歸其所有者保有隱私。評估方無法看到 Gemini 模型權重,Google 也無法看到評估方的測試提示詞。機密運算本身是相當成熟的技術:它仰賴硬體式的可信執行環境,即使在資料處理過程中也能保持加密,此方法已應用於醫療與金融等受監管產業。
為模型評估建立信任的新方法
這種密碼學證據有助於防止基準污染並保護敏感資料。隨著模型能力提升,這對高敏感度評估尤其重要,例如用於網路安全或政府機關的評估。雙盲評估讓獨立組織能夠在不犧牲資料主權或安全的前提下,嚴謹地測試先進模型。
Google 希望此試點計畫能為模型監督開創新前沿,協助整體產業打造更安全、更可靠且廣受信任的 AI 系統。方法論與研究結果的更多細節可參閱技術報告。