Google DeepMind 试点全球首个双盲 AI 评估
要点速览
- •该试点使用 Google Cloud 的 Confidential Space,防止测试期间任一方看到对方的敏感输入。
- •Google 表示,这一设置有助于减少基准污染,即提前接触试题会抬高模型分数。
- •此次评估与新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作进行。
- •Google 表示,这种方法尤其适用于网络安全和政府用途等高风险评估。
- •公司将此举视为迈向更可靠、且更广泛受信任的 AI 模型监督的一步。

By William Isaac, Sol Messing and Kristian Lum
Google DeepMind 已推出全球首个专有、前沿级 AI 模型的双盲评估。这种方法将外部评估限制在一个密码学“盒子”中,使其无法被模型在测试前用于优化表现。
该倡议旨在利用密码学安全环境,为专有模型基准建立信任。可以把这想象成一名即将参加高风险考试的学生:如果学生不小心提前看到了试题,那么满分会受到这份先验知识的影响,成为一种没有意义的成绩。要真正衡量其所知,学生在考试前就不应看到试题。
这正是业界在评估先进 AI 模型时面临的挑战。如果模型已经见过测试题目——这被称为基准污染——那么结果只能在一定程度上被信任。研究文献中对此已有充分记录,一些研究发现,公开基准测试集会泄露到用于训练大模型的网络规模语料中,因此数据集维护者增加了 canary strings 等工具,帮助开发者检测某个基准是否出现在训练数据中。
此次试点与新加坡 AI Safety Institute、OpenMined、AVERI 以及 MLCommons 合作开展。合作方将把一个 Gemini Flash Lite 模型放在一个 privacy-preserving environment 中,针对机密基准进行测试,从而提高评估完整性。
Google 表示,公司在模型开发和部署全过程中,会使用广泛的评估来审视其 AI 系统,但并不只依赖内部测试。为识别潜在盲点,公司与多样化的外部合作伙伴合作,包括专门研究实验室、公民社会组织以及国家级 AI Safety and Security Institutes(AISIs),借助它们的专业能力对模型进行压力测试。AISIs 本身也是较新的制度发展:2024 年底,包括美国、英国、日本、新加坡、韩国和欧盟在内的政府 AI 安全机构组成了一个国际网络,以协调对先进 AI 系统的评估工作。
随着 AI 模型能力不断增强,确保模型在测试前没有见过试题或提示词至关重要,因为先前接触会扭曲结果。政策制定者、研究人员和企业需要相信 AI 基准能够准确反映模型的真实能力和安全性,但如果模型能够提前“peek”评估问题,就会人为抬高分数并削弱这种信任。
尽管零日志协议和严格的合同保障长期以来一直保持外部测试提示的机密性,但引入技术和密码学保障,标志着安全模型评估向前迈出了重要一步。
双盲评估如何运作
过去,高风险的外部评估需要作出取舍。评估方要么交出测试提示,这会带来模型提供方提前看到试题的风险;要么模型提供方交出模型权重,这会带来其知识产权风险。
双盲评估消除了这一折中。借助 Google Cloud 的 Confidential Computing 产品组合中的 Confidential Space,双方都可以通过密码学方式验证:外部评估数据和专有模型都仅对各自所有者保持私密。评估方无法看到 Gemini 模型权重,Google 也无法看到评估方的测试提示。Confidential computing 本身是一项成熟技术:它依赖基于硬件的可信执行环境,即使在数据被处理时也保持加密,这种方法已被医疗和金融等受监管行业采用。
建立模型评估信任的新方法
这种密码学证据有助于防止基准污染并保护敏感数据。随着模型能力增强,这一点对高度敏感的评估尤为重要,例如网络安全或政府机构使用的评估。双盲评估使独立组织能够在不损害数据主权或安全性的情况下,严格测试先进模型。
Google 希望这项试点能为模型监督开辟新前沿,帮助更广泛的行业构建更安全、更可靠且更受信任的 AI 系统。有关方法和发现的更多细节,请阅读我们的 technical report。