Google DeepMind проводит первые в мире двойные слепые оценки моделей ИИ
Ключевые выводы
- •Пилотный проект использует Confidential Space из Google Cloud, чтобы ни одна из сторон не могла видеть конфиденциальные исходные данные другой во время тестирования.
- •По словам Google, такая схема помогает снизить загрязнение бенчмарков, при котором предварительное знакомство с тестовыми вопросами может завышать оценки моделей.
- •Оценка проводится совместно с Сингапурским институтом безопасности ИИ, OpenMined, AVERI и MLCommons.
- •Google отмечает, что метод особенно актуален для высококритичных оценок в таких областях, как кибербезопасность и государственное применение.
- •Компания представляет инициативу как шаг к более надёжному и пользующемуся широким доверием надзору за моделями ИИ.

Авторы: Уильям Айзек, Сол Мессинг и Кристиан Лам
Google DeepMind представила первую в мире двойную слепую оценку проприетарной модели ИИ передового класса — подход, при котором внешние оценки остаются внутри криптографической «коробки», где они не могут быть впоследствии использованы моделями для оптимизации производительности перед тестированием.
Цель инициативы — укрепить доверие к бенчмаркам проприетарных моделей за счёт криптографически защищённых сред. Представьте студента, которому предстоит сдавать важный экзамен: если он случайно заранее увидит вопросы теста, идеальный результат будет обусловлен этим знанием и утратит смысл. Чтобы по-настоящему измерить его знания, студент не должен видеть вопросы теста до самого экзамена.
Именно с этой задачей сталкивается отрасль при оценке продвинутых моделей ИИ. Если модель уже видела тестовые вопросы — проблема, известная как «загрязнение бенчмарков» (benchmark contamination), — результатам можно доверять лишь в определённой степени. Эта проблема хорошо задокументирована в научной литературе: исследования выявили попадание публичных тестовых наборов бенчмарков в веб-корпусы, используемые для обучения больших моделей, что побудило сопровождающих датасеты внедрить такие инструменты, как canary strings, позволяющие разработчикам обнаружить, попал ли бенчмарк в обучающие данные.
Пилотный проект реализуется в партнёрстве с Сингапурским институтом безопасности ИИ (Singapore AI Safety Institute), OpenMined, AVERI и MLCommons. Совместно партнёры протестируют модель Gemini Flash Lite на конфиденциальных бенчмарках в среде, обеспечивающей конфиденциальность данных, что повысит целостность оценки.
Google заявляет, что оценивает свои системы ИИ с помощью широкого спектра оценок на всех этапах разработки и развёртывания моделей, но не полагается исключительно на внутреннее тестирование. Для выявления потенциальных «слепых зон» компания сотрудничает с разнообразной группой внешних партнёров — включая специализированные исследовательские лаборатории, организации гражданского общества и национальные институты безопасности и защиты ИИ (AISI), — используя их уникальную экспертизу для стресс-тестирования своих моделей. Сами AISI являются недавним институциональным нововведением: в конце 2024 года институты безопасности ИИ из правительств США, Великобритании, Японии, Сингапура, Южной Кореи и Европейского союза сформировали международную сеть для координации оценки передовых систем ИИ.
По мере того как модели ИИ становятся более способными, критически важно обеспечить, чтобы модель не видела заранее тестовые вопросы или промпты, поскольку предварительное знакомство может исказить результаты. Составителям политик, исследователям и предприятиям необходимо доверять тому, что бенчмарки ИИ точно отражают реальные возможности и безопасность модели, но если модели могут заранее «подглядывать» оценочные вопросы, результаты могут быть искусственно завышены, а доверие — подорвано.
Хотя протоколы нулевого логирования и строгие договорные гарантии давно обеспечивают конфиденциальность внешних тестовых промптов, добавление технических и криптографических средств защиты означает крупный шаг вперёд в области безопасной оценки моделей.
Как работают двойные слепые оценки
Исторически внешние оценки с высокими ставками требовали компромисса: либо оценщики передавали свои тестовые промпты, рискуя тем, что поставщик модели заранее увидит тестовые вопросы, либо поставщик модели передавал её веса, рискуя своей интеллектуальной собственностью.
Двойные слепые оценки устраняют этот компромисс. Благодаря использованию Confidential Space из портфеля конфиденциальных вычислений Google Cloud обе стороны могут криптографически удостовериться, что внешние оценочные данные и проприетарная модель остаются конфиденциальными для своих владельцев. Оценщик не может видеть веса модели Gemini, а Google не может видеть тестовые промпты оценщика. Сами конфиденциальные вычисления — устоявшаяся технология: они опираются на аппаратные доверенные среды исполнения, которые сохраняют данные зашифрованными даже во время обработки; такой подход уже применяется в регулируемых отраслях, таких как здравоохранение и финансы.
Новый подход к формированию доверия к оценкам моделей
Криптографические доказательства помогают предотвращать загрязнение бенчмарков и защищают конфиденциальные данные. По мере роста возможностей моделей это становится особенно важным для высокочувствительных оценок, например тех, что используются в кибербезопасности или государственными органами. Двойные слепые оценки дают независимым организациям возможность строго тестировать передовые модели, не жертвуя суверенитетом данных или безопасностью.
Google надеется, что этот пилотный проект откроет новый рубеж в надзоре за моделями и поможет всей отрасли создавать более безопасные, надёжные и пользующиеся широким доверием системы ИИ. Подробнее о методологии и результатах можно узнать в техническом отчёте.