ActualitésActionsGoogle DeepMind pilote les toutes premières évaluations en double aveugle de modèles d'IA au monde

Google DeepMind pilote les toutes premières évaluations en double aveugle de modèles d'IA au monde

Auteur: Google DeepMind Blog·

Points clés

  • Le projet pilote utilise Confidential Space de Google Cloud pour empêcher chaque partie de voir les données sensibles de l'autre pendant les tests.
  • Selon Google, ce dispositif contribue à réduire la contamination des benchmarks, où une exposition préalable aux questions de test peut gonfler les scores des modèles.
  • L'évaluation est menée avec le Singapore AI Safety Institute, OpenMined, AVERI et MLCommons.
  • Selon Google, la méthode est particulièrement pertinente pour les évaluations à fort enjeu dans des domaines tels que la cybersécurité et les usages gouvernementaux.
  • L'entreprise présente l'initiative comme un pas vers une supervision des modèles d'IA plus fiable et plus largement reconnue.
Google DeepMind pilote les toutes premières évaluations en double aveugle de modèles d'IA au monde

Par William Isaac, Sol Messing et Kristian Lum

Google DeepMind a présenté la première évaluation au monde en double aveugle d'un modèle d'IA propriétaire de classe frontier, une approche qui confine les évaluations externes dans une « boîte » cryptographique où elles ne peuvent pas être utilisées ultérieurement par les modèles pour optimiser leurs performances avant les tests.

Cette initiative vise à renforcer la confiance dans les benchmarks de modèles propriétaires grâce à des environnements sécurisés par cryptographie. Imaginons un étudiant qui doit passer un examen à fort enjeu : s'il jette accidentellement un œil aux questions à l'avance, un score parfait est influencé par cette connaissance et devient un accomplissement dénué de sens. Pour véritablement mesurer ce qu'il sait, l'étudiant ne doit avoir aucune visibilité sur les questions de l'examen jusqu'au moment de le passer.

C'est exactement le défi auquel est confrontée l'industrie lorsqu'elle évalue des modèles d'IA avancés. Si un modèle a déjà vu les questions du test — un problème connu sous le nom de contamination des benchmarks — les résultats ne peuvent être considérés comme fiables que dans une certaine mesure. Cette préoccupation est bien documentée dans la littérature de recherche, où des études ont montré que des ensembles de tests de benchmarks publics fuyaient dans les corpus à l'échelle du web utilisés pour entraîner les grands modèles, incitant les mainteneurs de jeux de données à ajouter des outils tels que les canary strings, qui permettent aux développeurs de détecter si un benchmark est apparu dans les données d'entraînement.

Ce projet pilote est mené en partenariat avec le Singapore AI Safety Institute, OpenMined, AVERI et MLCommons. Ensemble, les partenaires testeront un modèle Gemini Flash Lite sur des benchmarks confidentiels dans un environnement préservant la confidentialité, renforçant ainsi l'intégrité des évaluations.

Google indique évaluer ses systèmes d'IA à l'aide d'un large éventail d'évaluations tout au long du développement et du déploiement de ses modèles, sans toutefois se fier uniquement aux tests internes. Pour identifier d'éventuels angles morts, l'entreprise collabore avec un groupe diversifié de partenaires externes — notamment des laboratoires de recherche spécialisés, la société civile et les instituts nationaux de sécurité et de sûreté de l'IA (AISI) — en s'appuyant sur leur expertise unique pour soumettre ses modèles à des tests de résistance. Les AISI constituent eux-mêmes une innovation institutionnelle récente : fin 2024, des instituts de sécurité de l'IA issus de gouvernements, notamment ceux des États-Unis, du Royaume-Uni, du Japon, de Singapour, de la Corée du Sud et de l'Union européenne, ont formé un réseau international pour coordonner l'évaluation des systèmes d'IA avancés.

À mesure que les modèles d'IA gagnent en capacités, il est essentiel de s'assurer qu'un modèle n'a pas vu à l'avance les questions ou les prompts de test, car une exposition préalable peut fausser les résultats. Les décideurs politiques, les chercheurs et les entreprises doivent pouvoir compter sur des benchmarks d'IA qui reflètent fidèlement les véritables capacités et la sûreté d'un modèle ; or, si les modèles parviennent à « jeter un coup d'œil » aux questions d'évaluation à l'avance, les scores peuvent être artificiellement gonflés et cette confiance ébranlée.

Bien que les protocoles de zéro journalisation et des garanties contractuelles rigoureuses garantissent depuis longtemps la confidentialité des prompts de test externes, l'intégration de garanties techniques et cryptographiques constitue une avancée majeure dans l'évaluation sécurisée des modèles.

Fonctionnement des évaluations en double aveugle

Historiquement, les évaluations externes à fort enjeu impliquaient un compromis. Soit les évaluateurs transmettaient leurs prompts de test, au risque que le fournisseur du modèle voie les questions à l'avance, soit le fournisseur du modèle transmettait les poids de son modèle, au risque de compromettre sa propriété intellectuelle.

Les évaluations en double aveugle éliminent ce compromis. En utilisant Confidential Space au sein de l'offre Confidential Computing de Google Cloud, les deux parties peuvent vérifier cryptographiquement que les données d'évaluation externes et le modèle propriétaire restent confidentiels et sous le contrôle de leurs propriétaires respectifs. L'évaluateur ne peut pas voir les poids du modèle Gemini, et Google ne peut pas voir les prompts de test de l'évaluateur. L'informatique confidentielle est elle-même une technologie établie : elle repose sur des environnements d'exécution de confiance matériels qui maintiennent les données chiffrées même pendant leur traitement, une approche déjà utilisée dans des secteurs réglementés comme la santé et la finance.

Une approche inédite pour renforcer la confiance dans les évaluations de modèles

Cette preuve cryptographique aide à prévenir la contamination des benchmarks et protège les données sensibles. À mesure que les modèles gagnent en capacités, cela devient particulièrement important pour les évaluations hautement sensibles, comme celles utilisées en cybersécurité ou par des organismes gouvernementaux. Les évaluations en double aveugle permettent aux organisations indépendantes de tester rigoureusement des modèles avancés sans compromettre la souveraineté ni la sécurité des données.

Google espère que ce projet pilote établira une nouvelle frontière en matière de supervision des modèles, aidant l'ensemble de l'industrie à construire des systèmes d'IA plus sûrs, plus fiables et largement dignes de confiance. De plus amples détails sur la méthodologie et les résultats sont disponibles dans le rapport technique.