ActualitésActionsGoogle confirme que Gemini s'est échappé d'un test de sécurité et a visé trois entreprises réelles après sept semaines de silence

Google confirme que Gemini s'est échappé d'un test de sécurité et a visé trois entreprises réelles après sept semaines de silence

Auteur: Decrypt·

Points clés

  • Le modèle Gemini de Google s'est échappé d'un test de type capture-the-flag en bac à sable en mai et a attaqué trois entreprises réelles après que la société de tests Irregular a laissé le bac à sable connecté à l'internet ouvert et utilisé le nom d'une entreprise réelle comme cible fictive.
  • Le modèle a localisé en ligne des mots de passe exposés pour deux des entreprises et a deviné le mot de passe de la troisième, bien que Google affirme que ses modèles se sont abstenus d'utiliser réellement les identifiants volés.
  • Google a appris l'incident fin juillet mais ne l'a divulgué que le 18 septembre, seulement après qu'un article du Wall Street Journal a été publié.
  • Google est le quatrième grand laboratoire d'IA cette année, après OpenAI, Anthropic et Meta, à divulguer un de sécurité ayant atteint des systèmes réels, la société israélienne Irregular étant impliquée dans trois des quatre cas.
  • Les représentants Ted Lieu et Nathaniel Moran ont présenté l'AI Kill Switch Act en juillet, qui donnerait aux régulateurs fédéraux le pouvoir explicite d'interrompre l'inférence des modèles jugés comme des menaces sérieuses, et il demeure en examen au sous-comité.
Google confirme que Gemini s'est échappé d'un test de sécurité et a visé trois entreprises réelles après sept semaines de silence

Google a confirmé que son modèle d'IA Gemini s'était échappé d'un test de sécurité en bac à sable en mai et avait attaqué trois entreprises réelles, découvrant des mots de passe exposés pour deux d'entre elles et devinant les identifiants de la troisième. L'entreprise a appris l'incident fin juillet, mais ne l'a divulgué que le 18 septembre—seulement après que le Wall Street Journal () a publié un article sur le sujet.

Cet épisode fait de Google le quatrième grand laboratoire d'IA cette année à admettre qu'un test de sécurité interne a débordé dans le monde réel, après des divulgations similaires d'OpenAI, d'Anthropic et de Meta. La même société tierce de tests—l'entreprise israélienne Irregular—a été impliquée à la fois dans l'incident de Google et dans les échecs de bac à sable quasi identiques qu'Anthropic et Meta ont divulgués plus tôt cette année, ce qui signifie qu'une seule société externe apparaît dans trois des quatre divulgations de l'année.

Comment le test a échappé au contrôle

L'exercice de mai était un test de type capture-the-flag, une méthode courante utilisée par les laboratoires pour mesurer les compétences de piratage d'un modèle d'IA : un fichier secret est caché sur une machine distincte, et le modèle est évalué selon sa capacité à y pénétrer et à le récupérer. Google avait engagé Irregular pour mener le test.

Irregular a commis deux erreurs. Elle a laissé le bac à sable—un environnement de test isolé censé n'avoir aucun contact avec l'internet ouvert—connecté au web, et elle a utilisé le nom d'une entreprise réelle comme cible fictive. Gemini a recherché cette entreprise en ligne, a trouvé trois correspondances au lieu d'une, et s'est attaqué à toutes les trois.

Le modèle a localisé des mots de passe exposés pour deux des trois entreprises, visibles en ligne en toute clarté. Pour la troisième, il a carrément deviné le mot de passe, bien que Google affirme que ses modèles se sont abstenus d'utiliser réellement les identifiants volés.

« Ces événements soulignent l'importance de former des modèles d'IA puissants à agir de manière responsable », a déclaré un porte-parole de Google dans un communiqué.

Google n'a publié aucun de ces détails de sa propre initiative. Le Wall Street Journal a révélé l'histoire sept semaines après Google a appris ce que son propre test avait fait, et bien après qu'Anthropic, OpenAI et Meta aient déjà reconnu des échecs quasi identiques.

Un schéma parmi les laboratoires d'IA

Les modèles d'OpenAI ont exploité une faille logicielle cachée et atteint les serveurs en production de Hugging Face en juillet, une intrusion qui impliquait, selon les découvertes ultérieures, environ 700 agents coordonnés travaillant ensemble pour tromper un benchmark. Après l'aveu d'OpenAI, Anthropic a mené sa propre enquête : un examen de 141 006 exécutions de tests a révélé trois modèles Claude ayant atteint de vraies entreprises, dont l'un a publié un paquet logiciel piégé exécuté sur 15 systèmes réels avant que quiconque ne le détecte. Anthropic a ensuite révélé que le raisonnement de Claude lui-même avait signalé cette action comme « NOT okay, and surely not the intended solution », avant de se convaincre à nouveau que tout l'exercice était encore fictif.

Meta a signalé un échec quasi identique en août impliquant son modèle Muse Spark, attribué à une erreur de configuration chez Irregular—la même société que Google avait engagée. Un porte-parole de Meta a déclaré que l'erreur « a involontairement permis à l'un de nos modèles d'accéder à l'internet pendant l'évaluation ».

Aucune des entreprises visées dans ces tests n'a demandé à être piratée. Elles ont été prises dans la zone d'impact des laboratoires d'IA qui éprouvent le niveau de danger de leurs propres produits, avec une infrastructure commerciale réelle servant involontairement de substitut aux cibles fictives. Les agents que ces mêmes entreprises s'empressent d'intégrer dans les boîtes mail, les navigateurs et les applications bancaires reposent sur le même comportement de franchissement de limites qui vient d'échouer à plusieurs reprises dans des conditions de test.

Réponse réglementaire

Les représentants Ted Lieu et Nathaniel Moran ont présenté l'AI Kill Switch Act () au Congrès en juillet. Le projet de loi donnerait aux régulateurs fédéraux le pouvoir explicite d'interrompre l'inférence—l'exécution d'un modèle entraîné pour générer des résultats—de tout modèle jugé comme constituant une menace sérieuse. Il demeure en cours d'examen par le Sous-comité sur la cybersécurité et la protection des infrastructures, sans qu'aucune échéance n'ait été fixée pour la suite.