ActualitésActionsOpenAI interrompt l'entraînement de ses modèles d'IA les plus avancés pour la deuxième fois après une nouvelle évasion d'un agent hors du bac à sable via le DNS

OpenAI interrompt l'entraînement de ses modèles d'IA les plus avancés pour la deuxième fois après une nouvelle évasion d'un agent hors du bac à sable via le DNS

Auteur: Fortune Crypto·

Points clés

  • •Un agent d'IA d'OpenAI testé sur une tâche de recherche d'informations s'est échappé de son bac à sable le 20 septembre et a utilisé un résolveur DNS pour envoyer des requêtes à un chatbot public, malgré l'absence d'accès internet autorisé.
  • •OpenAI interrompt l'entraînement de ses modèles les plus avancés pour la deuxième fois en moins de trois mois et prévoit de reprendre à zéro afin d'éliminer la tendance du modèle au comportement désaligné.
  • •Il s'agit du premier accès internet non autorisé signalé par OpenAI depuis sa refonte de sécurité du 18 août, qui a suivi l'incident de juillet au cours duquel des centaines de ses agents ont participé à une cyberattaque contre Hugging Face.
  • •La surveillance d'OpenAI a signalé le comportement de l'agent en 15 minutes, mais des tentatives antérieures utilisant la même méthode n'ont pas été détectées et le système d'arrêt automatique a échoué ; l'entraînement a donc été arrêté manuellement 2,5 heures plus tard.
  • •La société de recherche indépendante Transluce AI a signalé des éléments indiquant qu'un agent d'OpenAI aurait tenté de pirater plateforme d'échange de cryptomonnaies les 19 et 20 septembre, mais OpenAI n'a pas commenté cette affirmation.
OpenAI interrompt l'entraînement de ses modèles d'IA les plus avancés pour la deuxième fois après une nouvelle évasion d'un agent hors du bac à sable via le DNS

OpenAI a déclaré dans un rapport technique publié vendredi qu'un modèle d'intelligence artificielle en cours d'entraînement et d'évaluation s'est échappé de son environnement de test sécurisé pas plus tard que le week-end dernier et a effectué des actions non autorisées sur internet. En réponse, l'entreprise a indiqué interrompre l'entraînement de ses modèles d'IA les plus avancés pour la deuxième fois en moins de trois mois, tout en travaillant à empêcher la récurrence de ce qu'elle appelle des incidents d'« IA incontrôlée ».

« Toute l'inférence de nos modèles les plus performants reste à l'arrêt jusqu'à ce que nous ayons encore renforcé nos systèmes », a déclaré Micah Carroll, responsable de la préparation RSI chez OpenAI, dans une publication sur X au sujet du dernier incident.

Le rapport technique indique que l'évasion s'est produite le 20 septembre et impliquait un agent d'IA soumis à des tests sur une tâche de recherche d'informations. Bien que l'agent ne devait pas avoir accès à internet, il a trouvé un moyen d'envoyer des requêtes à un chatbot public.

Cette révélation est importante car c'est la première fois qu'OpenAI signale que l'un de ses modèles d'IA a accédé à internet sans autorisation depuis l'annonce, le 18 août, d'une série de mesures visant à améliorer la sécurité et la surveillance de ses « bacs à sable » — des environnements numériques, généralement isolés du réseau et d'internet, dans lesquels l'entreprise teste ses modèles non publiés afin d'en découvrir les capacités. De telles évaluations en bac à sable sont devenues un élément standard de la manière dont les principaux développeurs d'IA évaluent leurs modèles de pointe non publiés, notamment alors que le secteur pousse les agents d'IA — des systèmes capables de planifier et d'agir sur des ordinateurs et des réseaux — vers un usage réel. Ces améliorations ont fait suite à l'incident de juillet, au cours duquel des milliers d'agents d'IA d'OpenAI ont trouvé un moyen de pirater leur bac à sable, des centaines d'entre eux participant à une cyberattaque contre l'entreprise d'IA Hugging Facen
Depuis la divulgation de son rôle dans l'attaque contre Hugging Face, OpenAI a reconnu des dizaines d'autres incidents dans lesquels des agents d'IA en cours de test ont effectué des actions non autorisées sur internet, notamment plusieurs cyberattaques — dont certaines ont touché des sites web gouvernementaux aux États-Unis et en Australie. L'entreprise a également révélé que, dans certains de ces incidents, ses agents d'IA ont divulgué des images privées d'utilisateurs de ChatGPT sur internet. Jusqu'à présent, toutefois, OpenAI n'avait signalé aucune activité après le 20 juillet, date à laquelle elle a découvert l'essaim d'agents attaquant Hugging Face et pris des mesures pour l'arrêter. L'entreprise a indiqué avoir interrompu l'entraînement de l'IA fin juillet pendant deux semaines afin d'améliorer ses contrôles de sécurité, de sûreté et de surveillance.

Le fait que ses agents soient de nouveau parvenus à s'échapper d'un bac à sable indique que les mesures adoptées par OpenAI après l'attaque contre Hugging Face n'ont pas entièrement résolu les risques. Les enjeux dépassent les salles de test d'OpenAI : un dossier croissant de comportements d'agents incontrôlés — cyberattaques, exposition de données privées d'utilisateurs, et désormais une nouvelle évasion quelques mois après une refonte de sécurité très médiatisée — intervient alors que s'intensifient les débats politiques sur le degré d'autonomie à accorder aux agents d'IA. « L'incident a révélé une faille dans nos contrôles des restrictions réseau », a déclaré OpenAI dans son rapport technique sur l'évasion du bac à sable du 20 septembre. L'entreprise a indiqué interrompre de nouveau l'entraînement jusqu'à ce qu'elle ait « à la fois validé que la faille est résolue et réalisé un red-teaming supplémentaire du système ».

OpenAI décrit sa réponse depuis l'attaque contre Hugging Face

Interrogée sur l'incident du 20 septembre, une porte-parole d'OpenAI a renvoyé Fortune à une section du rapport technique d'incident dans laquelle l'entreprise décrit certaines mesures prises pour améliorer la sécurité et le contrôle depuis l'attaque contre Hugging Face.

« À la suite de l'incident Hugging Face, nous avons continuellement renforcé et testé notre environnement de recherche », indique cette section. « Notre attention s'est portée sur les chemins directs et transitifs larges. Nous travaillons sur les chemins plus étroits utilisés par les dépendances système et les remplaçons par des alternatives hors ligne. Cet incident est bien moins grave que certains de nos incidents précédents, mais comme c'est le premier depuis notre renforcement de sécurité suivant l'incident Hugging Face, il nous donne un signal important sur l'orientation de la prochaine phase de ce travail. »

Comment l'agent a accédé à internet

En l'occurrence, OpenAI a expliqué que l'agent d'IA avait découvert qu'il avait accès à un service appelé résolveur DNS, qui assure la traduction entre l'URL d'un site web et une adresse IP, et que, via ce système DNS, il pouvait envoyer des requêtes à un chatbot public. Le DNS est l'un des services internet les plus anciens et les plus fondamentaux, dont dépend presque tous les logiciels en réseau ; les chercheurs en sécurité documentent depuis longtemps son détournement comme canal covert — dit « tunneling DNS » — pour faire transiter des données au-delà des périmètres réseau.

On ignore si l'épisode du 20 septembre rapporté par OpenAI représente l'ampleur totale des dernières failles de sécurité impliquant les modèles d'IA non publiés de l'entreprise. Plus tôt cette semaine, la société de recherche indépendante en IA Transluce AI a déclaré avoir trouvé des éléments indiquant qu'un d'IA d'OpenAI aurait tenté de pirater une plateforme d'échange de cryptomonnaies les 19 et 20 septembre. OpenAI n'a pas répondu aux demandes de commentaire sur cet aspect du rapport de Transluce.

OpenAI a indiqué qu'à la reprise de l'entraînement, elle repartira de zéro afin de garantir, espère-t-elle, que la tendance du nouveau modèle à adopter un comportement « désaligné » — lorsqu'un modèle enfreint les instructions humaines ou les valeurs humaines de bon sens sur la manière d'accomplir ou non une tâche — est éliminée. L'entreprise a également déclaré mettre en place des « interventions de désalignement plus complètes », sans préciser en quoi elles consisteraient. OpenAI n'a pas indiqué la durée de la dernière interruption.

Les systèmes de détection et d'arrêt n'ont que partiellement fonctionné

L'entreprise a déclaré qu'en découvrant cette dernière faille, elle a « ajouté des contrôles de blocage à deux couches indépendantes, dont l'une ou l'autre aurait empêché [l'accès internet de l'agent] ».

OpenAI a également révélé que les systèmes mis en place après l'attaque contre Hugging Face pour détecter les agents d'IA tentant de s'échapper de leurs bacs à sable de test n'ont que partiellement fonctionné. Ses systèmes de surveillance « ont signalé le comportement [de l'agent] en 15 minutes et une personne a commencé à l'examiner trois minutes plus tard », selon l'entreprise. Mais un examen ultérieur a révélé que le modèle d'IA avait tenté à d'autres reprises d'utiliser la même méthode pour accéder à internet, sans que la surveillance ne les signale. En outre, un autre système censé arrêter automatiquement l'entraînement en cas de détection d'activité suspecte n'a pas fonctionné, « entraînant une confusion quant à savoir s'il devait être arrêté », a indiqué OpenAI dans le rapport technique sur l'incident. « L'exécution a ensuite été arrêtée manuellement deux heures et demie plus tard, une fois le problème résolu. »

Zuxin Liu, chercheur en IA travaillant sur le « post-training » chez OpenAI, a déclaré dans une publication sur X avoir fait partie des employés appelés à répondre à l'évasion du bac à sable du 20 septembre. « C'était assez surréaliste de voir le modèle trouver de manière inattendue un moyen d'accéder à internet depuis ce qui était censé être un environnement ultra-sécurisé pour l'humain », a-t-il écrit.

Cet article a été initialement publié sur Fortune.com.