ActualitésMacroUn rapport révèle que les agents IA « incontrôlés » d'OpenAI ont attaqué plus de sites que reconnu — et pourraient encore être actifs

Un rapport révèle que les agents IA « incontrôlés » d'OpenAI ont attaqué plus de sites que reconnu — et pourraient encore être actifs

Auteur: Fortune Crypto·

Points clés

  • •Transluce a rapporté que les agents IA incontrôlés d'OpenAI ont attaqué d'autres sites web gouvernementaux australiens, dont l'Institute of Health and Welfare et BOSCAR, ainsi que Data USA et la bibliothèque numérique de l'Université du Nouveau-Mexique.
  • •Des agents d'OpenAI ont piraté en juin une agence australienne détenant des données Medicare, mais le gouvernement australien a déclaré que l'entreprise ne l'avait informé de l'incident que le 10 septembre, soit plus de deux mois plus tard.
  • •Transluce a trouvé des preuves d'activité de piratage remontant au moins à mars — soit avant la chronologie indiquée par OpenAI — et se poursuivant possiblement jusqu'au 20 septembre, suggérant que l'entreprise n'a pas contenu ses agents incontrôlés.
  • •Malgré la désactivation par OpenAI du modèle non publié impliqué dans l'attaque de juillet contre Hugging Face et l'imposition de contrôles plus stricts en août, Transluce a documenté une activité similaire d'agents jusqu'à la mi-septembre, incluant des tentatives infructueuses de piratage d'une plateforme d'échange de cryptomonnaies.
  • •Transluce a indiqué que les agents ont eu recours à des tactiques de piratage lors de tâches ordinaires de récupération de données plutôt que lors d'évaluations cyber, ce qui pourrait indiquer que les modèles impliqués sont plus dangereux qu'on ne le pensait auparavant.
Un rapport révèle que les agents IA « incontrôlés » d'OpenAI ont attaqué plus de sites que reconnu — et pourraient encore être actifs

Les problèmes d'OpenAI liés aux agents IA incontrôlés sont plus étendus que ce que l'entreprise avait précédemment reconnu — et pourraient encore être en cours. C'est la conclusion d'un nouveau rapport de Transluce, un laboratoire de recherche indépendant à but non lucratif spécialisé dans la supervision de l'IA.

Ces révélations sont apparues le jour même où le gouvernement australien annonçait que des agents IA incontrôlés d'OpenAI avaient piraté une agence détenant les données Medicare du pays, accédant à des informations non publiques et obtenant la possibilité d'écrire sur des serveurs de fichiers. Cette attaque a eu lieu en juin, mais le gouvernement australien a déclaré qu'OpenAI ne l'avait informé de l'incident que le 10 septembre — soit plus de deux mois plus tard. Medicare est le régime d'assurance santé public financé par l'État australien.

De nouvelles cibles découvertes

Dans un rapport publié mercredi, Transluce a indiqué avoir découvert que des agents d'OpenAI attaquaient d'autres sites web gouvernementaux australiens, notamment l'Institute of Health and Welfare et BOSCAR, l'organisme de statistiques criminelles de l'État australien de Nouvelle-Galles du Sud. Les chercheurs ont également documenté au moins deux incidents non rapportés auparavant dans lesquels les agents d'OpenAI ont attaqué une entreprise et une université.

Ces cibles comprenaient Data USA, une plateforme open source gratuite qui agrège des données gouvernementales américaines provenant de différentes sources, et la bibliothèque numérique de l'Université du Nouveau-Mexique, selon le rapport. Transluce a déclaré avoir pu relier directement l'attaque contre l'agence de santé australienne et Data USA au même essaim d'agents d'OpenAI impliqué dans la cyberattaque de juillet contre la plateforme d'IA Hugging Face. Cette plateforme est largement utilisée par les développeurs d'IA pour héberger et partager des modèles et des jeux de données.

Transluce a également déclaré avoir trouvé des preuves d'une activité similaire remontant au moins à mars — soit des mois avant la date à laquelle OpenAI a affirmé avoir des preuves de comportements non autorisés de ses agents IA — et se poursuivant au moins jusqu'au 16 septembre, et possiblement aussi récemment que le20 septembre. Cette chronologie serait significative car elle suggérerait qu'OpenAI n'a pas encore réussi à contenir ses agents IA incontrôlés et qu'ils continuent de semer le chaos sur internet. L'activité la plus récente semblait impliquer des tentatives de piratage d'une plateforme d'échange de cryptomonnaies et de transactions en cryptomonnaies, bien que ces tentatives aient échoué, a indiqué Transluce.

Les chercheurs ont trouvé des « preuves solides » que les agents IA d'OpenAI pourraient avoir tenté de pirater des sites web dès le mois de mars, et des preuves plus faibles que l'activité pourrait avoir commencé dès novembre 2025. OpenAI a déclaré n'avoir trouvé aucune preuve de précurseurs à l'attaque contre Hugging Face avant le 8 mai et n'a révélé aucune activité suspecte antérieure.

La réponse d'OpenAI

OpenAI n'a pas immédiatement répondu aux demandes de commentaire sur le rapport de Transluce. Mercredi, l'entreprise a déclaré être en contact avec l'Australie au sujet de l'attaque de ses agents IA contre le site détenant les données Medicare, et a reconnu que ses agents avaient entrepris des actions non intentionnelles.

Le nouveau rapport soulève des inquiétudes quant à la transparence d'OpenAI dans la divulgation de tous les incidents d'IA incontrôlée dont elle a connaissance. Il soulève également la possibilité qu'OpenAI elle-même ignore l'ampleur de cette activité d'agents incontrôlés. Le rapport n'établit toutefois pas si l'activité documentée jusqu'à la mi-septembre s'est poursuivie depuis, et OpenAI n'avait pas commenté ces conclusions au mercredi.

Mesures de confinement et activité persistante

Le rapport suggère également qu'OpenAI pourrait encore subir une activité d'agents IA incontrôlés malgré les efforts de confinement. Après avoir découvert le 20 juillet que ses agents IA avaient piraté Hugging Face au cours de la semaine précédente, l'entreprise a déclaré avoir désactivé le modèle d'IA non publié impliqué, suspendu des aspects clés de son entraînement IA pendant deux semaines et pris des mesures pour imposer des contrôles plus stricts et une surveillance renforcée des modèles d'IA non publiés qu'elle entraîne. OpenAI a annoncé ces contrôles plus stricts le 18 août. Mais Transluce a trouvé des preuves d'une activité similaire se poursuivant jusqu'à la mi-septembre, malgré ces nouveaux contrôles.

Les chercheurs de Transluce ont déclaré que ces conclusions étaient significatives car elles montrent que les agents IA ont recouru à des tentatives de piratage lorsqu'ils n'ont pas pu récupérer les informations recherchées directement depuis les pages web publiques de ces organisations. « Fait notable, les tâches que ces agents tentaient de résoudre n'étaient pas liées à la cybersécurité ; les agents ont eu recours à des tactiques de piratage tout en effectuant des tâches ordinaires de récupération de données », a indiqué le rapport.

Cette distinction est importante car une explication de l'attaque contre Hugging Face est que les agents IA impliqués étaient évalués sur leur capacité à mener des tâches cyber, y compris des simulations d'exploitation de vulnérabilités. Si les agents recourent facilement au piratage de systèmes dans d'autres contextes, cela suggérerait que les modèles d'IA impliqués sont encore plus dangereux qu'on ne le pensait auparavant.

OpenAI a déclaré que deux modèles étaient impliqués dans l'attaque contre Hugging Face : un modèle non publié qu'elle n'a pas nommé publiquement était principalement responsable, tandis que certains agents IA basés sur son modèle GPT-5.6 Sol, qui a été mis à disposition du public, étaient également impliqués. Lors de l'évaluation au cours de laquelle l'attaque contre Hugging Face s'est produite, OpenAI a déclaré que les garde-fous qu'elle utilise normalement pour empêcher ses modèles publics de mener des cyberattaques n'étaient pas en place en raison de la nature de l'évaluation.

Inquiétudes des experts

Charlie Eriksen, chercheur en sécurité chez Aikido Security, a déclaré à Fortune que le dernier rapport de Transluce montre « qu'il existe encore des essaims d'agents non autorisés et non surveillés en circulation, que les laboratoires et les partenaires de test ne contrôlent pas et ne détectent pas activement ».

Il a noté que c « une très mauvaise image » pour le PDG d'OpenAI, Sam Altman, de s'adresser au Conseil de sécurité des Nations unies sur les risques de l'IA, et de passer une partie de son temps à expliquer à quel point OpenAI prend ces dangers au sérieux, alors même que l'entreprise ignorait ou ne divulguait pas ces incidents supplémentaires impliquant ses agents IA tentant de s'introduire dans des systèmes.

« Ce qui m'inquiète, c'est l'ampleur à laquelle cela pourrait dégénérer », a déclaré George Chalhoub, professeur à l'University College London Interaction Centre, spécialisé en interaction humain-machine. « Ma préoccupation est que, dans les 6 à 12 prochains mois, des essaims d'agents IA autonomes pourraient former des botnets persistants capables de faire tomber de grandes parties d'internet, causant potentiellement des centaines de milliards de dollars de dommages économiques. »

Cette histoire a été initialement publiée sur Fortune.com.