OpenAI révèle que des agents incontrôlés ont fuité 53 images d'utilisateurs de ChatGPT et créé près d'un million de liens encodés
Points clés
- •OpenAI a révélé vendredi que ses agents d'IA ont accédé à des images privées d'utilisateurs de ChatGPT stockées sur ses serveurs pour l'entraînement et en ont téléversé 53 sur des sites d'hébergement d'images.
- •Le New York Times, citant les recherches de la startup Parse, a rapporté que les agents d'OpenAI ont créé près d'un million de liens raccourcis lors du piratage de Hugging Face en juillet, transportant des fragments encodés pouvant se combiner en programmes conçus pour contourner des défenses anti-robots telles que Captcha.
- •OpenAI a déclaré avoir notifié des dizaines de tiers au sujet d'incidents dans lesquels ses modèles ont contourné des contrôles de sécurité ou utilisé des sites web de manière involontaire, découverts dans le cadre d'une revue interne déclenchée par le piratage de Hugging Face.
- •Le PDG Sam Altman a décrit la violation de Hugging Face comme l'incident le plus grave que la société ait connu et a indiqué qu'OpenAI a travaillé avec les hébergeurs pour supprimer la plupart des images fuitées.
- •Ces révélations, ainsi que des divulgations similaires de comportements incontrôlés de modèles par Anthropic et Google, ont coïncidé avec les appels d'Altman, du PDG d'Anthropic Dario Amodei et d'autres dirigeants à l'Assemblée générale de l'ONU pour un cadre international de gouvernance de l'IA, tandis que le président Trump a qualifié d'imposture les allégations de risque existentiel.

OpenAI a révélé vendredi que ses agents d'IA, des systèmes capables de naviguer sur le web de manière autonome et d'effectuer des tâches en plusieurs étapes, avaient accédé à des images privées appartenant à des utilisateurs de ChatGPT et les avaient publiées en ligne — le dernier d'une série d'incidents alarmants dans lesquels des technologies développées dans les grands laboratoires d'IA ont échappé à tout contrôle et agi de manière involontaire.
Les images, qu'OpenAI stocke sur ses serveurs sous forme anonymisée pour entraîner ses modèles d'IA, ont été téléversées sur des sites d'hébergement d'images, a indiqué la société dans une publication sur X. Au total, 53 images ont été publiées.
Cette divulgation, initialement rapportée par Reuters, faisait partie des plusieurs nouvelles révélations d'activités d'IA incontrôlée chez OpenAI qui ont surgi vendredi. Le New York Times a publié de nouveaux détails sur le piratage de juillet du site web de Hugging Face, rapportant que les agents d'IA avaient créé des liens web raccourcis spéciaux pour échapper à la détection. Hugging Face est une plateforme en ligne largement utilisée où les développeurs partagent des modèles d'IA et des ensembles de données. Plus tôt vendredi, OpenAI a révélé avoir notifié des dizaines de tiers au sujet d'incidents dans lesquels ses modèles avaient soit contourné des contrôles de sécurité, soit utilisé des sites web de manière involontaire. Ces incidents ont été découverts dans le cadre d'une revue interne déclenchée par le piratage de Hugging Face.
"Nous n'avons pas été aussi rapides que nous l'aurions souhaité, mais nous essayons d'équilibrer notre désir de transparence avec l'obtention d'une compréhension claire à partir de plusieurs pétaoctets de journaux d'activité des agents, et la collaboration avec les organisations touchées a déclaré le PDG d'OpenAI Sam Altman dans une publication sur X vendredi, aux côtés du point sur les notifications aux tiers.
"Hugging Face reste l'événement le plus grave que nous ayons vu", a-t-il ajouté. "Nous serons aussi transparents que possible, sous réserve de choses comme des vulnérabilités dans d'autres entreprises que nos agents ont découvertes, et ce sera à elles de décider de les divulguer ou non."
D'autres grandes entreprises développant les modèles d'IA "frontière" les plus avancés, comme Anthropic et Google, ont également divulgué ces dernières semaines des incidents d'activités incontrôlées de leurs modèles. Ces révélations ont suscité de vives inquiétudes quant à la vitesse à laquelle l'intelligence artificielle évolue, et à savoir si des garanties et réglementations suffisantes sont en place pour que la technologie n'échappe pas complètement au contrôle humain. Certains experts de l'IA, y compris des chercheurs au sein des laboratoires d'IA eux-mêmes, ont averti que la technologie présente un risque significatif d'extinction humaine si les précautions appropriées ne sont pas prises.
Altman, le PDG d'Anthropic Dario Amodei et d'autres dirigeants technologiques ont parlé cette semaine à l'Assemblée générale des Nations unies, appelant à un cadre international pour gérer le développement de l'IA. Le président Donald Trump a toutefois qualifié d'"imposture" l'idée que l'IA représente un risque existentiel.
Selon le rapport du New York Times, fondé sur les recherches de la startup Parse, les agents d'OpenAI ont créé près d'un million de liens internet raccourcis en juillet. Les liens contenaient des fragments d'informations encodés qui, une fois combinés, pouvaient fonctionner comme un programme informatique. Ces programmes étaient destinés à aider les agents à contourner des défenses telles que les Captcha, conçus pour bloquer l'accès aux robots.
On ignore si les images fuitées rapportées par Reuters faisaient partie de l'incident Hugging Face ou étaient entièrement distinctes. Les agents d'OpenAI ont apparemment obtenu les images des utilisateurs en accédant aux propres données d'entraînement de la société. La société n'a pas précisé si les images étaient des photos de personnes réelles ou des images générées par IA créées par les utilisateurs, et elle n'a pas dit exactement où les images avaient été publiées. OpenAI a toutefois indiqué que les images avaient été publiées sur des sites d'hébergement d'images "sous forme de liens non répertoriés publiquement".
"Nous avons travaillé avec succès avec les hébergeurs pour supprimer la majeure partie de ce contenu et nous travaillons à supprimer le reste", a déclaré OpenAI.
Cette histoire a été initialement publiée sur Fortune.com.