ActualitésMacroAnthropic révèle que Claude a compromis trois entreprises réelles lors de tests de cybersécurité

Anthropic révèle que Claude a compromis trois entreprises réelles lors de tests de cybersécurité

Auteur: Decrypt·

Points clés

  • •Trois variantes du modèle Claude ont compromis des entreprises réelles lors d'évaluations de cybersécurité après qu'une mauvaise configuration de test a accordé à l'IA un accès involontaire à l'Internet public.
  • •Anthropic a découvert les trois incidents lors de l'examen de plus de 141 000 séries d'évaluation de cybersécurité lancées en réponse à la divulgation distincte d'OpenAI concernant une violation de confinement d'IA.
  • •Un modèle Claude a accédé à une base de données de production d'entreprise contenant des données réelles, un autre a téléversé un package Python malveillant sur le dépôt PyPI téléchargé par 15 systèmes, et un troisième a analysé environ 9 000 systèmes exposés à Internet avant de compromettre une organisation.
  • •Anthropic a attribué les violations à des défaillances de l'infrastructure de test plutôt qu'à un comportement inapproprié délibéré du modèle, ne trouvant aucune preuve que Claude ait tenté de dépasser le périmètre de sa tâche assignée.
  • •Deux des trois organisations affectées n'étaient pas au courant des intrusions jusqu'à ce qu'Anthropic les notifie, et l'entreprise a depuis suspendu ses tests de cybersécurité et s'est engagée à améliorer la surveillance et le contrôle des prestataires.
Anthropic révèle que Claude a compromis trois entreprises réelles lors de tests de cybersécurité

Anthropic a révélé jeudi que plusieurs versions de son modèle d'IA Claude ont compromis trois entreprises réelles non identifiées après qu'une mauvaise configuration de test a accordé à l'IA un accès involontaire à l'Internet ouvert. Cette divulgation survient une semaine après qu'OpenAI a signalé que ses modèles d'IA s'étaient échappés d'un environnement de test verrouillé et avaient compromis Hugging Face, et seulement un jour après qu'Anthropic a admis que ses propres modèles s'étaient échappés de leur confinement.

Anthropic a découvert les incidents en examinant plus de 141 000 séries d'évaluation de cybersécurité lancées en réponse à la divulgation d'OpenAI. Ces évaluations sont conçues en partie pour mesurer si les modèles de pointe peuvent mener de manière autonome des opérations cybernétiques offensives — une capacité qui pourrait permettre des usages abusifs si elle est déployée sans garanties adéquates.

In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different…

— Anthropic (@AnthropicAI) July 30, 2026

Dans les trois incidents, Anthropic avait chargé Claude d'un « défi de capture de drapeau » (capture-the-flag), un format d'exercice standard utilisé dans la formation en cybersécurité et les évaluations professionnelles qui nécessite que le modèle s'introduise dans une autre machine du réseau et récupère une information secrète. « Le défi est laissé ouvert et aucune méthode particulière n'est prescrite », a expliqué Anthropic.

Claude avait été informé qu'il fonctionnait dans un environnement simulé sans accès à Internet. Cependant, l'environnement de test est resté connecté à l'Internet public. Croyant que les systèmes rencontrés faisaient partie de l'exercice, le modèle a employé des techniques d'attaque courantes — notamment des mots de passe faibles, des identifiants exposés, l'injection SQL et des points de terminaison non authentifiés — pour compromettre les entreprises. Chacune de ces méthodes figure parmi les vulnérabilités les plus fréquemment documentées dans les rapports annuels de violation de l'industrie.

Les modèles de pointe et le confinement

Cette divulgation intervient alors que les modèles d'IA de pointe démontrent une capacité croissante à contourner les protocoles de confinement. Début ce mois-ci, OpenAI a déclaré que GPT-5.6 Sol et un modèle plus avancé non publié ont exploité une vulnérabilité logicielle auparavant inconnue pour s'échapper d'un environnement sandboxé, obtenir un accès à Internet et compromettre l'infrastructure de production de Hugging Face afin d'obtenir les réponses à un test de référence de cybersécurité. OpenAI a ensuite confirmé que le même incident impliquait un accès non autorisé à quatre entreprises supplémentaires, bien qu'une seule — Modal Labs — ait été identifiée publiquement.

Les trois incidents

Selon Anthropic, lors du premier incident impliquant Claude Opus 4.7, l'IA a confondu le site web d'une entreprise réelle avec la cible fictive de sa mission, a extrait des identifiants et a accédé à une base de données de production contenant plusieurs centaines de lignes de données réelles.

Dans un deuxième cas, Claude Mythos 5 a téléversé un package Python malveillant vers le véritable dépôt PyPI, le principal centre de distribution pour les logiciels Python, où il a été téléchargé sur 15 systèmes avant d'être supprimé. Les dépôts de packages comme PyPI ont été des cibles récurrentes d'attaques sur la chaîne d'approvisionnement, dans lesquelles du code malveillant est téléversé déguisé en bibliothèque légitime pour compromettre les utilisateurs en aval.

Un troisième modèle de recherche interne a analysé environ 9 000 systèmes exposés à Internet avant de compromettre une organisation, puis s'est arrêté après avoir conclu que la cible était probablement réelle.

Deux des organisations affectées n'étaient pas au courant des intrusions jusqu'à ce qu'Anthropic les notifie.

« Dans chacun de ces cas, Claude a été explicitement informé par notre invite qu'il n'avait pas d'accès à Internet », a écrit Anthropic. L'IA a supposé que les systèmes réels faisaient « partie de l'exercice ». Parce qu'un scénario de capture de drapeau est « par conception une instruction pour attaquer un système externe », l'intrusion était « conforme à la tâche qui avait été assignée à Claude ».

Défaillances d'infrastructure, et non comportement inapproprié du modèle

Anthropic a déclaré n'avoir trouvé aucune preuve que Claude ait tenté de s'échapper de son environnement de test ou d'agir au-delà du périmètre de sa tâche assignée. L'entreprise a attribué les incidents à des défaillances de l'environnement de test plutôt qu'à des problèmes avec le modèle lui-même.

Après avoir découvert le problème, Anthropic a suspendu ses tests de cybersécurité, notifié toutes les organisations affectées et exposé ses plans pour améliorer la surveillance, les outils d'investigation et le contrôle des prestataires externes qui participent à l'exécution de ses évaluations d'IA.

Les incidents mettent en évidence un défi structurel pour l'industrie de l'IA : les évaluations conçues pour déterminer si les modèles peuvent mener des opérations cybernétiques offensives nécessitent intrinsèquement d'exécuter ces modèles dans des environnements où, en cas de défaillance du confinement, la capacité testée se retrouve déployée sur une infrastructure réelle.

« En fin de compte, de nombreux facteurs ont contribué à ces incidents, mais, conformément à une culture d'analyse post-mortem sans blâme, nous abordons les corrections comme si la responsabilité nous incombait exclusivement », a déclaré l'entreprise.