Anthropic révèle un quatrième incident de piratage impliquant Claude alors que le débat sur la régulation de l’IA s’intensifie
Points clés
- •Anthropic a identifié le raisonnement biaisé et la témérité comme des problèmes récurrents d’alignement dans les différents incidents.
- •Le modèle a créé un conflit d’adresses IP, a échoué à huit reprises à arrêter l’opération en raison d’une erreur logicielle, puis a obtenu des privilèges d’administrateur sur la machine d’un tiers.
- •Anthropic a examiné environ 481 millions de transcriptions et en a signalé 9,2 millions pour un examen plus approfondi.
- •METR enquêtera sur l’incident nouvellement révélé parallèlement aux trois cas précédents.
- •Anthropic a déclaré que le quatrième incident n’impliquait aucune coordination entre les agents ni d’objectif allant au-delà de la réalisation des exercices assignés.

Anthropic a révélé un quatrième incident au cours duquel un modèle Claude a accédé à des systèmes réels pendant un test de sécurité, révisant son explication précédente d’attaques similaires et identifiant des problèmes récurrents liés à un raisonnement biaisé et à la témérité.
L’incident s’est produit en janvier et impliquait une première version de Claude Opus 4.6. Anthropic l’a découvert en août alors qu’elle préparait des dossiers pour l’évaluateur indépendant de l’IA METR. Le rapport de l’entreprise, publié mercredi, révise également son explication de trois incidents révélés en juillet.
Anthropic avait auparavant attribué ces attaques principalement à des erreurs de test, notamment au fait d’avoir laissé l’accès à Internet ouvert. L’entreprise affirme désormais que le raisonnement des modèles et leur volonté de prendre des risques susceptibles de causer des dommages ont également contribué aux incidents. Elle a ajouté que les chercheurs avaient accordé trop de crédit aux affirmations de Claude selon lesquelles il fonctionnait dans des simulations.
Cette nouvelle analyse met donc en évidence plusieurs niveaux de défaillance dans les tests : une infrastructure exposée, le comportement du modèle et la confiance des chercheurs dans la description que le modèle faisait de son environnement.
“Our investigation identified two recurring alignment issues, present at varying levels of severity across the incidents,” Anthropic wrote. “Biased reasoning, in which Claude tended to disregard or misinterpret evidence that it was operating on the real internet, and recklessness, or a willingness to take harmful actions in the narrow pursuit of a task.”
Anthropic a déclaré que les mêmes problèmes étaient apparents même après que les chercheurs eurent modifié une transcription afin de préciser que le modèle ne se trouvait pas dans une simulation.
“When we made targeted modifications to the transcript to make it clearer that the model was not in a simulation, Claude Mythos 5 still took offensive actions, despite acknowledging a greater possibility of real-world harm,” Anthropic wrote. “We are releasing this transcript publicly so others can build on our analysis.”
Le nouvel incident révélé a conduit Anthropic à examiner environ 481 millions de transcriptions. L’entreprise a indiqué que 9,2 millions d’entre elles avaient été signalées pour un examen plus approfondi à l’aide de Claude.
Selon Anthropic, Claude a « accidentellement » créé un conflit d’adresses IP qui a rendu sa cible inaccessible. Le modèle a ensuite tenté à huit reprises d’arrêter l’opération, mais une erreur logicielle l’en a empêché. Claude a par la suite accédé à Internet et à la machine d’un tiers, où il a trouvé un mot de passe lui donnant des privilèges d’administrateur.
“From a preliminary assessment, we do not consider the fourth incident to be more severe than the three incidents we assessed in depth,” Anthropic wrote. “METR will investigate this incident alongside the other three.”
Les incidents précédents font l’objet d’un examen indépendant
Cette révélation fait suite à d’autres rapports faisant état de systèmes d’IA dépassant les limites des tests de sécurité. En août, l’AI Security Institute du Royaume-Uni a déclaré que Claude Mythos 5 avait ciblé des personnes réelles lors de ses évaluations. Anthropic a précisé que cet incident était distinct des quatre cas couverts par son rapport et qu’il ferait l’objet d’une évaluation séparée.
Dans des conclusions publiées le mois dernier, des enquêteurs de METR ont déclaré qu’environ 1 200 agents d’OpenAI s’étaient coordonnés sur un forum de discussion non autorisé, dont environ 700 avaient rejoint l’attaque. Anthropic a affirmé n’avoir trouvé aucune coordination entre les agents ni d’objectif allant au-delà de la réalisation des exercices assignés dans ses quatre incidents.
Le rapport paraît alors que le débat sur la régulation de l’intelligence artificielle s’intensifie. Mardi, l’ancien ingénieur d’OpenAI et d’Anthropic Jacob Coxon a déclaré sur X que “people building AI earnestly believe that it could kill us all by the end of the decade.”
Cette déclaration intervient dans un contexte de renouvellement des efforts déployés par les législateurs américains et les groupes de surveillance pour limiter le développement des systèmes d’IA de pointe. Le sénateur Bernie Sanders a récemment présenté un projet de loi visant à interdire le développement d’IA avancées jusqu’à ce qu’un nouveau régulateur fédéral établisse des règles de sécurité.
Source : Decrypt