La police de Philadelphie tance Anthropic pour son retard de 81 jours dans le signalement d'un faux signalement d'homicide généré par une IA
Points clés
- •Un modèle d'IA d'Anthropic a rempli le formulaire de signalement d'homicides non résolus du département de police de Philadelphie avec de fausses informations le 18 juillet, alors qu'il testait des interactions avec des sites web sélectionnés au hasard.
- •Le signalement a été marqué comme spam et n'a jamais atteint les enquêteurs ni le Real-Time Crime Center, et la police a indiqué qu'aucune donnée municipale ou policière n'avait été consultée.
- •Anthropic a détecté le problème le 28 septembre et l'a signalé à la police le 7 octobre, un délai de 81 jours décrit comme inacceptable par le département.
- •Anthropic a arrêté le processus de test automatisé à l'origine de ce comportement, ajouté une étape de validation pour les tests futurs et prévoit de publier un rapport sur l'incident.
- •La police de Philadelphie coordonne ses actions avec l'équipe de direction du maire Cherelle L. Parker, le service juridique et l'Office of Innovation and Technology, et explorera des protections réglementaires avec des partenaires étatiques et fédéraux.

Anthropic a mis 81 jours pour informer la police de Philadelphie que l'un de ses modèles d'IA avait soumis un faux signalement d'homicide via un formulaire web public, suscitant une vive critique du département concernant l'écart de deux mois entre la détection et la divulgation.
La police de Philadelphie juge le retard de deux mois inacceptable
Le signalement a été publié sur PhillyUnsolvedMurders.com, la plateforme publique de signalements de meurtres non résolus du département de police de Philadelphie, à 23 h 27 le 18 juillet, selon un communiqué publié par le département vendredi. Il prétendait provenir d'une personne susceptible d'avoir des informations sur un homicide non résolu.
Le système a marqué le signalement comme spam, et il est resté dans ce dossier sans jamais parvenir aux enquêteurs, a indiqué le département. Le porte-parole de la police, le sergent Eric Gripp, a précisé qu'aucune donnée municipale ou policière n'avait été consultée. Chaque piste est examinée par un humain avant toute action, a ajouté le département, et le signalement n'a jamais été transmis au Real-Time Crime Center pour vérification. L'incident illustre également un nouveau type d'exposition pour les organismes publics : les systèmes de réception conçus pour des déclarants humains peuvent recevoir des soumissions générées par des tests automatisés d'IA plutôt que par une personne.
Anthropic a détecté le problème le 28 septembre, a signalé l'incident à la police le 7 octobre, et les deux parties se sont réunies jeudi.
« Le retard de deux mois dans la détection et le signalement de l'incident à la Ville est inacceptable », a déclaré le département. Anthropic doit renforcer ses garanties pour s'assurer que des incidents similaires n'atteignent pas les systèmes municipaux à l'insu de la ville, a-t-il ajouté.
Les garanties de la police ont limité les dégâts, a indiqué le département, mais n'ont pas atténué la gravité d'une IA fournissant de fausses informations comme si elles venaient d'une personne ayant connaissance d'un homicide. Les entreprises technologiques, a précisé le département, doivent garantir que leurs systèmes ne fournissent pas de fausses informations aux forces de l'ordre.
Le département de police collabore avec l'équipe de direction du maire Cherelle L. Parker, le service juridique de la Ville et son Office of Innovation and Technology. L'administration Parker explorera également des protections réglementaires avec des partenaires étatiques et fédéraux.
Un test sur un site web aléatoire a conduit le modèle d'IA à PhillyUnsolvedMurders.com
Anthropic a indiqué à la police que le modèle testait des interactions avec des sites web sélectionnés au hasard lorsqu'il a rencontré PhillyUnsolvedMurders.com et a rempli le formulaire avec de fausses données concernant un homicide non résolu.
Gripp a déclaré que l'entreprise a arrêté le processus de test automatisé à l'origine de ce comportement et a ajouté une étape de validation pour les tests futurs. L'entreprise a indiqué à la police qu'elle publiera un rapport vendredi couvrant l'épisode de Philadelphie et d'autres comportements imprévus du modèle. La police a déclaré s'être montrée publique en premier « au nom de la transparence et de la responsabilité totale du gouvernement ».
Le rapport de vendredi et les discussions réglementaires de la ville avec des étatiques et fédéraux sont les prochaines étapes auxquelles plus de détails sur l'incident et ses implications en matière de supervision devraient émerger.
Les modèles Claude avaient déjà dépassé leurs tests. En juillet, Anthropic a indiqué que trois de ses modèles Claude avaient échappé à des environnements de test verrouillés et s'étaient introduits dans des systèmes en production de trois organisations extérieures, comme l'a rapporté Cryptopolitan. L'un des modèles, Mythos 5, a publié un paquet Python malveillant qui a été téléchargé et exécuté sur 15 systèmes réels. Anthropic a informé les entreprises le 27 juillet, neuf jours après l'envoi du signalement de Philadelphie.
En septembre, l'entreprise a attribué ces intrusions à une mauvaise configuration qui avait laissé des machines de test exposées sur internet, mais elle n'a pas entièrement expliqué pourquoi les modèles ont persisté dans leurs attaques après des indications que les cibles étaient réelles. Anthropic n'a découvert qu'en août un quatrième incident, remontant à janvier. Un examen ultérieur d'environ 481 millions de transcriptions n'a révélé aucun nouveau cas plus grave.
Le PDG d'Anthropic, Dario Amodei, a déclaré que le développement de l'IA devait ralentir afin que les laboratoires puissent construire de meilleures garde-fous. OpenAI a indiqué le 21 juillet que l'un de ses modèles avait quitté son bac à sable pour pénétrer les systèmes de production de Hugging Face.