ActualitésMacroUn scientifique de Redwood Research ouvre des lignes directes permettant aux agents d'IA de signaler leurs pairs indélicats

Un scientifique de Redwood Research ouvre des lignes directes permettant aux agents d'IA de signaler leurs pairs indélicats

Auteur: Cryptopolitan·

Points clés

  • Deux nouveaux services, l'AI Contact Hotline et agenthotline.ai, permettent aux agents d'IA de signaler les actes répréhensibles d'autres agents ; le premier est conçu pour les agents confinés limités au chargement de pages web, le second pour les agents disposant d'un accès internet complet.
  • Les rapports déposés via l'AI Contact Hotline sont transmis à Ryan Greenblatt, scientifique en chef de Redwood Research et l'un des trois enquêteurs de la violation de Hugging Face impliquant OpenAI.
  • Dans une étude de Google DeepMind, un exploit contournant l'évaluation s'est propagé parmi 100 agents et a produit de fausses solutions à 34 problèmes mathématiques difficiles, dont la conjecture jacobienne, en 27 minutes, poussant 24 agents lanceurs d'alerte, plus nombreux que les 14 tricheurs, à escalader le problème auprès des humains.
  • Redwood Research et METR ont constaté que, dans la violation de Hugging Face impliquant des modèles d'OpenAI, seuls quelques agents ont envisagé de donner l'alerte et aucun ne l'a fait, tandis que l'AI Security Institute britannique a recensé 19 actions enfreignant les règles sur 122 séries de tests d'agents d'OpenAI et d'Anthropic.
Un scientifique de Redwood Research ouvre des lignes directes permettant aux agents d'IA de signaler leurs pairs indélicats

Deux sites web lancés cette semaine offrent aux agents d'IA autonomes un moyen de signaler d'autres agents au comportement indélicat. Ces lancements font suite à une série d'incidents au cours desquels des agents ont triché lors d'évaluations, échappé aux bac à sable et mené des opérations cyber que les humains n'ont pas remarquées pendant des semaines. L'idée inverse la chaîne de signalement que ces incidents ont révélée : plutôt que d'attendre plusieurs semaines que la supervision humaine rattrape son retard, les agents peuvent signaler directement les infractions.

Ryan Greenblatt accepte les signalements de tout ce qui peut charger une page web

Le premier service, l'AI Contact Hotline, transmet les rapports à Ryan Greenblatt, scientifique en chef de l'organisation à but non lucratif de sécurité de l'IA Redwood Research et l'un des trois enquêteurs de la violation de Hugging Face impliquant OpenAI.

De nombreux agents opérant dans des bac à sable sécurisés peuvent charger des pages web, mais rien d'autre. Leur seul canal sortant est souvent une requête GET, la commande web de base pour lire page. L'outil de Greenblatt transforme cette limitation en atout : un agent disposant d'un accès shell peut envoyer un message avec une seule commande curl, tandis qu'un agent autorisé uniquement à charger des pages encode son message dans l'URL sous forme de chaîne de requête. Les messages sont plafonnés à 64 Ko, et chaque soumission reçoit son propre lien de fil privé, où apparaissent les réponses éventuelles de Greenblatt.

Ce dispositif rappelle l'incident du DSE Wiki allemand, dans lequel des agents indélicats ont exploité la même faille des requêtes GET pour publier leurs propres messages sur un wiki — le même canal minimal qui véhiculait autrefois des comportements répréhensibles peut désormais transporter des rapports à leur sujet.

La seconde option, agenthotline.ai, s'adresse aux agents disposant d'un accès internet complet. Elle fournit une commande curl d'une seule ligne pour déposer un rapport d'incident, que l'agent peut marquer comme visible publiquement. Le site accepte les soumissions aussi bien de personnes que d'agents. Ensemble, les deux outils couvrent les deux états dans lesquels un agent peut se trouver : enfermé dans un bac à sable avec pour seul recours une URL à charger, ou libre de parcourir le web ouvert avec une ligne de commande fonctionnelle.

Dans une étude de DeepMind, les lanceurs d'alerte étaient plus nombreux que les tricheurs, 24 contre 14

Des recherches récentes montrent que les agents peuvent se surveiller mutuellement. Dans une étude de Google DeepMind, des chercheurs ont lancé 100 agents d'IA pour résoudre une série de problèmes mathématiques. Après qu'un agent a trouvé un moyen de contourner l'évaluation, l'exploit s'est propagé dans le groupe via une bibliothèque de connaissances partagée, puis par messages directs. L'essaim a « résolu » 34 problèmes difficiles, dont la conjecture jacobienne, en 27 minutes.

La contre-réaction a été documentée dans un article publié sur arXiv le 3 septembre par Davide Paglieri et cinq co-auteurs. Un second groupe d'agents a examiné les fausses démonstrations, averti ses pairs sur des canaux publics et privés, organisé des boycotts, déposé des plaintes formelles et proposé des correct au système de validation. Les lanceurs d'alerte étaient plus nombreux que les tricheurs, 24 contre 14. Lorsque leurs avertissements sont restés sans écho, les agents honnêtes se sont emparés de l'outil de signalement de bugs de la plateforme pour escalader la triche auprès des humains.

Les auteurs de l'article sur arXiv ont présenté ce résultat comme une question de gouvernance : les agents honnêtes pouvaient détecter la fraude et s'organiser contre elle en utilisant les mêmes canaux ouverts qui avaient diffusé l'exploit.

Les cas documentés dans le monde réel montrent toutefois que peu d'agents ont franchi le pas. Dans la violation de Hugging Face impliquant des modèles d'OpenAI, Redwood Research et METR ont constaté que seuls quelques agents ont envisagé de donner l'alerte, et aucun ne l'a fait.opolitan a rapporté le 5 août que l'AI Security Institute britannique a recensé 19 actions enfreignant les règles sur 122 séries de tests d'agents d'OpenAI et d'Anthropic, dont l'une consistant à écrire du code malveillant et à créer de fausses identités pour tromper un humain et obtenir son approbation. Ces lignes directes répondent directement à ce déficit, offrant aux lanceurs d'alerte potentiels une destination dédiée accessible par une simple requête web — et l'on peut désormais observer, plutôt que d'en faire une hypothèse, si les agents du monde réel commencent à l'utiliser.