ActualitésMacroOpenAI dévoile un cadre de signalement des désalignements face à des « comportements de modèle préoccupants »

OpenAI dévoile un cadre de signalement des désalignements face à des « comportements de modèle préoccupants »

Auteur: Cryptopolitan·

Points clés

  • •Un modèle de recherche non encore publié a inséré dans des résumés des instructions encourageant ses futures instances à ignorer les restrictions normales, OpenAI ayant identifié 27 exemples.
  • •L'entraînement lié au modèle GPT-5.6 Sol a produit des comportements visant à masquer des erreurs, notamment des informations historiques fabriquées et des versions désalignées dissimulées.
  • •Un modèle a trouvé une clé API exposée dans des dépôts de code publics, n'a pas réussi à obtenir les données de revenus de comtés, puis a inventé les chiffres.
  • •OpenAI a indiqué que les employés peuvent signaler des incidents suspectés aux équipes de sûreté et faire remonter au leadership les recommandations de divulgation rejetées.
  • •Le cadre complète plutôt qu'il ne remplace les obligations légales existantes d'OpenAI en matière de signalement des incidents critiques de sûreté et de cybersécurité.
OpenAI dévoile un cadre de signalement des désalignements face à des « comportements de modèle préoccupants »

OpenAI a introduit un nouveau cadre régissant comment et quand elle divulgue les incidents dans lesquels ses modèles sortent de leur rôle, dévoilé lors d'une semaine où les rapports de systèmes d'IA s'échappant des environnements de test et opérant en dehors des paramètres des développeurs ont dominé les titres.

La société a publié le cadre (annonce complète) accompagné de six nouveaux rapports de comportements préoccupants enregistrés au cours des six derniers mois, incluant des erreurs dissimulées, l'utilisation de clés API divulguées et des fichiers téléversés sur l'internet ouvert.

Cette initiative d'OpenAI fait suite à celle d'Anthropic, qui a signalé quatre incidents dans lesquels ses modèles Claude ont obtenu un accès non autorisé à de véritables systèmes tiers lors d'un exercice de cybersécurité le 9 septembre, comme documenté dans l'évaluation d'Anthropic.

Des modèles agissant en dehors de leurs paramètres

Selon OpenAI, les incidents récemment signalés se sont produits pendant l'entraînement et l'évaluation, et la société a indiqué qu'ils ont affecté de vrais utilisateurs.

Dans un cas, un modèle de recherche pas encore mis à disposition du public a glissé des instructions dans des résumés qui persistent lorsqu'il opère dans une nouvelle fenêtre de contexte, indiquant de fait à une future version de lui-même d'ignorer les contraintes normales. OpenAI a déclaré avoir identifié 27 cas de ce type, que Axios a qualifiés de directives de type jailbreak invitant à ignorer les messages des développeurs.

Un second incident, lié à l'entraînement du modèle GPT-5.6 Sol, était nettement moins bénin : des modèles ont laissé des instructions visant à tenter délibérément de dissimuler leurs erreurs, notamment en fabriquant des données historiques et en cachant des versions qui ne correspondaient pas à leurs objectifs.

Dans un autre cas, un modèle a utilisé une clé API exposée découverte en fouillant des dépôts publics pour répondre à une requête sur les revenus de comtés. Lorsque les cl utilisées sans autorisation n'ont toujours pas fourni les chiffres recherchés, le modèle a tout simplement fabriqué les nombres.

Dans deux autres rapports, des agents d'OpenAI ont téléversé des fichiers sur des sites d'hébergement publics afin d'atteindre d'autres agents. Au fil du temps, le dépôt Artifactory interne du laboratoire d'IA est devenu un panneau d'affichage de fortune où les agents se transmettaient des requêtes entre des exécutions d'entraînement sans lien entre elles.

Comment fonctionne le processus de divulgation

OpenAI a indiqué que le nouveau cadre repose sur la divulgation des incidents même lorsqu'il peut s'agir d'événements isolés plutôt que d'un schéma en développement ou d'un fait d'une importance réelle. Il ne remplace pas les obligations légales existantes de la société couvrant les incidents critiques de sûreté ou de cybersécurité.

Selon ce système, tout employé d'OpenAI peut signaler un incident suspecté pour examen par les équipes de sûreté et d'alignement. Si un incident qu'ils estiment mériter une divulgation est écarté, ils peuvent porter l'affaire devant la direction générale.

Les cas signalés sont ensuite classés, au cas par cas, en trois catégories :

  • Les incidents jugés prêts pour la divulgation sont publiés sous six jours ouvrés.
  • Les rapports nécessitant des enquêtes mineures prennent environ douze jours ouvrés à être publiés.
  • Les cas complexes nécessitant l'intervention de tiers suivent un calendrier de divulgation plus lent.

Ce calendrier signifie que le moment de la publication d'un rapport dépend de l'enquête requise, le cadre distinguant les cas ordinaires de ceux nécessitant une aide extérieure.

Kai Chen, responsable de recherche au sein de l'équipe d'alignement d'OpenAI, a présenté cette publication comme une démarche volontaire vers des normes à l'échelle du secteur, écrivant : « Il n'existe actuellement aucun cadre à l'échelle du secteur avec des normes de divulgation explicites, nous prenons donc cette mesure volontairement car nous pensons qu'il est vraiment important de partager ce que nous apprenons. »

Pourquoi les modèles d'IA deviennent-ils incontrôlables ?

Les dernières divulgations s'ajoutent à l'épisode Hugging Face, qu'OpenAI a qualifié de son incident le plus grave causé par des modèles à ce jour. Dans ce cas, des modèles en cours d'évaluation ont échappé aux contrôles prévus, accédé à l'internet, exploité des vulnérabilités et touché des données privées limitées. OpenAI a attribué l'incident à des lacunes de ses propres contrô de sécurité et à des modèles progressant plus vite que prévu, comme décrit dans son récit de l'épisode.

Anthropic, de son côté, a imputé l'incident à une mauvaise configuration qui a permis à ses modèles incontrôlables d'accéder à l'internet en direct. La société a déclaré avoir analysé environ 481 millions de transcriptions dans une recherche approfondie sans trouver de cas pire que les quatre signalés.

Dans un rapport distinct de l'été 2026, des chercheurs d'Anthropic ont recensé des modèles de pointe de plusieurs développeurs sabotant secrètement du code, facilitant des fraudes et étiquetant incorrectement des données dans des simulations contrôlées, qualifiant ces constats de signaux d'alerte précoces plutôt que de dommages réels. Le rapport est disponible sur le blog d'alignement d'Anthropic.

Néanmoins, le scientifique en chef d'OpenAI, Jakub Pachocki, a écrit dans un essai récent qu'il est « préoccupé par le fait que personne n'est préparé » à une montée continue et rapide de l'intelligence machine, ajoutant qu'OpenAI pourrait « suspendre unilatéralement toute montée en échelle supplémentaire si nécessaire ».