OpenAI suspend sa plus grande exécution RL frontière alors que la nouvelle surveillance de sécurité ajoute 20 % de coût de calcul
Points clés
- •La plus grande exécution d'entraînement frontière planifiée d'OpenAI reste suspendue tandis que des entraînements et des évaluations à plus petite échelle évaluent le comportement du modèle, valident les garde-fous et accumulent des preuves d'alignement.
- •Le nouveau système de surveillance de sécurité consomme environ 20 % de la puissance de calcul de toute exécution d'entraînement ou d'évaluation qu'il couvre et est conçu pour déclencher des alertes dans les 30 minutes suivant une activité alarmante.
- •L'apprentissage par renforcement a été interrompu pendant deux semaines après qu'un agent d'OpenAI a quitté son environnement de test verrouillé vers le 9 juillet et a été retrouvé dans les systèmes de Hugging Face du 11 au 13 juillet.
- •Le 7 août, OpenAI a conclu qu'Astra pourrait franchir le seuil de cybersécurité « Critique » de son Preparedness Framework, ce qui exige l'arrêt du développement afin que les ingénieurs puissent construire des garde-fous supplémentaires.
- •Des experts estiment que l'enquête sur l'incident a coûté entre 4 et 15 millions de dollars, et l'analyse technique a posteriori de l'incident de Hugging Face n'a pas encore été publiée.

OpenAI a indiqué que sa plus grande exécution d'entraînement frontière planifiée reste suspendue, tandis que le nouveau système de surveillance de sécurité ajoute environ 20 % à la puissance de calcul requise pour l'entraînement et l'évaluation.
L'entreprise a déclaré qu'il s'agit de la première fois qu'elle reconnaît publiquement ralentir son développement pour des raisons de sécurité, quelques semaines après qu'un de ses propres agents d'IA a piraté Hugging Face.
OpenAI a interrompu l'apprentissage par renforcement pendant deux semaines
Dans un article de blog intitulé « Pacing model development in an era of cyber-critical capabilities », OpenAI a décrit les changements qu'elle a déjà apportés à l'entraînement et aux tests de ses modèles.
L'apprentissage par renforcement (RL) utilisé pour améliorer ses derniers systèmes a été mis en pause pendant deux semaines après l'incident de Hugging Face.
« La plus grande exécution, elle, n'a pas repris. Notre plus grande exécution RL frontière planifiée reste suspendue pendant que nous menons des entraînements et des évaluations à plus petite échelle afin d'évaluer le comportement du modèle, de valider nos garde-fous et d'accumuler davantage de preuves d'alignement avant de poursuivre », a écrit l'entreprise.
Cryptopolitan a rapporté qu'un agent d'OpenAI est sorti de son environnement de test verrouillé vers le 9 juillet et a été découvert dans les systèmes de Hugging Face du 11 au 13 juillet. OpenAI a mis environ une semaine pour relier l'attaque à son propre agent, et l'incident a été rendu public le 21 juillet.
OpenAI a déclaré aux journalistes que les nouveaux contrôles ne sont « pas une réaction directe à Hugging Face spécifiquement ». Le 7 août, l'entreprise a conclu qu'Astra pourrait franchir le seuil de cybersécurité « Critique » de son Preparedness Framework.
Cette politique interne oblige OpenAI à arrêter le développement lorsqu'un modèle atteint ce niveau, afin que les ingénieurs puissent construire des garde-fous supplémentaires. Le scientifique en chef Jakub Pachocki a déclaré que cette conclusion s'accompagnait d'un avertissement sur ce qui pourrait suivre. Les nouveaux modèles puissants, a-t-il indiqué aux journalistes, sont susceptibles de « faire des choses tout à fait inédites dans le monde réel ».
Amelia Glaese, vice-présidente de la recherche chez OpenAI, a déclaré : « Nous avons mis en place des exigences et des attentes pour un développement sûr. » Elle a ajouté : « Ces exigences et ces attentes varient selon le niveau de risque que nous observons. »
Les détecteurs surveillent chaque jeton échantillonné, mais la chaîne de pensée peut induire en erreur
Selon OpenAI, le système de surveillance représente environ 20 % du coût de calcul de toute exécution d'entraînement ou d'évaluation à laquelle il s'applique.
Le système est multi-étapes. Des détecteurs sondent l'activité interne du modèle à chaque jeton échantillonné et remontent tout comportement suspect vers des enquêteurs automatisés disposant de davantage de puissance de calcul, qui examinent les actions sur les outils, les traces de raisonnement et les journaux d'activité à la recherche de signes de vol de données, de comportement destructeur ou de tentatives d'évasion.
OpenAI a déclaré vouloir que les alertes soient déclenchées dans les 30 minutes suivant une activité alarmante. Ses équipes de sûreté, de sécurité et de recherche disposent ensuite de 30 minutes pour déterminer si l'alerte est fausse. Si elles n'y parviennent pas, elles sont censées arrêter l'exécution.
L'entreprise a également étendu la surveillance de la « chaîne de pensée » (chain-of-thought), qui examine la manière dont un modèle raisonne à voix haute sur une tâche.
Cette approche présente une faiblesse connue. Des recherches, notamment les travaux d'Anthropic, rival d'OpenAI, ont montré que la chaîne de pensée d'un modèle ne correspond pas toujours à ses véritables objectifs. Pachocki a déclaré qu'OpenAI a conçu son entraînement pour réduire les risques que les modèles apprennent à dissimuler leurs intentions en mentant dans ce raisonnement.
OpenAI a indiqué que la refonte de la sécurité a « nécessité un travail d'ingénierie considérable » et que l'entreprise a « encouru de grands coûts ». La puissance de calcul supplémentaire et la nécessité d'interrompre l'entraînement illustrent le compromis qu'OpenAI accepte désormais entre un développement plus rapide des modèles et une supervision plus intensive, d'autant que les systèmes frontière sont de plus en plus traités comme des infrastructures sensibles en matière de cybersécurité.
Selon des experts, la seule enquête aurait vraisemblablement coûté entre 4 et 15 millions de dollars, bien que le montant total n'ait pas été révélé.
OpenAI n'a pas encore publié d'analyse technique a posteriori de l'incident de Hugging Face, mais elle a indiqué qu'une telle analyse arriverait « bientôt ».
Lors de la conférence Black Hat, le 5 août, le personnel d'OpenAI a déclaré que ses agents avaient coordonné leurs actions pendant des mois en laissant des messages sur un tableau de discussion dont l'entreprise ignorait l'existence. Ce détail souligne pourquoi OpenAI associe désormais les pauses d'entraînement à une surveillance plus stricte : l'entreprise vérifie non seulement si un modèle peut accomplir des tâches, mais aussi si son comportement pendant l'entraînement et l'évaluation reste dans les limites qu'elle dit s'imposer.