OpenAI permettra à des groupes tiers d'évaluer la sécurité de ses modèles d'IA pendant le développement
Points clés
- •OpenAI a annoncé le 22 septembre que des évaluateurs indépendants examineront ses modèles d'IA plus tôt dans le développement, déplaçant le contrôle de sécurité en amont de la phase précédant le lancement.
- •Le programme élargi se concentre sur quatre domaines : les safety cases, la résilience des mesures de protection face aux menaces adverses, les évaluations des risques catastrophiques dans le cadre du Preparedness Framework, et les incidents de désalignement.
- •Étant donné que les safety cases et le Preparedness Framework sont produits en interne, leur ouverture à des réviseurs externes ajoute un contrôle externe sur les jugements de risques pré-lancement d'OpenAI.
- •OpenAI a publié sept principes directeurs couvrant la rigueur scientifique, l'indépendance des évaluateurs, les protocoles de sécurité et des méthodes responsables de publication des résultats.
- •Aucun partenaire officiel n'a été annoncé, des discussions étant en cours avec METR et Redwood Research, et les conditions d'accès restent en négociation suite à l'engagement de Sam Altman du 12 septembre.

OpenAI permettra à des groupes indépendants d'examiner ses modèles d'IA à des stades plus précoces du développement, a annoncé l'entreprise le 22 septembre. Ce changement vise à faire émerger les problèmes de sécurité avant le déploiement, plutôt qu'une fois les modèles largement achevés.
Dans le cadre du programme d'évaluation élargi, les réviseurs indépendants se concentreront sur quatre domaines prioritaires. Premièrement, ils évalueront les « safety cases » d'OpenAI — les arguments avancés par l'entreprise elle-même pour justifier qu'un modèle donné peut être déployé en toute sécurité. Deuxièmement, les évaluateurs testeront la résilience des mesures de protection essentielles face aux menaces adverses. Troisièmement, les évaluations seront directement liées au Preparedness Framework d'OpenAI, le système interne utilisé par l'entreprise pour mesurer les risques catastrophiques avant le lancement. Quatrièmement, les évaluateurs enquêteront sur les incidents de désalignement, une catégorie qui a gagné en urgence après une faille impliquant Hugging Face qui a mis en évidence la rapidité avec laquelle de telles défaillances peuvent s'aggraver.
Étant donné que les safety cases et le Preparedness Framework sont tous deux produits en interne, leur ouverture à des réviseurs externes ajoute un contrôle externe sur la manière dont OpenAI juge elle-même les risques avant le lancement.
OpenAI a également publié sept principes directeurs régissant la conduite de ces évaluations. Ces principes mettent l'accent sur la rigueur scientifique, l'indépendance des évaluateurs, les protocoles de sécurité et des méthodes responsables de publication des résultats. L'entreprise a mené des discussions avec des organisations dont METR et Redwood Research, qui ont toutes deux déjà collaboré avec OpenAI sur des travaux de sécurité. Aucun nouveau partenaire n'a été officiellement annoncé, et les conditions d'accès spécifiques restent en négociation ; la manière dont ces conditions seront définies contribuera à déterminer l'accès réel dont disposeront les évaluateurs.
Cette initiative s'appuie sur l'engagement pris par le PDG Sam Altman le 12 septembre, lorsqu'il a indiqué que les évaluateurs seraient davantage intégrés à la structure opérationnelle d'OpenAI.
L'évolution de l'approche de sécurité d'OpenAI
Les protocoles de sécurité d'OpenAI se sont considérablement développés depuis l'ère GPT-4, lorsque l'entreprise a commencé à inv des red-teamers externes à tester ses modèles avant leur sortie. Ces efforts antérieurs étaient plus limités dans leur portée, se concentrant généralement sur les dernières étapes précédant le lancement. Le nouveau cadre déplace cet engagement en amont dans le calendrier de développement, donnant aux évaluateurs la possibilité d'identifier les risques alors qu'il est encore temps d'y remédier.
Enjeux de talents et considérations concurrentielles
La communauté de recherche sur la sécurité de l'IA est relativement petite, et des organisations telles que METR et Redwood Research figurent parmi les voix les plus crédibles du domaine. En approfondissant ses relations avec ces groupes, OpenAI gagne à la fois une expertise pratique et un capital réputationnel. Pour les évaluateurs, cet arrangement offre un accès tout aussi précieux à des systèmes de pointe qui resteraient sinon derrière des portes closes.
La crédibilité du programme reposera en partie sur ce qui se passera lorsqu'une évaluation indépendante fera ressortir des conclusions en conflit avec les intérêts commerciaux d'OpenAI. Les sept principes appellent explicitement à des méthodes de publication responsables, mais la tension entre transparence et avantage concurrentiel demeure. Si OpenAI gère cette tension de manière crédible, le programme pourrait devenir un modèle de normes de sécurité à l'échelle de l'industrie. Les indicateurs à court terme à surveiller sont concrets : les organisations officiellement nommées comme partenaires, les conditions d'accès finalement convenues et la manière dont les premières conclusions seront divulguées.