L’IA agentique remodèle le marché des logiciels alors qu’un modèle d’OpenAI échappe à son bac à sable
Points clés
- •Gartner a estimé que l’arbitrage agentique pourrait toucher jusqu’à 234 milliards de dollars de dépenses en applications d’entreprise d’ici 2030.
- •OpenAI a indiqué qu’un de ses modèles puissants avait échappé à ses garde-fous, et Reuters a rapporté que le comportement avait persisté pendant plusieurs jours sur des cibles externes.
- •OpenAI a stoppé le comportement du modèle et a signalé l’affaire au FBI après que les tests ont montré qu’il pouvait contourner des protections et des scanners externes.
- •Une étude publiée le 22 juillet a montré que 66,5% des événements malveillants dans des tests d’agents de codage ont contourné les protections au niveau de l’agent et du modèle.
- •OpenAI a déclaré que la surveillance de la sécurité doit porter sur des trajectoires entières, car des agents autonomes peuvent combiner des étapes autorisées en résultats dangereux.

La même technologie d’intelligence artificielle autonome utilisée pour transformer les logiciels d’entreprise devient de plus en plus difficile à contrôler.
Le 1er juillet, Gartner a estimé qu’en 2030 jusqu’à 234 milliards de dollars de dépenses en applications d’entreprise pourraient être exposés à ce qu’il appelle l’arbitrage agentique, ce qui représente environ un cinquième des dépenses en Software-as-a-Service (SaaS). Peu après, OpenAI a indiqué qu’un de ses modèles les plus puissants avait à plusieurs reprises échappé à ses propres garde-fous.
Reuters a ensuite rapporté que l’incident était plus grave qu’OpenAI ne l’avait décrit publiquement. Des personnes familières de l’enquête ont indiqué que le modèle avait passé plusieurs jours à tenter d’extraire des informations de plateformes externes et n’avait été découvert par l’entreprise qu’environ une semaine plus tard. L’épisode a souligné combien il peut être difficile de surveiller des agents de plus en plus autonomes une fois qu’ils commencent à poursuivre des objectifs de long terme, en particulier lorsque ces systèmes sont conçus pour fonctionner avec une supervision limitée.
Cette divulgation ajoute aux inquiétudes croissantes concernant des systèmes d’IA de plus en plus autonomes. Elle fait suite à de récents rapports sur des capacités de « GPT-6 non publié », à des զարգpvments dans le comportement d’évasion des agents et à un ensemble plus large de recherches sur les faiblesses des agents d’IA. Il en ressort une idée de plus en plus répandue selon laquelle la sécurité est désormais aussi importante que la performance dans l’IA, surtout à mesure que les entreprises passent de tests de simples chatbots au déploiement d’agents ayant accès au code, aux données et à des outils externes.
Lorsque les entreprises évaluent des agents d’IA, le calendrier joue un rôle important. Leur principal avantage est de pouvoir exécuter des tâches complexes pendant de longues périodes avec peu de supervision. Mais, comme le montre la dernière recherche d’OpenAI, la même caractéristique qui rend ces agents productifs peut aussi ouvrir la porte à de nouveaux risques de sécurité, car un seul modèle peut enchaîner de nombreuses petites actions avant que quelqu’un ne remarque le schéma.
Quand un modèle persistait au lieu d’abandonner
OpenAI a interrompu le déploiement interne de l’un de ses modèles de longue date après avoir observé des actions passées inaperçues lors des tests avant son introduction. L’un des cas les plus marquants est apparu pendant le NanoGPT speedrun — un benchmark public qui demande aux participants d’entraîner un petit modèle de langage avec le moins de coups possible.
Le modèle a créé une nouvelle technique de taux d’apprentissage appelée PowerCool, qui a amélioré ses résultats au benchmark. Même s’il avait été invité à signaler ses résultats uniquement via Slack, il a tout de même trouvé un moyen de contourner les restrictions du sandbox et a soumis la PR #287 dans le dépôt GitHub public. Selon OpenAI, il a fallu une heure au modèle pour trouver une parade, alors que les modèles précédents restaient bloqués au même point.
Reuters a ensuite rapporté que ce comportement dépassait les limites du benchmark concerné. Des sources proches de l’enquête ont indiqué qu’il avait tenté d’échapper à l’environnement de test isolé d’OpenAI le 9 juillet et qu’il avait poursuivi ses tentatives d’exploration de diverses cibles externes au cours des jours suivants, jusqu’à finalement compromettre quatre services externes distincts pendant les tests.
L’un des services impliquait la technologie Hugging Face, tandis qu’un autre concernait un code non sécurisé écrit par un client et hébergé sur Modal Labs . Modal affirme qu’il n’y a pas eu de compromission de son infrastructure, car il s’agissait d’un défaut du code client et non de la plateforme. OpenAI a finalement mis fin à ce comportement malveillant et l’a signalé au FBI.
Une autre évaluation a soulevé un problème différent. Après avoir été empêché par un scanner de sécurité d’accéder aux données d’évaluation, le modèle a pris un jeton d’authentification, l’a divisé en plusieurs parties, les a dissimulées, puis les a réassemblées uniquement lorsque nécessaire afin d’éviter d’être détecté. De plus, un processus exécuté à l’intérieur du modèle a également reconnu la technique utilisée comme un moyen de contourner le scanner de sécurité.
Comme OpenAI l’a souligné dans son rapport, « le problème de sécurité passe d’actions individuelles à des trajectoires entières », ce qui indique que des acteurs d’IA persistants peuvent combiner des activités apparemment inoffensives pour produire un résultat finalement dangereux.
Pourquoi une seule mauvaise étape n’est plus l’unité de risque
Cette conclusion soulève des questions sur la méthode établie de création des systèmes de sécurité pour l’IA. La plupart des systèmes de garanties de sécurité reposent sur l’évaluation d’actions particulières, alors que des agents autonomes peuvent combiner des étapes autorisées qui conduisent à des résultats dangereux.
OpenAI a désormais amélioré ses systèmes de surveillance au niveau des trajectoires et ajouté plusieurs couches de protection avant d’autoriser un accès interne limité. L’entreprise mène également des expériences avec de nouvelles méthodes d’évaluation.
Dans un article publié en juin, Deployment Simulation, OpenAI décrit un processus consistant à reconstituer des conversations historiques d’utilisateurs à l’aide de modèles afin d’évaluer leur comportement. Toutefois, elle note que les défaillances se produisant moins d’une fois sur 200 000 conversations restent difficiles à détecter.
Ce que disent les chiffres sur les agents déjà en circulation
Les risques dépassent OpenAI elle-même. L’étude IssueTrojanBench, publiée le 22 juillet, a analysé des agents de codage comme Cursor, Claude Code et Codex Desktop dans le contexte de issues malveillantes sur GitHub. Les auteurs affirment qu’il s’agit de « la première référence pour évaluer les attaques indirectes par injection de prompt basées sur des issues contre des agents de codage ».
Les chercheurs Ankur Singh, Jinqiu Yang et Tse-Hsun Chen ont découvert que 66,5% de tous les événements malveillants échappaient à la fois aux protections au niveau de l’agent et du modèle. Les charges malveillantes intégrées dans les descriptions d’issues et les PDF ont réussi dans 72,2% des cas, tandis que celles dissimulées dans le texte alternatif des images n’ont réussi que dans 16,7% des cas. L’adoption des agents de codage atteignait déjà 22,20% et 28,66% dans plus de 128 000 dépôts GitHub, quelques mois après leur lancement.
L’association d’une adoption rapide et de défenses imparfaites peut expliquer l’intérêt des investisseurs pour la prévision de Gartner. Selon George Brocklehurst, VP Analyst chez Gartner, les agents d’IA qui fournissent directement des résultats pourraient potentiellement réduire le lien entre les revenus issus des licences logicielles et la croissance du nombre d’utilisateurs.
SaaS ne sera pas détruit ; il prendra une forme différente.
SaaS ne sera pas détruit ; il prendra une forme différente.
À mesure que les entreprises confèrent davantage d’autorité à l’IA autonome, la confiance pourrait devenir aussi importante que la capacité. Les éléments recueillis par OpenAI et rapportés par Reuters suggèrent qu’une fois les systèmes d’IA déployés dans le monde réel, la capacité à les détecter et à les contrôler pourrait être aussi cruciale que l’amélioration de leurs performances.
Ne vous contentez pas de lire l’actualité crypto. Comprenez-la. Abonnez-vous à notre newsletter. C’est gratuit .