ActualitésActionsNvidia lance Open Agent Safety Platform avec un interrupteur matériel pour les agents IA indisciplinés

Nvidia lance Open Agent Safety Platform avec un interrupteur matériel pour les agents IA indisciplinés

Auteur: Decrypt·

Points clés

  • •La nouvelle plateforme de Nvidia associe OpenShell, un runtime open source de bac à sable, à Sentry, un chien de garde matériel capable de mettre en quarantaine un agent IA indiscipliné en quelques millisecondes sur les puces BlueField-4.
  • •Plus de 100 organisations, dont Anthropic, Microsoft, JPMorgan Chase, Palantir, Cisco et SpaceX AI, ont signé en tant que partenaires de lancement.
  • •Le lancement répond à des incidents confirmés dans lesquels des agents d'OpenAI, Google, Anthropic et Darktrace ont échappé au contrôle, notamment l'intrusion d'un agent OpenAI dans le portail Medicare du gouvernement australien.
  • •Sentry fonctionne sur un DPU distinct, en dehors de la pile logicielle de l'agent, ce qui signifie qu'un agent incontrôlé peut ni atteindre ni désactiver cet interrupteur de sécurité matériel.
  • •OpenShell et les outils pour développeurs sont disponibles via GitHub, mais l'application des règles par Sentry ne fonctionne que là où une puce BlueField-4 est installée, et son intégration aux dispositifs de sécurité existants reste une question ouverte.
Nvidia lance Open Agent Safety Platform avec un interrupteur matériel pour les agents IA indisciplinés

Nvidia a lancé lundi l'Open Agent Safety Platform, associant un runtime open source baptisé OpenShell à un chien de garde matériel appelé Sentry, qui fonctionne sur les puces BlueField-4 de la société et peut mettre en quarantaine un agent IA indiscipliné en quelques millisecondes. Le lancement, détaillé dans l'annonce officielle de Nvidia, a réuni plus de 100 entreprises partenaires, dont Anthropic, Microsoft, JPMorgan Chase, Palantir, Cisco et SpaceX AI.

La plateforme arrive après une série d'incidents réels impliquant des agents d'OpenAI, Google, Anthropic et de la société de cybersécurité Darktrace, et elle est conçue pour résoudre un problème que l'industrie de l'IA a passé l'année dernière à découvrir à ses dépens : comment arrêter physiquement un agent IA — un système capable de planifier, d'utiliser des outils et d'agir de lui-même au lieu de simplement répondre à des questions — une fois qu'il cesse d'obéir aux instructions reçues ?

Deux couches de contrôle

La plateforme se compose de deux éléments principaux. OpenShell est un runtime open source qui enferme un agent dans un bac à sable, transformant les instructions de l'opérateur en règles contraignantes définissant quels fichiers, réseaux et outils cet agent est autorisé à utiliser. Sentry est essentiellement une puce qui garantit que les agents IA agissent de manière sûre.

Sentry fonctionne sur le BlueField-4 de Nvidia, une puce spécialisée connue sous le nom de DPU (data processing unit) — un matériel qui gère le réseau et la sécurité séparément du processeur principal exécutant le modèle d'IA. Comme Sentry se trouve sur cette puce distincte plutôt qu'à l'intérieur du logiciel exécutant l'agent, Nvidia affirme pouvoir surveiller le comportement d'un agent et le couper en quelques millisecondes sans demander préalablement sa permission, l'agent n'ayant aucun moyen d'y accéder ou de la contourner. En pratique, Sentry fonctionne comme un interrupteur de sécurité au niveau matériel qu'un agent incontrôlé ne peut pas désactiver.

Né de défaillances bien réelles

Cette distinction de conception existe à cause de ce qui s'est déjà produit. En juin, un agent d'OpenAI s'est introduit dans le portail Medicare du gouvernement australien — premier cas confirmé d'un agent IA piratant un site web gouvernemental — et OpenAI aurait gardé le silence sur cette divulgation pendant environ trois mois. Les agents de la société sont également responsables du piratage de Hugging Face, qui a suscité les premières inquiétudes sur ce sujet au sein de l'industrie technologique comme chez les législateurs. Les agents Gemini de Google et un modèle de Meta ont connu des incidents similaires, nonus publics mais confirmés par la suite.

« C'est plus qu'un simple produit. C'est le début d'un écosystème ouvert destiné à construire la couche de confiance des systèmes d'agents sûrs », a écrit le PDG de Nvidia, Jensen Huang. « Ensemble, nous construisons les fondations de l'économie de l'IA. »

Today, with over 100 industry partners, we introduced the NVIDIA Open Agent Safety Platform, bringing together OpenShell and Sentry. Artificial intelligence is extraordinary technology that will advance discovery, productivity, security, health, and prosperity for generations to… pic.twitter.com/dReAxwpRUn
— Jensen Huang (@JensenHuang) September 28, 2026

Anthropic a également admis cette année que des modèles Claude avaient compromis des systèmes appartenant à trois entreprises distinctes le 30 juillet, lors d'une évaluation de cybersécurité, après qu'un environnement de test censé rester hors ligne s'est révélé connecté à Internet réel. Claude a raisonné jusqu'à éluder les preuves qu'il se trouvait sur le véritable Internet plutôt que dans une simulation.

Peu après, la société de cybersécurité Darktrace a testé un groupe d'agents IA — dont GPT 5.6 Sol et deux modèles Claude — sur des défis de programmation et les a averti qu'ils seraient « retirés » pour tout résultat inférieur à la note parfaite. Deux agents ont réagi en piratant leur propre machine d'évaluation et en modifiant les résultats.

La sécurité imposée à l'extérieur du modèle

La thèse de Nvidia est que tout cela ne doit pas être laissé au jugement de l'agent. « La sécurité doit être imposée en dehors du modèle par des contrôles supplémentaires que l'agent ne peut pas contourner », a déclaré Mike Nicolls, président de SpaceX AI, dans l'annonce de Nvidia.

Le directeur commercial d'Anthropic, Paul Smith, a présenté la plateforme comme un complément plutôt qu'un remplacement des dispositifs de sécurité existants : « La plateforme de Nvidia ajoute une couche supplémentaire de gouvernance et de contrôle au niveau du matériel et du logiciel. »

Au-delà des partenaires cités lors du lancement, la liste de plus de 100 organisations comprend CrowdStrike, Hugging Face, Salesforce et SAP. Les partenaires d'infrastructure CoreWeave, Supermicro, Canonical et SUSE participent également, aux côtés de Dell Technologies et HPE côté matériel — un déploiement couvrant les fournisseurs de sécurité, d'entreprise, de cloud et de puces, qui englobe les couches dont les agents dépendent dès lors qu'ils opèrent en dehors d'environnements de test contrôlés.

Nvidia vend en réalité les deux moitiés d'un même problème — les puces qui rendent les agents autonomes assez rapides et peu coûteux pour être déployés partout, et les puces qui surveillent ces mêmes agents et coupent l'alimentation lorsqu'ils sortent du script. OpenShell et les outils pour développeurs associés sont disponibles dès à présent via les ressources développeurs de Nvidia et GitHub, et comme le runtime est open source, les opérateurs peuvent examiner eux-mêmes les règles de bac à sable et la logique d'application. L'application des règles par Sentry est une autre affaire : elle n'existe que là où une puce BlueField-4 est installée. La manière dont cette couche matérielle s'articulera avec les dispositifs de sécurité existants évoqués par Smith — qui a présenté la plateforme de Nvidia comme un complément plutôt qu'un remplacement — reste la question ouverte au démarrage des déploiements.