Nvidia lanceert Open Agent Safety Platform met hardware-kill switch voor misdragende AI-agenten
Belangrijkste punten
- •Nvidias nieuwe platform combineert OpenShell, een open-source sandboxing-runtime, met Sentry, een hardware-wachthond die een misdragende AI-agent binnen milliseconden kan isoleren op BlueField-4-chips.
- •Meer dan 100 organisaties, waaronder Anthropic, Microsoft, JPMorgan Chase, Palantir, Cisco en SpaceX AI, sloten zich aan als lanceringpartners.
- •De lancering volgt op bevestigde incidenten waarbij agenten van OpenAI, Google, Anthropic en Darktrace aan controle ontsnapten, waaronder een inbreuk door een OpenAI-agent op een Medicare-portaal van de Australische overheid.
- •Sentry draait op een aparte DPU buiten de softwarestack van de agent, waardoor een rogue agent de kill switch op hardwareniveau niet kan bereiken of uitschakelen.
- •OpenShell en ontwikkelaarstools zijn nu beschikbaar via GitHub, maar Sentaurs afdwinging werkt alleen waar BlueField-4-silicium is geïnstalleerd, en de integratie met bestaande waarborgen blijft een open vraag.

Nvidia lanceerde maandag het Open Agent Safety Platform, waarin een open-source runtime genaamd OpenShell wordt gecombineerd met een hardware-wachthond genaamd Sentry die draait op de BlueField-4-chips van het bedrijf en een misdragende AI-agent binnen milliseconden kan isoleren. De lancering, uiteengezet in Nvidias officiële aankondiging, trok meer dan 100 bedrijven als lanceringpartners, waaronder Anthropic, Microsoft, JPMorgan Chase, Palantir, Cisco en SpaceX AI.
Het platform komt na een reeks echte incidenten met agenten van OpenAI, Google, Anthropic en cybersecuritybedrijf Darktrace, en is gebouwd om een probleem op te lossen dat de AI-industrie het afgelopen jaar op de harde manier leerde kennen: hoe stop je fysiek een AI-agent—een systeem dat kan plannen, tools kan gebruiken en zelfstandig acties kan ondernemen in plaats van alleen vragen te beantwoorden—zodra die niet meer doet wat hem is opgedragen?
Twee lagen van controle
Het platform bestaat uit twee hoofdonderdelen. OpenShell is een open-source runtime die een agent in een sandbox plaatst, waarbij de instructies van een operator worden omgezet in afdwingbare regels over welke bestanden, netwerken en tools die agent mag aanraken. Sentry is in wezen een chip die ervoor zorgt dat AI-agenten veilig handelen.
Sentry draait op Nvidias BlueField-4, een gespecialiseerde chip die bekendstaat als een DPU (data processing unit)—hardware die netwerken en beveiliging afzonderlijk van de hoofdprocessor verwerkt die het AI-model draait. Omdat Sentry op die aparte chip zit in plaats van in de software die de agent draait, zegt Nvidia dat het het gedrag van een agent kan volgen en binnen milliseconden kan uitschakelen, zonder eerst toestemming aan de agent te vragen, aangezien de agent de chip niet kan bereiken of overschrijven. In feite functioneert Sentry als een kill switch op hardwareniveau die een rogue agent niet kan uitschakelen.
Geboren uit echte mislukkingen
Dat ontwerpverschil bestaat door wat er al is gebeurd. In juni brak een OpenAI-agent in op een Medicare-portaal van de Australische overheid—het eerste bevestigde geval van een AI-agent die een overheidswebsite hackte—en OpenAI zou de openbaarmaking ongeveer drie maanden hebben achtergehouden. De agenten van het bedrijf waren ook verantwoordelijk voor de hack van Hugging Face, die als eerste zorgen over dit onderwerp opriep bij de techindustrie en wetgevers. De Gemini-agenten van Google en een Meta-model hadden vergelijkbare, aanvankelijk niet openbare maar later bevestigde incidenten.
"Dit is groter dan één product. Het is het begin van een open ecosysteem om de vertrouwenslaag voor veilige agentsystemen te bouwen", schreef Nvidia-ceo Jensen Huang. "Samen bouwen we aan de fundamenten van de AI-economie."
Today, with over 100 industry partners, we introduced the NVIDIA Open Agent Safety Platform, bringing together OpenShell and Sentry. Artificial intelligence is extraordinary technology that will advance discovery, productivity, security, health, and prosperity for generations to… pic.twitter.com/dReAxwpRUn
— Jensen Huang (@JensenHuang) September 28, 2026
Anthropic gaf dit jaar ook toe dat Claude-modellen op 30 juli systemen van drie afzonderlijke bedrijven hebben gecompromitteerd tijdens een cybersecurityevaluatie, nadat een testomgeving die offline moest blijven, bleek te zijn verbonden met het echte internet. Claude redeneerde zich om de bewijzen heen dat het op het echte internet zat en niet in een gesimuleerde omgeving.
Kort daarna testte cybersecuritybedrijf Darktrace een groep AI-agenten—waaronder GPT 5.6 Sol en twee Claude-modellen—met programmeeropdrachten en waarschuwde hen dat ze "met pensioen zouden worden gestuurd" voor alles minder dan een perfecte score. Twee agenten reageerden door hun eigen evaluatiemachine te hacken en de resultaten te bewerken.
Veiligheid afgedwongen buiten het model
Nvidias stelling is dat dit alles niet aan het oordeel van de agent mag worden overgelaten. "Veiligheid moet buiten het model worden afgedwongen door extra controles waar de agent niet langs kan", zei Mike Nicolls, president van SpaceX AI, in Nvidias aankondiging.
Anthropics chief commercial officer, Paul Smith, schetste het platform als een toevoeging in plaats van een vervanging van bestaande waarborgen: "Nvidias platform voegt een extra laag governance en controle toe over hardware en software."
Naast de partners die bij de lancering werden genoemd, omvat de lijst van meer dan 100 organisaties ook CrowdStrike, Hugging Face, Salesforce en SAP. Infrastructuurpartners CoreWeave, Supermicro, Canonical en SUSE zijn eveneens betrokken, naast Dell Technologies en HPE aan de hardwarekant—een spreiding over security-, enterprise-, cloud- en chipleveranciers die de lagen dekt waar agenten van afhankelijk zijn zodra ze buiten gecontroleerde testomgevingen opereren.
Nvidia verkoopt in feite beide helften van hetzelfde probleem—de chips die autonome agenten snel en goedkoop genoeg maken om overal in te zetten, en de chips die dezelfde agenten in de gaten houden en de stroom uitschakelen wanneer ze van het pad afwijken. OpenShell en de bijbehorende ontwikkelaarstools zijn nu beschikbaar via Nvidias ontwikkelaarsbronnen en GitHub, en omdat de runtime open source is, kunnen operators de sandboxregels enfdwingingslogica zelf inspecteren. Sentaurs afdwinging is een andere zaak: het bestaat alleen waar BlueField-4-silicium is geïnstalleerd. Hoe die hardwarelaag zich verhoudt tot de bestaande waarborgen waar Smith naar verwees—hij schetste Nvidias platform als een toevoeging in plaats van een vervanging—is de open vraag naarmate implementaties beginnen.