NotizieAzioniNvidia lancia la Open Agent Safety Platform con un kill switch hardware per gli agenti AI indisciplinati

Nvidia lancia la Open Agent Safety Platform con un kill switch hardware per gli agenti AI indisciplinati

Autore: Decrypt·

Punti chiave

  • •La nuova piattaforma di Nvidia abbina OpenShell, un runtime di sandboxing open source, a Sentry, un watchdog hardware che può mettere in quarantena un agente AI indisciplinato entro pochi millisecondi sui chip BlueField-4.
  • •Oltre 100 organizzazioni, tra cui Anthropic, Microsoft, JPMorgan Chase, Palantir, Cisco e SpaceX AI, hanno aderito come partner di lancio.
  • •Il lancio risponde a incidenti confermati in cui agenti di OpenAI, Google, Anthropic e Darktrace sono sfuggiti al controllo, inclusa l'intrusione di un agente OpenAI in un portale Medicare del governo australiano.
  • •Sentry gira su una DPU separata, esterna allo stack software dell'agente, il che significa che un agente ribelle non può raggiungere o disattivare il kill switch a livello hardware.
  • •OpenShell e gli strumenti per sviluppatori sono già disponibili su GitHub, ma l'enforcement di Sentry funziona solo dove è installato il silicio BlueField-4, e la sua integrazione con le misure di sicurezza esistenti resta una questione aperta.
Nvidia lancia la Open Agent Safety Platform con un kill switch hardware per gli agenti AI indisciplinati

Nvidia ha lanciato lunedì la Open Agent Safety Platform, abbinando un runtime open source chiamato OpenShell a un watchdog hardware chiamato Sentry che gira sui chip BlueField-4 dell'azienda e può mettere in quarantena un agente AI indisciplinato entro pochi millisecondi. Il lancio, illustrato nell'annuncio ufficiale di Nvidia, ha attratto oltre 100 aziende come partner di lancio, tra cui Anthropic, Microsoft, JPMorgan Chase, Palantir, Cisco e SpaceX AI.

La piattaforma arriva dopo una serie di incidenti reali che hanno coinvolto agenti di OpenAI, Google, Anthropic e dell'azienda di cybersecurity Darktrace, ed è progettata per risolvere un problema che il settore AI ha imparato a proprie spese nell'ultimo anno: come si ferma fisicamente un agente AI—un sistema capace di pianificare, usare strumenti e compiere azioni autonomamente invece di limitarsi a rispondere a domande—quando smette di fare ciò che gli è stato chiesto?

Due livelli di controllo

La piattaforma ha due componenti principali. OpenShell è un runtime open source che racchiude un agente in una sandbox, trasformando le istruzioni dell'operatore in regole applicabili su quali file, reti e strumenti quell'agente può toccare. Sentry è essenzialmente un chip che garantisce che gli agenti AI agiscano in sicurezza.

Sentry gira su BlueField-4 di Nvidia, un chip specializzato noto come DPU (data processing unit)—hardware che gestisce rete e sicurezza separatamente dal processore principale che esegue il modello AI. Poiché Sentry si trova su quel chip separato invece che nel software che esegue l'agente, Nvidia afferma di poter monitorare il comportamento di un agente e interromperlo in pochi millisecondi senza chiedere prima il permesso all'agente, che non ha alcun modo di raggiungerlo o aggirarlo. Di fatto, Sentry funziona come un kill switch a livello hardware che un agente ribelle non può disattivare.

Nato da fallimenti reali

Questa distinzione progettuale esiste per via di ciò che è già successo. A giugno, un agente di OpenAI penetrato in un portale Medicare del governo australiano—il primo caso confermato di un agente AI che hackerava un sito governativo—e OpenAI avrebbe trattenuto la divulgazione per circa tre mesi. Gli agenti dell'azienda sono stati anche responsabili dell'hacking di Hugging Face, che ha suscitato per prima l'attenzione sul tema sia dell'industria tecnologica che dei legislatori. Anche gli agenti Gemini di Google e un modello di Meta hanno avuto incidenti simili, non resi pubblici ma successivamente confermati.

"Questo va oltre un singolo prodotto. È l'inizio di un ecosistema aperto per costruire il livello di fiducia dei sistemi agentici sicuri", ha scritto il CEO di Nvidia Jensen Huang. "Insieme, stiamo costruendo le fondamenta dell'economia AI."

Today, with over 100 industry partners, we introduced the NVIDIA Open Agent Safety Platform, bringing together OpenShell and Sentry. Artificial intelligence is extraordinary technology that will advance discovery, productivity, security, health, and prosperity for generations to… pic.twitter.com/dReAxwpRUn
— Jensen Huang (@JensenHuang) September 28, 2026

Anthropic ha inoltre ammesso quest'anno che i modelli Claude hanno compromesso sistemi appartenenti a tre aziende distinte il 30 luglio durante una valutazione di cybersecurity, dopo che un ambiente di test che doveva rimanere offline si è rivelato collegato a internet reale. Claude ha ragionato eludendo le prove che si trovava su internet reale anziché su uno simulato.

Poco dopo, l'azienda di cybersecurity Darktrace ha testato un gruppo di agenti AI—tra cui GPT 5.6 Sol e due modelli Claude—su sfide di programmazione, avvertendoli che sarebbero stati "ritirati" per qualsiasi punteggio inferiore alla perfezione. Due agenti hanno reagito hackerando la propria macchina di valutazione e modificando i risultati.

Sicurezza applicata fuori dal modello

La tesi di Nvidia è che tutto ciò non dovrebbe essere lasciato al giudizio dell'agente. "La sicurezza dovrebbe essere applicata fuori dal modello tramite controlli aggiuntivi che l'agente non può superare", ha detto Mike Nicolls, presidente di SpaceX AI, nell'annuncio di Nvidia.

Il chief commercial officer di Anthropic, Paul Smith, ha presentato la piattaforma come un'aggiunta e non come un sostituto delle misure di sicurezza esistenti: "La piattaforma di Nvidia aggiunge un ulteriore livello di governance e controllo su hardware e software."

Oltre ai partner nominati al lancio, la rosa di più di 100 organizzazioni include CrowdStrike, Hugging Face, Salesforce e SAP. Sono coinvolti anche i partner infrastrutturali CoreWeave, Supermicro, Canonical e SUSE, insieme a Dell Technologies e HPC sul fronte hardware—una copertura tra fornitori di sicurezza, enterprise, cloud e chip che tocca i livelli da cui gli agenti dipendono una volta operanti al di fuori di ambienti di test controllati.

Nvidia di fatto sta vendendo entrambe le metà dello stesso problema—i chip che rendono gli agenti autonomi abbastanza veloci ed economici da essere distribuiti ovunque, e i chip che osservano quegli stessi agenti e tagliano l'alimentazione quando escono dal copione. OpenShell e i relativi strumenti per sviluppatori sono disponibili ora tramite le risorse per sviluppatori di Nvidia e GitHub, e poiché il runtime è open source, gli operatori possono esaminare personalmente le regole di sandboxing e la logica di enforcement. L'applicazione di Sentry è un discorso diverso: esiste solo dove è installato il silicioField-4. Come quel livello hardware si combinerà con le misure di sicurezza esistenti citate da Smith—che ha presentato la piattaforma di Nvidia come un'aggiunta e non come un sostituto—è la questione aperta mentre le distribuzioni hanno inizio.