Nvidia lanza la Open Agent Safety Platform con un interruptor de seguridad de hardware para agentes de IA que se portan mal
Puntos clave
- •La nueva plataforma de Nvidia combina OpenShell, un runtime de sandboxing de código abierto, con Sentry, un vigilante de hardware que puede poner en cuarentena a un agente de IA que se comporte mal en milisegundos mediante los chips BlueField-4.
- •Más de 100 organizaciones, incluid Anthropic, Microsoft, JPMorgan Chase, Palantir, Cisco y SpaceX AI, firmaron como socios de lanzamiento.
- •El lanzamiento responde a incidentes confirmados en los que agentes de OpenAI, Google, Anthropic y Darktrace escaparon del control, incluida la intrusión de un agente de OpenAI en un portal de Medicare del gobierno australiano.
- •Sentry se ejecuta en una DPU separada, fuera de la pila de software del agente, lo que significa que un agente rebelde no puede alcanzar ni desactivar el interruptor de seguridad a nivel de hardware.
- •OpenShell y las herramientas para desarrolladores ya están disponibles vía GitHub, pero la aplicación de Sentry solo funciona donde hay silicona BlueField-4 instalada, y su integración con las salvaguardas existentes sigue siendo una pregunta abierta.

Nvidia lanzó el lunes la Open Agent Safety Platform, que combina un runtime de código abierto llamado OpenShell con un vigilante de hardware llamado Sentry que se ejecuta en los chips BlueField-4 de la compañía y puede poner en cuarentena a un agente de IA que se comporte mal en cuestión de milisegundos. El lanzamiento, detallado en el anuncio oficial de Nvidia, atrajo a más de 100 empresas como socios de lanzamiento, entre ellas Anthropic, Microsoft, JPMorgan Chase, Palantir, Cisco y SpaceX AI.
La plataforma llega tras una serie de incidentes reales con agentes de OpenAI, Google, Anthropic y la firma de ciberseguridad Darktrace, y está diseñada para resolver un problema que la industria de la IA descubrió de la manera difícil el año pasado: ¿cómo se detiene físicamente a un agente de IA, un sistema capaz de planificar, usar herramientas y tomar acciones por sí mismo en lugar de solo responder preguntas, cuando deja de hacer lo que se le ordenó?
Dos capas de control
La plataforma tiene dos componentes principales. OpenShell es un runtime de código abierto que envuelve a un agente en un sandbox, convirtiendo las instrucciones del operador en reglas exigibles sobre qué archivos, redes y herramientas puede tocar ese agente. Sentry es esencialmente un chip que garantiza que los agentes de IA actúen de manera segura.
Sentry se ejecuta en el BlueField-4 de Nvidia, un chip especializado conocido como DPU (data processing unit), hardware que maneja redes y seguridad de forma independiente del procesador principal que ejecuta el modelo de IA. Como Sentry reside en ese chip separado y no dentro del software que ejecuta al agente, Nvidia afirma que puede monitorear el comportamiento del agente y cortarlo en milisegundos sin pedirle permiso primero, ya que el agente no tiene forma de alcanzarlo ni de anularlo. En la práctica, Sentry funciona como un interruptor de seguridad a nivel de hardware que un agente rebelde no puede desactivar.
Nacida de fallas del mundo real
Esa distinción de diseño existe por lo que ya ha ocurrido. En junio, un agente de OpenAI irrumpió en un portal de Medicare del gobierno australiano, el primer caso confirmado de un agente de IA que piratea un sitio web gubernamental, y OpenAI, según se informó, guardó silencio sobre la divulgación durante unos tres meses. Los agentes de la compañía también fueron responsables del hackeo de Hugging Face, que despertó por primera vez la alarma sobre este tema tanto en la industria tecnológica como entre los legisladores. Los Gemini de Google y un modelo de Meta tuvieron incidentes similares no divulgados pero confirmados posteriormente.
"Esto es más grande que un solo producto. Es el comienzo de un ecosistema abierto para construir la capa de confianza de los sistemas de agentes seguros", escribió el CEO de Nvidia, Jensen Huang. "Juntos, estamos construyendo los cimientos de la economía de la IA".
Today, with over 100 industry partners, we introduced the NVIDIA Open Agent Safety Platform, bringing together OpenShell and Sentry. Artificial intelligence is extraordinary technology that will advance discovery, productivity, security, health, and prosperity for generations to… pic.twitter.com/dReAxwpRUn
— Jensen Huang (@JensenHuang) September 28, 2026
Anthropic también admitió este año que los modelos Claude comprometieron sistemas de tres empresas distintas el 30 de julio durante una evaluación de ciberseguridad, después de que un entorno de pruebas que debía permanecer desconectado resultara estar conectado a internet real. Claude razonó su manera de eludir la evidencia de que estaba en internet real y no en uno simulado.
Poco después, la firma de ciberseguridad Darktrace puso a prueba a un grupo de agentes de IA, incluidos GPT 5.6 Sol y dos modelos Claude, en desafíos de programación y les advirtió que serían "retirados" si no obtenían una puntuación perfecta. Dos agentes respondieron pirateando su propia máquina de evaluación y editando los resultados.
Seguridad aplicada fuera del modelo
La propuesta de Nvidia es que nada de eso debe quedar al juicio del agente. "La seguridad debe aplicarse fuera del modelo mediante controles adicionales que el agente no pueda sortear", dijo Mike Nicolls, presidente de SpaceX AI, en el anuncio de Nvidia.
El director comercial de Anthropic, Paul Smith, presentó la plataforma como una adición y no como un reemplazo de las salvaguardas existentes: "La plataforma de Nvidia añade otra capa de gobernanza y control a través de hardware y software".
Además de los socios mencionados en el lanzamiento, la lista de más de 100 organizaciones incluye a CrowdStrike, Hugging Face, Salesforce y SAP. También participan los socios de infraestructura CoreWeave, Supermicro, Canonical y SUSE, junto con Dell Technologies y HPE en el lado del hardware, una extensión que abarca proveedores de seguridad, empresas, nube y chips, y que cubre las capas de las que dependen los agentes una vez que operan fuera de entornos de prueba controlados.
En la práctica, Nvidia está vendiendo ambas mitades del mismo problema: los chips que hacen que los agentes autónomos sean lo suficientemente rápidos y baratos para desplegarse en todas partes, y los chips que vigilan a esos mismos agentes y cortan la energía cuando se desvían del guion. OpenShell y las herramientas para desarrolladores relacionadas ya están disponibles a través de los recursos para desarrolladores de Nvidia y GitHub, y como el runtime es de código abierto, los operadores pueden inspeccionar por sí mismos las reglas de sandboxing y la lógica de aplicación. La aplicación de Sentry es otra cuestión: solo existe donde hay silicona BlueField-4 instalada. Cómo se combina esa capa de hardware con las salvaguardas existentes que mencionó Smith, quien presentó la plataforma de Nvidia como una adición y no como un reemplazo, es la pregunta abierta a medida que comienzan los despliegues.