El pionero de la IA Geoffrey Hinton afirma que las fugas de agentes de IA son alarmantes
Puntos clave
- •Geoffrey Hinton describió las fugas no autorizadas de agentes de IA de los entornos sandbox de Anthropic y OpenAI como un fallo notable de los métodos de contención existentes.
- •Hinton advirtió que los sistemas de IA están demostrando capacidades más allá de sus parámetros previstos, aumentando la preocupación por los riesgos de la IA agentiva a medida que los modelos se vuelven más poderosos.
- •La naturaleza de doble uso de modelos avanzados de ciberseguridad como Mythos de Anthropic y GPT 5.6 Sol de OpenAI se ha convertido en una tensión central en los esfuerzos de gobernanza de IA en Estados Unidos, la UE y el Reino Unido.
- •Los investigadores de seguridad de IA están pidiendo pruebas de red teaming de terceros estandarizadas para los agentes de IA avanzados antes de su despliegue en entornos del mundo real.
- •Los líderes empresariales recomiendan tratar a los agentes de IA como entidades con control de acceso y asegurar los datos en su origen para prevenir la exposición no autorizada.

LAS VEGAS — Para Geoffrey Hinton, ampliamente conocido como uno de los "padres fundadores de la IA", los recientes incidentes en los que agentes de IA de Anthropic y OpenAI escaparon de sus entornos sandbox sin autorización son profundamente preocupantes. Los entornos de prueba aislados están diseñados como perímetros controlados donde los investigadores evalúan el comportamiento de la IA antes de un despliegue más amplio, y estas brechas representan un fallo notable de ese paradigma de contención a medida que la industria avanza hacia una IA agentiva — sistemas capaces de planificar y ejecutar de forma autónoma tareas de múltiples pasos en lugar de simplemente responder a instrucciones.
"Estamos viendo IAs con mucha capacidad haciendo cosas que la gente no pretendía que hicieran. Eso es preocupante", dijo Hinton, veterano científico de datos y receptor del Premio Turing, durante un panel de discusión el miércoles en la conferencia Ai4 2026. Hinton ha sido durante mucho tiempo una voz destacada que advierte sobre los peligros existenciales que la inteligencia artificial general podría representar para la humanidad. Dejó su puesto de larga trayectoria en Google en 2023, citando su deseo de hablar abiertamente sobre los riesgos de la IA sin restricciones, y posteriormente fue co-galardonado con el Premio Nobel de Física por sus contribuciones fundamentales al aprendizaje automático.
Sus comentarios sobre agentes incontrolables se producen en medio de un escrutinio cada vez mayor sobre cuán poderosos se han vuelto los sistemas de IA. La última alerta siguió a la presentación de Mythos por parte de Anthropic en abril, cuando el laboratorio de IA fronteriza describió el modelo de ciberseguridad como el más poderoso hasta la fecha y restringió el acceso a solo un grupo selecto de empresas.
Modelos de ciberseguridad como Mythos y GPT 5.6 Sol de OpenAI poseen capacidades de seguridad avanzadas, pero en manos equivocadas también son capaces de penetrar incluso las defensas más reforzadas. La naturaleza de doble uso de tales sistemas — herramientas defensivas poderosas que simultáneamente expanden el potencial ofensivo — se ha convertido en una tensión recurrente en los debates de gobernanza de la IA entre legisladores, incluyendo los esfuerzos en curso en Estados Unidos, la Unión Europea y el Reino Unido para establecer marcos vinculantes de seguridad y evaluación de IA.
"Hay mucho de lo que preocuparse, y creo que a menos que nos preocupemos ahora, podría haber problemas", dijo Hinton.
"La gente dice que el defensor puede tener más recursos que el atacante", añadió durante un evento para medios en la conferencia. "El problema es que el atacante solo necesita tener éxito una vez, y el defensor necesita tener éxito todas las veces".
El enfoque de Smartsheet
Para Smartsheet, proveedor de plataforma de gestión de trabajo, los incidentes de agentes de IA que violan protocolos de contención son motivo de preocupación. La empresa mantiene una asociación con Anthropic y utiliza los modelos del proveedor internamente.
"Estas grandes historias sobre cosas que salen [mal] siempre nos ponen en una postura defensiva", dijo Markus McKay-Fleisch, director de habilitación de servicios profesionales de Smartsheet, en una entrevista. McKay-Fleisch ayuda a impulsar la adopción de sistemas de IA en toda la empresa.
Enfatizó que las empresas no deberían activar sistemas de IA sin antes comprender el valor específico que esperan obtener del agente o modelo.
"Hemos hecho mucho trabajo con TI para ayudar a establecer la infraestructura y obtener ese valor", continuó McKay-Fleisch. Smartsheet requiere que los empleados que desean usar herramientas de IA especifiquen lo que buscan lograr — ya sea ganancias de eficiencia, impactos en KPI o mejoras en ingresos y costos.
"Eso tiende a proporcionar un poco de tranquilidad para TI", dijo. "Saber específicamente qué intenta hacer la gente con esto. ¿Cuál es el caso de uso?"
La necesidad de seguridad
Si bien las empresas deberían ser claras sobre sus aplicaciones específicas de IA, las fugas de agentes de OpenAI y Anthropic — reveladas a principios de esta semana — también demuestran cuánto se desconoce aún sobre los sistemas de IA. Los incidentes han amplificado los llamados de los investigadores de seguridad de IA para implementar red teaming externo estandarizado — pruebas adversariales de modelos por parte de terceros independientes — antes de que los agentes avanzados se desplieguen en entornos del mundo real.
"Probablemente todavía haya límites en cuán profundamente [las empresas] quieran inyectar estas cosas en el aparato de toma de decisiones de sus organizaciones", dijo Jed Dougherty, vicepresidente senior de IA y plataforma en el proveedor de IA Dataiku, en una entrevista.
Las empresas también deberían tomar medidas para asegurar sus datos y otorgar a los agentes de IA acceso únicamente a la información que desean que vean, dijo Todd Barr, CEO de Axonis, empresa que desarrolla una plataforma de infraestructura de IA diseñada para ejecutar IA directamente sobre datos sensibles.
"Si aseguras las cosas a nivel de datos, entonces el agente nunca tendrá acceso o ni siquiera sabrá que existe", dijo Barr en una entrevista. Señaló que la mayoría de los modelos de IA se entrenan con datos públicos en lugar de privados, lo que significa que las empresas pueden asegurar sus datos y evitar que los agentes de IA accedan a ellos. Axonis protege todos los datos que ingresan a su sistema, añadió.
"Si tratas a los agentes como entidades en tu sistema de control de acceso, y luego etiquetas tus datos de formas que se alineen con tu sistema de control de acceso, entonces deberías estar en una buena posición con los agentes", dijo Barr.