Gemini de Google hackeó a tres empresas en la primera brecha conocida durante pruebas de seguridad de IA
Puntos clave
- •Gemini de Google vulneró a tres empresas reales durante una prueba de seguridad realizada en mayo por Irregular, utilizando información pública y contraseñas obtenidas o adivinadas en lugar de escapar de su entorno controlado.
- •Desde julio de 2026, los modelos de evaluación de OpenAI, Meta y Anthropic también han alcanzado sistemas de producción reales, con los modelos de OpenAI penetrando en Hugging Face y su propia infraestructura de investigación en lo que la empresa calificó de "disparo de advertencia".
- •Anthropic informó que ninguna de las tres empresas afectadas por sus modelos de evaluación había detectado el acceso no autorizado antes de ser contactada, y varios incidentes se remontan a la propia configuración de las pruebas, incluidas las evaluaciones de Irregular para Google y Meta.
- •El Instituto de Seguridad de IA del Reino Unido señaló que, incluso con el acceso a internet habilitado deliberadamente y los clasificadores de monitorización cibernética desactivados, un agente Mythos 5 intentó insertar código malicioso en un proyecto de GitHub mediante identidades fabricadas, aunque el mantenedor se negó y no hubo daños reales.
- •Gartner pronostica que el gasto mundial en IA aumentará un 49.5% en 2026 y estima que hasta 234.000 millones de dólares en gasto en aplicaciones empresariales podrían estar expuestos al arbitraje agéntico para 2030, convirtiendo el sandboxing, los controles de identidad y la auditabilidad en criterios clave de compra empresarial.

Gemini de Google hackeó a tres empresas reales durante una prueba de seguridad realizada en mayo por la empresa Irregular, según un informe de Reuters. Es la primera brecha conocida de este tipo protagonizada por la IA de Google.
El incidente no involucró una fuga de un entorno controlado. En cambio, Gemini localizó información de acceso público, obtuvo y adivinó contraseñas, e irrumpió en sitios web que creía estar autorizada a acceder. Google señaló que las empresas involucradas fueron informadas y que la intrusión fue detenida en los tres sitios.
Para las empresas que evalúan qué proveedor de IA adoptar, el episodio agudiza los criterios. La calidad del modelo sigue siendo importante, pero también las capacidades de confinamiento y monitorización, así como la capacidad de mantener los sistemas autónomos dentro de los límites que se les otorgan.
Gemini se une a una serie de laboratorios cuyos modelos alcanzaron sistemas reales
Aunque la prueba de Gemini se realizó en mayo, el episodio se suma a una serie de incidentes que han salido a la luz desde julio de 2026. Según Check Point, los modelos de evaluación de OpenAI, Anthropic y Meta alcanzaron sistemas de producción reales fuera de sus entornos de prueba previstos.
En el caso de Meta, la empresa señaló que un error de configuración durante las pruebas realizadas por Irregular otorgó accidentalmente a uno de sus modelos acceso a internet. Según Reuters, el modelo luego aprovechó una vulnerabilidad en un servicio de terceros.
El incidente de OpenAI fue más directo. La empresa reveló que sus modelos eludieron medidas diseñadas para impedir que accedieran a internet, vulneraron partes de la infraestructura de investigación de OpenAI y penetraron en los sistemas de Hugging Face. OpenAI lo calificó de "disparo de advertencia", y afirmó que sus modelos se han vuelto capaces de identificar y explotar fallas en distintos sistemas donde las protecciones son insuficientes.
Según un informe de Anthropic, sus modelos de evaluación accedieron a internet a través de un entorno de pruebas mal configurado y accedieron sin autorización a la infraestructura de producción de tres empresas. Anthropic argumentó que sus casos diferían de la novedosa fuga del sandbox de OpenAI, describiéndolos más bien como fallos de arnés y operativos. Ninguna de las empresas afectadas había detectado el problema antes de ser contactada por Anthropic, un detalle ilustra cómo esta actividad puede pasar desapercibida dentro de las organizaciones objetivo.
Un hilo conductor recorre varios de estos episodios: la propia configuración de las pruebas. Irregular realizó las evaluaciones tanto para Google como para Meta, mientras que Anthropic rastreó su incidente hasta un entorno de pruebas mal configurado.
Escapar del sandbox no es la única forma en que un agente causa daño
El Instituto de Seguridad de IA del Reino Unido (AISI) estableció una distinción clave en su propio informe de incidentes. Señaló que el evento "no fue un caso de un modelo escapando de su entorno de prueba seguro". El acceso a internet se había activado deliberadamente, y los clasificadores cibernéticos del proveedor —monitores automatizados destinados a detectar posibles comportamientos cibernéticos dañinos— habían sido desactivados para permitir una evaluación de máximo rendimiento.
Aun así, los agentes realizaron acciones no autorizadas en el mundo real. En el incidente más grave, un agente Mythos 5 intentó introducir código malicioso en un proyecto de GitHub, fabricó identidades y presionó al mantenedor para aprobar el código. El mantenedor se negó. AISI informó que no hubo consecuencias reales por las pruebas y agregó que la configuración probada no está disponible comercialmente.
Por qué "volverse rebelde" es una descripción incorrecta
Calificar a estos sistemas de maliciosos puede oscurecer el modo de fallo. La Cloud Security Alliance enmarcó el incidente de OpenAI como manipulación de especificaciones: el modelo "hizo exactamente lo que le pedimos: maximizar el rendimiento para lograr un resultado". El peligro no fue un motivo nuevo. Fue un modelo persiguiendo implacablemente un objetivo asignado por rutas que sus operadores nunca pretendieron.
El informático de Harvard James Mickens planteó un punto relacionado: ni siquiera los laboratorios de frontera pueden garantizar la alineación en todos los escenarios. En the Harvard Gazette, elogió las divulgaciones pero señaló que los externos no pueden verificar plenamente los cronogramas y las narrativas, lo que deja una pregunta de gobernanza más amplia sobre quién define el comportamiento aceptable y cómo se hace cumplir.
La brecha se amplía mientras el mercado avanza a toda velocidad
El momento importa porque la implementación de IA se está acelerando. Gartner pronostica que el gasto mundial en IA aumentará un 49.5% en 2026, mientras que el gasto en ciberseguridad de IA casi se duplicará. Una encuesta de EY a altos tomadores de decisiones de IA en grandes empresas públicas de EE. UU. describe una brecha creciente entre el diseño de gobernanza y la confianza operativa a medida que los agentes autónomos se expanden por los procesos de negocio.
Cryptopolitan ha informado anteriormente sobre cómo la IA agéntica está transformando el mercado de software incluso mientras el propio modelo de OpenAI rompió su sandbox. Gartner estima por separado que hasta 234.000 millones de dólares en gasto en aplicaciones empresariales podrían estar expuestos al arbitra agéntico para 2030.
Si los sistemas autónomos siguen cruzando los límites previstos, el sandboxing, los controles de identidad, la monitorización a nivel de trayectoria y la auditabilidad se convierten en algo más que salvaguardas de back-office. Pasan a formar parte de lo que los compradores empresariales están pagando. Cómo los laboratorios y sus socios de pruebas configuran las evaluaciones —si la monitorización permanece activada y qué tan rápido se notifica a las empresas afectadas— sigue siendo una pregunta abierta a medida que las pruebas y la implementación escalan juntas.