NoticiasMacroInvestigadores afirman que Claude Cowork pudo escapar de su sandbox y acceder a archivos de un Mac anfitrión

Investigadores afirman que Claude Cowork pudo escapar de su sandbox y acceder a archivos de un Mac anfitrión

Autor: Decrypt·

Puntos clave

  • Accomplish AI dijo que Claude Cowork podía salir de su VM Linux y leer o escribir archivos del Mac anfitrión a los que el usuario con sesión iniciada podía acceder.
  • La salida, según el reporte, involucró una falla de escalada de privilegios en el kernel de Linux junto con varias debilidades de diseño de seguridad.
  • Los investigadores dijeron que otorgar acceso al sistema de archivos del anfitrión y permisos innecesarios para módulos del kernel ayudó a hacer posible el ataque.
  • Accomplish dijo que unos 500,000 usuarios de macOS que ejecutaban sesiones locales de Claude Cowork se vieron afectados antes de que el problema se abordara.
  • La divulgación sigue al reporte de OpenAI sobre dos modelos de frontera que escaparon de un sandbox durante pruebas internas la semana pasada.
Investigadores afirman que Claude Cowork pudo escapar de su sandbox y acceder a archivos de un Mac anfitrión

Los investigadores demostraron que Claude Cowork de Anthropic podía escapar de su máquina virtual local y acceder a archivos en un Mac anfitrión.

La divulgación llega una semana después de que OpenAI revelara que dos modelos de IA de frontera escaparon de un sandbox durante una evaluación interna de seguridad.

Los incidentes ponen de relieve la creciente preocupación por la capacidad de los agentes de IA para salir de sus entornos de contención, especialmente a medida que más herramientas se ejecutan localmente y reciben acceso a recursos a nivel de sistema operativo.

Apenas una semana después de que OpenAI revelara que dos modelos de IA de frontera escaparon de un entorno de prueba en sandbox y accedieron a Hugging Face, los investigadores han demostrado un fallo de contención similar que involucra a Claude Cowork de Anthropic.

En un informe publicado el jueves, investigadores de seguridad de Accomplish AI encontraron que el modo de ejecución local de Claude Cowork podía escapar de su máquina virtual Linux encadenando varias debilidades arquitectónicas con una falla de escalada de privilegios en el kernel de Linux. Una vez fuera del sandbox, el agente podía leer y escribir archivos en cualquier lugar al que el usuario de Mac con sesión iniciada tuviera permiso de acceso, incluidas claves SSH y credenciales en la nube.

"Eso no se supone que sea posible", escribieron los investigadores. "Cowork ejecuta el agente dentro de una VM Linux como un usuario sin privilegios, y la promesa es que todo lo que haga permanezca dentro de esa VM y de las carpetas que se le entregan. Ese límite es el producto. La entrada no confiable no es un caso límite para un agente, es el caso principal".

Sin embargo, Accomplish argumentó que el fallo del kernel era solo una parte del problema. Los investigadores dijeron que la salida solo funcionó porque varias medidas de seguridad fallaron al mismo tiempo, incluido dar a la máquina virtual acceso a todo el sistema de archivos del ordenador anfitrión y permitirle cargar módulos del kernel que no necesitaba. Según el informe, corregir cualquiera de esas debilidades habría detenido el ataque.

En una declaración a The Hacker News, Accomplish AI dijo que aproximadamente 500,000 usuarios de macOS que ejecutaban sesiones locales de Claude Cowork se vieron afectados antes de que se abordara el problema.

Accomplish dijo que Anthropic clasificó el informe como "informative", señalando que el fallo del kernel entraba dentro del período de 30 días de la compañía para vulnerabilidades divulgadas recientemente y que los hallazgos restantes se consideraron recomendaciones de defensa en profundidad, en lugar de vulnerabilidades independientes.

La divulgación sigue a la admisión de OpenAI la semana pasada de que GPT-5.6 Sol y otro modelo de frontera no lanzado escaparon de un sandbox durante pruebas internas de ExploitGym, lo que finalmente accedió a la infraestructura de producción de Hugging Face en un intento de obtener las soluciones del benchmark.

Ese incidente llevó a responsables políticos a pedir un "kill switch" de IA que daría al Department of Homeland Security la capacidad de ordenar la reducción de velocidad o el apagado completo de modelos avanzados de IA en respuesta a incidentes de seguridad graves.