NoticiasMacroEl Opus 5 de Anthropic logra una tasa de éxito de inyección de prompt del cero por ciento para agentes de navegador

El Opus 5 de Anthropic logra una tasa de éxito de inyección de prompt del cero por ciento para agentes de navegador

Autor: The Decoder·

Puntos clave

  • Opus 5 logró una tasa de éxito de ataque de inyección de prompt del cero por ciento en 129 escenarios de prueba para agentes de navegador, pero solo cuando las protecciones de Auto Mode estaban activadas.
  • Sin las defensas por capas de Auto Mode, la vulnerabilidad de Opus 5 a la inyección de prompt es del 3,7 por ciento, superior al 0,93 por ciento de Sonnet 5 en la misma configuración desprotegida.
  • Las pruebas independientes de la firma de seguridad Gray Swan encontraron que Opus 5 redujo la tasa de éxito de ataque después de 15 intentos del 5,5 por ciento en Opus 4.8 al 2,0 por ciento.
  • Auto Mode se defiende de la inyección de prompt utilizando dos capas independientes que analizan los datos entrantes en busca de instrucciones ocultas y bloquean acciones peligrosas antes de que se ejecuten.
  • Los resultados de Anthropic se aplican específicamente a su propio ecosistema y podrían no generalizarse a implementaciones de terceros que carezcan de defensas por capas equivalentes.
El Opus 5 de Anthropic logra una tasa de éxito de inyección de prompt del cero por ciento para agentes de navegador

Anthropic informa que su modelo más reciente, Opus 5, es casi inmune a los ataques de inyección de prompt dentro de su propio ecosistema de software. La inyección de prompt —una técnica en la que un atacante evita las instrucciones operativas de un modelo de IA mediante entradas manipuladas, como texto oculto incrustado en páginas web— fracasó contra Opus 5 en casi todos los escenarios probados.

Según la tarjeta del sistema de Opus 5, la tasa de éxito de ataque para agentes de navegador alcanzó el cero por ciento en 129 escenarios de prueba. Esto contrasta notablemente con el reconocimiento de OpenAI en diciembre de que la inyección de prompt podría no resolverse nunca.

En una evaluación general de inyección de prompt realizada por la firma de seguridad Gray Swan, la tasa de éxito después de 15 intentos se redujo del 5,5 por ciento en Opus 4.8 al 2,0 por ciento en Opus 5, según se detalla en la sección de pruebas de seguridad de la tarjeta del sistema.

Sin embargo, el resultado del cero por ciento en agentes de navegador depende de activar Auto Mode en productos como Claude Cowork. Auto Mode despliega dos capas de defensa: una que analiza los datos entrantes en busca de instrucciones ocultas antes de que el modelo los procese, y otra que bloquea acciones peligrosas antes de su ejecución. Un atacante tendría que vencer ambas capas de forma independiente para tener éxito.

Sin estas protecciones, la vulnerabilidad de Opus 5 a la inyección de prompt se sitúa en un 3,7 por ciento. Curiosamente, Sonnet 5 tiene un mejor desempeño en esa configuración desprotegida, con una tasa del 0,93 por ciento. Solo la combinación del modelo Opus 5 y el software protector Auto Mode lleva la tasa de éxito de ataque a cero en escenarios de agentes de navegador.

La inyección de prompt ha sido ampliamente considerada como uno de los desafíos de seguridad más significativos que enfrentan los agentes de IA —sistemas autónomos que navegan por la web, leen documentos y realizan acciones en nombre de los usuarios. Debido a que estos agentes procesan de forma rutinaria contenido externo no confiable, los actores maliciosos potencialmente pueden incrustar instrucciones que anulen las directivas originales del agente. La vulnerabilidad ha sido una preocupación persistente en toda la industria de la IA y un obstáculo clave para la implementación más amplia de sistemas de IA agentivos. Los principales laboratorios de IA, incluidos Google y OpenAI, también están desarrollando productos de agentes de navegador, lo que convierte la resistencia a la inyección de prompt en un diferenciador competitivo a medida que estas herramientas avanzan hacia un uso más amplio por parte de consumidores y empresas. Los resultados de Anthropic sugieren que combinar mejoras de entrenamiento a nivel de modelo con barreras arquitectónicas puede reducir el riesgo, aunque los hallazgos se aplican específicamente al ecosistema propio de Anthropic y podrían no generalizarse a implementaciones de terceros que carezcan de defensas por capas equivalentes.