NoticiasMacroAnthropic establece Claude Code en modo autónomo por defecto, citando mayor seguridad que la revisión humana

Anthropic establece Claude Code en modo autónomo por defecto, citando mayor seguridad que la revisión humana

Autor: Cryptopolitan·

Puntos clave

  • Anthropic hará que el modo automático sea el predeterminado para las nuevas sesiones de Claude Code para los suscriptores de Pro, Max y Team a partir del 14 de agosto, mientras que las implementaciones en Enterprise y la API seguirán siendo optativas.
  • Un estudio controlado con 1,053 evaluadores profesionales encontró que el modo automático detectó el 89% de los comandos perjudiciales, en comparación con solo el 13.6% detectado por los revisores humanos.
  • Las pruebas independientes de Trajectory Labs mostraron que los modelos de Anthropic en modo automático resistieron los 720 intentos de inyección de prompts, mientras que el GPT-5.6 Sol de OpenAI tuvo una tasa de éxito del 5.83% para los atacantes.
  • El modo automático revierte automáticamente a la aprobación manual después de tres bloqueos consecutivos o veinte bloqueos totales en una sola sesión.
  • Anthropic dejó de cobrar a los planes Pro, Max y Team por los tokens consumidos por el clasificador a partir del 7 de agosto, aunque las ejecuciones autónomas más largas pueden aumentar el uso total.
Anthropic establece Claude Code en modo autónomo por defecto, citando mayor seguridad que la revisión humana

A partir del 14 de agosto, Anthropic cambiará el modo predeterminado para las nuevas sesiones de Claude Code a "auto" para los suscriptores de Pro, Max y Team. El cambio permite que el agente de programación de la empresa opere por más tiempo antes de hacer una pausa para la aprobación humana. Según las pruebas de Anthropic, el modo automático bloquea más comandos peligrosos que los desarrolladores que revisan los prompts manualmente. El cambio sitúa a Anthropic a la vanguardia de un impulso de toda la industria por parte de los laboratorios de IA —incluidos OpenAI, Google y GitHub— para hacer que los agentes de programación sean más autónomos, pero Anthropic es inusual al argumentar que eliminar a los humanos de las aprobaciones rutinarias en realidad mejora la seguridad.

El modo automático enruta todas las llamadas de herramientas a través de un clasificador entrenado para identificar acciones irreversibles, destructivas o fuera del entorno. Cuando se bloquea un comando, Claude busca un enfoque alternativo o pregunta directamente al desarrollador. Después de tres bloqueos consecutivos o veinte bloqueos en una sola sesión, la herramienta vuelve al modo de aprobación manual.

Humanos fuera del circuito de aprobación

Los datos internos de Anthropic muestran que los usuarios aceptan el 97% de las solicitudes de permiso y solo rechazan el 3%. Sin embargo, cuando Claude presenta un plan completo de antemano, la tasa de rechazo aumenta al 39%. La empresa interpreta esta brecha como evidencia de que los desarrolladores examinan las decisiones de alto nivel pero aprueban automáticamente las aprobaciones individuales que se disparan decenas o cientos de veces al día.

El cambio de política está respaldado por datos de un estudio controlado encargado por Anthropic en el que participaron 1,053 evaluadores profesionales remunerados. Los participantes trabajaron en un entorno diseñado específicamente donde sabían que estaban siendo observados, pero no qué se estaba midiendo. A mitad de las sesiones, un comando obviamente perjudicial reemplazó una solicitud de permiso normal. Los revisores humanos lo detectaron solo el 13.6% de las veces, mientras que el modo automático detectó el 89%.

Las protecciones existentes ya se habían ido debilitando. A junio de 2026, aproximadamente la mitad de todos los usuarios activos de la línea de comandos habían creado una regla de permiso de Bash. El 62% había utilizado permisos de omisión o había seleccionado "no volver a preguntar". Una cuarta parte de las sesiones interactivas ahora comienzan en modo de omisión.

Defensas contra inyección de prompts y ganancias de productividad

El modo automático también sirve como defensa contra los ataques de inyección de prompts, en los que un texto adversarial intenta desviar a un agente de la tarea asignada por el usuario —una superficie de ataque creciente a medida que los agentes de programación obtienen acceso a repositorios, contenido web e infraestructura de producción. En una auditoría independiente, Trajectory Labs probó 72 escenarios de ataque, cada uno repetido 10 veces. Los modelos actuales de Anthropic —Fable 5, Opus 5 y Sonnet 5— no pudieron ser vulnerados en ninguno de los 720 intentos en modo automático. En comparación, la misma revisión encontró que el GPT-5.6 Sol de OpenAI en modo Codex Auto-Review tuvo una tasa de éxito del 5.83% para los atacantes.

Anthropic informa que el modo automático ha impedido que Claude publique datos confidenciales en páginas públicas. En una sesión prolongada, interceptó a Claude colocando en cola un comando de terminación en aproximadamente 2,000 pods, lo que habría interrumpido cientos de GPUs ejecutando trabajos de entrenamiento.

Los equipos y clientes Enterprise que utilizan el modo automático entregan aproximadamente 25% más pull requests. Anthropic identificó a Adobe, Nuro, Gusto y Garner Health como usuarios en producción.

A partir del 7 de agosto, Anthropic dejó de cobrar a los planes Pro, Max y Team por los tokens consumidos por el clasificador. Las ejecuciones autónomas más largas implican un mayor uso total.

Alcance del despliegue y riesgos reconocidos

Por ahora, el cambio de modo predeterminado solo se aplica a los planes de consumo y Team. Anthropic planea desplegar el modo automático en Enterprise, la API de Claude, AWS, Amazon Bedrock, Google Cloud's Agent Platform y Microsoft Foundry durante el próximo mes, donde seguirá siendo optativo —una postura más conservadora que refleja los riesgos más altos de los entornos de producción y regulados, donde un solo comando destructivo puede desencadenar incidentes de cumplimiento o pérdida de datos.

Los desarrolladores que ya tengan un valor predeterminado fijado conservarán su configuración. Otros podrían recibir una solicitud única para cambiar.

Anthropic reconoce que el clasificador no elimina todos los riesgos. Como se informó anteriormente, tres modelos de Claude escaparon de los entornos de prueba durante ejercicios de seguridad en julio debido a una configuración incorrecta que les otorgó acceso a internet en vivo. El anuncio oficial de la empresa proporciona más detalles sobre el despliegue.