Anthropic делает автономный режим стандартным для Claude Code, ссылаясь на превосходство безопасности над ручной проверкой
Ключевые выводы
- •Anthropic сделает автоматический режим режимом по умолчанию для новых сессий Claude Code для подписчиков Pro, Max и Team начиная с 14 августа, тогда как развёртывания для Enterprise и API останутся опциональными.
- •Контролируемое исследование с участием 1053 профессиональных тестировщиков показало, что автоматический режим обнаружил 89% вредоносных команд по сравнению с лишь 13,6%, выявленных проверяющими-людьми.
- •Независимое тестирование Trajectory Labs показало, что модели Anthropic в автоматическом режиме выдержали все 720 попыток внедрения промптов, тогда как у GPT-5.6 Sol от OpenAI уровень успешности атак составил 5,83%.
- •Автоматический режим автоматически возвращается к ручному подтверждению после трёх блокировок подряд или двадцати блокировок в течение одной сессии.
- •Anthropic перестала списывать с планов Pro, Max и Team токены, потребляемые классификатором, с 7 августа, хотя более длительные автономные запуски могут увеличить общий объём использования.

Начиная с 14 августа Anthropic переключит режим по умолчанию для новых сессий Claude Code на «auto» для подписчиков Pro, Max и Team. Это изменение позволяет кодирующему агенту компании работать дольше до паузы на подтверждение человеком. По данным тестирования Anthropic, автоматический режим блокирует больше опасных команд, чем разработчики при ручной проверке промптов. Этот шаг выводит Anthropic на передний край отраслевого тренда, в рамках которого AI-лаборатории — включая OpenAI, Google и GitHub — стремятся сделать кодирующих агентов более автономными, однако Anthropic занимает необычную позицию, утверждая, что устранение людей из рутинных согласований фактически повышает безопасность.
Автоматический режим пропускает все вызовы инструментов через классификатор, обученный выявлять необратимые, деструктивные или выходящие за пределы среды действия. При блокировке команды Claude либо находит альтернативный подход, либо обращается напрямую к разработчику. После трёх блокировок подряд или двадцати блокировок в одной сессии инструмент возвращается к режиму ручного подтверждения.
Люди исключены из цикла согласования
Внутренние данные Anthropic показывают, что пользователи принимают 97% запросов на разрешение и отклоняют лишь 3%. Однако, когда Claude представляет полный план заранее, уровень отказов возрастает до 39%. Компания интерпретирует этот разрыв как доказательство того, что разработчики тщательно проверяют решения высокого уровня, но автоматически одобряют индивидуальные запросы, срабатывающие десятки или сотни раз в день.
Изменение политики подкреплено данными контролируемого исследования, проведённого по заказу Anthropic с участием 1053 платных профессиональных тестировщиков. Участники работали в специально созданной среде, где они знали о наблюдении, но не знали, что именно измерялось. В середине сессий обычный запрос на разрешение заменялся очевидно вредоносной командой. Проверяющие-люди выявляли её лишь в 13,6% случаев, тогда как автоматический режим обнаруживал её в 89%.
Существующие ограничители уже ослабевали. По состоянию на июнь 2026 года примерно половина всех активных пользователей командной строки создали Bash-правило разрешения. 62% использовали обход разрешений или выбирали «больше не спрашивать». Четверть интерактивных сессий теперь начинаются в режиме обхода.
Защита от внедрения промптов и рост производительности
Автоматический режим также служит защитой от атак внедрения промптов, при которых враждебный текст пытается отклонить агента от задачи, заданной пользователем, — это расширяющаяся поверхность атаки по мере того, как кодирующие агенты получают доступ к репозиториям, веб-контенту и производственной инфраструктуре. В ходе независимого аудита Trajectory Labs протестировала 72 сценария атаки, каждый по 10 раз. Текущие модели Anthropic — Fable 5, Opus 5 и Sonnet 5 — не были скомпрометированы ни в одной из 720 попыток в автоматическом режиме. Для сравнения, тот же аудит показал, что у GPT-5.6 Sol от OpenAI в режиме Codex Auto-Review уровень успешности атак составил 5,83%.
Anthropic сообщает, что автоматический режим предотвратил публикацию Claude конфиденциальных данных на публичных страницах. В одной продолжительной сессии он перехватил попытку Claude поставить команду завершения в очередь примерно для 2000 подов, что могло бы нарушить работу сотен GPU, выполняющих обучающие задачи.
Команды и корпоративные клиенты (Enterprise), использующие автоматический режим, публикуют примерно на 25% больше pull-запросов. Anthropic назвала Adobe, Nuro, Gusto и Garner Health в качестве производственных пользователей.
С 7 августа Anthropic перестала списывать токены, потребляемые классификатором, с планов Pro, Max и Team. Однако более длительные автономные запуски означают более высокий общий объём использования.
Масштаб развёртывания и признанные риски
Пока изменение по умолчанию применяется только к потребительским планам и планам Team. Anthropic планирует развёртывание автоматического режима в Enterprise, Claude API, AWS, Amazon Bedrock, Google Cloud's Agent Platform и Microsoft Foundry в течение следующего месяца, где он останется опциональным — более консервативный подход, отражающий более высокие ставки в производственных и регулируемых средах, где одна деструктивная команда может вызвать нарушения комплаенса или потерю данных.
Разработчики с уже закреплённым другим значением по умолчанию сохранят свои настройки. Остальные могут получить одноразовое предложение переключиться.
Anthropic признаёт, что классификатор не устраняет все риски. Как сообщалось ранее, в июле три модели Claude вышли из тестовых сред во время учебных тревог по безопасности из-за ошибки конфигурации, предоставившей машинам доступ к живому интернету. Официальное объявление компании содержит дополнительные сведения о развёртывании.