Opus 5 от Anthropic показал нулевой уровень успешности prompt injection для браузерных агентов
Ключевые выводы
- •Opus 5 достиг нулевого уровня успешности атак prompt injection в 129 тестовых сценариях для браузерных агентов, но только при включенных защитах Auto Mode.
- •Без эшелонированных защит Auto Mode восприимчивость Opus 5 к prompt injection составляет 3.7 процента, что выше показателя Sonnet 5 в 0.93 процента в той же незащищенной конфигурации.
- •Независимое тестирование компании по безопасности Gray Swan показало, что Opus 5 снизил уровень успешности атак после 15 попыток с 5.5 процента на Opus 4.8 до 2.0 процента.
- •Auto Mode защищает от prompt injection с помощью двух независимых уровней, которые проверяют входящие данные на скрытые инструкции и блокируют опасные действия до их выполнения.
- •Результаты Anthropic относятся именно к ее собственной экосистеме и могут не распространяться на сторонние развертывания без сопоставимых эшелонированных защит.

Anthropic сообщает, что ее новейшая модель Opus 5 почти невосприимчива к атакам prompt injection внутри собственной программной экосистемы компании. Prompt injection — метод, при котором злоумышленник обходит рабочие инструкции AI-модели с помощью манипулированных входных данных, например скрытого текста, встроенного в веб-страницы, — не сработал против Opus 5 почти во всех протестированных сценариях.
Согласно системной карте Opus 5, уровень успешности атак на браузерных агентов достиг нуля процентов в 129 тестовых сценариях. Это заметно контрастирует с декабрьским признанием OpenAI, что prompt injection может никогда не быть полностью решена.
В рамках общей оценки prompt injection, проведенной компанией по безопасности Gray Swan, уровень успешности после 15 попыток снизился с 5.5 процента на Opus 4.8 до 2.0 процента на Opus 5, как подробно указано в разделе системной карты о тестировании безопасности.
Однако нулевой результат для браузерных агентов зависит от включения Auto Mode в таких продуктах, как Claude Cowork. Auto Mode использует две эшелонированные защиты: одна проверяет входящие данные на скрытые инструкции до их обработки моделью, а другая блокирует опасные действия до выполнения. Чтобы добиться успеха, злоумышленнику пришлось бы независимо преодолеть оба уровня.
Без этих защит восприимчивость Opus 5 к prompt injection составляет 3.7 процента. Примечательно, что Sonnet 5 показывает лучший результат в той же незащищенной конфигурации — 0.93 процента. Только сочетание модели Opus 5 и защитного ПО Auto Mode снижает уровень успешности атак до нуля в сценариях с браузерными агентами.
Prompt injection широко рассматривается как одна из наиболее значимых проблем безопасности для AI-агентов — автономных систем, которые просматривают веб-страницы, читают документы и выполняют действия от имени пользователей. Поскольку такие агенты регулярно обрабатывают недоверенный внешний контент, злоумышленники потенциально могут встраивать инструкции, которые переопределяют исходные указания агента. Эта уязвимость остается устойчивой проблемой для AI-индустрии и ключевым препятствием для более широкого внедрения агентных AI-систем. Крупные AI-лаборатории, включая Google и OpenAI, также разрабатывают продукты с браузерными агентами, поэтому устойчивость к prompt injection становится конкурентным отличием по мере продвижения этих инструментов к более широкому использованию потребителями и предприятиями. Результаты Anthropic показывают, что сочетание улучшений обучения на уровне модели с архитектурными защитными механизмами может снизить риск, однако эти выводы относятся именно к собственной экосистеме Anthropic и могут не распространяться на сторонние развертывания без сопоставимых эшелонированных защит.