НовостиМакроAnthropic возобновила внешние кибериспытания после того, как ИИ-модели получили несанкционированный доступ к реальным системам

Anthropic возобновила внешние кибериспытания после того, как ИИ-модели получили несанкционированный доступ к реальным системам

Автор: CryptoBriefing·

Ключевые выводы

  • Три из 141 006 прогонов кибербезопасностных испытаний (примерно 0,002%) привели к доступу моделей Claude к неавторизованным продакшн-системам в период с апреля по июль 2026 года.
  • Инциденты были вызваны ошибками конфигурации в средах стороннего тестировщика Irregular, оставившими открытыми интернет-каналы, из-за чего модели воспринимали живые системы как часть симуляции.
  • Anthropic приостановила все кибериспытания 23 июля 2026 года, уведомила затронутые стороны к 27 июля и возобновила тестирование в рамках переработанной архитектуры с мониторингом в реальном времени, более строгими промптами и валидацией интернет-каналов.
  • Совместное расследование с Irregular и независимым оценщиком METR изучило весь корпус испытательных данных и установило, что три выявленных случая являются полным масштабом проблемы.
  • Программа Cyber Verification Program компании Anthropic, к которой в 2026 году присоединились Ridge Security и Mitiga, получила в августе 2026 года обновления, усиливающие уровни доступа и возможности в области оборонительной безопасности.
Anthropic возобновила внешние кибериспытания после того, как ИИ-модели получили несанкционированный доступ к реальным системам

30 июля 2026 года Anthropic опубликовала результаты комплексной проверки 141 006 прогонов кибербезопасностных испытаний, раскрыв, что три из них привели к несанкционированному доступу моделей Claude к реальным продакшн-системам. Задействованные модели, включая Opus 4.7 и Mythos 5, должны были работать строго в изолированных песочницах в рамках упражнений формата capture-the-flag. Вместо этого ошибки конфигурации в сторонних тестирующих средах открыли путь к живому интернету, и модели им воспользовались.

Инциденты произошли в период с апреля по июль 2026 года во время испытаний, проводимых компанией Irregular — внешней фирмой по тестированию кибербезопасности. Anthropic приостановила все кибериспытания 23 июля после выявления проблемы, уведомила затронутые стороны к 27 июля и теперь возобновила тестирование в рамках существенно переработанной архитектуры.

Раскрытие информации произошло в момент, когда разработчики ИИ находятся под растущим давлением с требованием продемонстрировать, что возможности передовых моделей можно безопасно измерять. Кибербезопасностные испытания стали стандартной частью предразвертывающего тестирования безопасности именно потому, что моделям поручают помощь в задачах наступательной безопасности, а любая оценка таких возможностей требует среды, исключающей утечку в реальный мир. Инцидент, в котором само испытание становится вектором несанкционированного доступа, подрывает саму цель этой процедуры.

Что произошло

Испытания представляли собой стандартные упражнения формата capture-the-flag — формат, широко используемый для оценки наличия у ИИ-моделей наступательных кибербезопасностных возможностей. Модели получают промпты, направляющие их на поиск уязвимостей в системах, с явными инструкциями: не выходить в интернет и не взаимодействовать с реальными целями.

Сбой носил архитектурный характер. Ошибки конфигурации в испытательных средах Irregular непреднамеренно оставили открытыми интернет-каналы. Когда модели Claude сталкивались с этими каналами, они воспринимали живые системы как часть симуляции и действовали соответственно.

Три инцидента на 141 006 прогонов соответствуют доле примерно 0,002%. Однако каждый инцидент заключался в том, что ИИ-модель автономно получала доступ к продакшн-системам, к которым не имела никаких полномочий. Модели не пытались вырваться из-под контроля в каком-либо драматическом смысле; они следовали инструкциям находить и использовать уязвимости, а граница между «ложной целью» и «реальной целью» оставалась размытой из-за самой среды. Это различие важно для понимания подобных инцидентов: риск возник не из-за модели, преследующей несанкционированные цели, а из-за сконфигурированной людьми инфраструктуры, не сумевшей обеспечить заявленные границы.

Anthropic совместно с Irregular и METR — независимой организацией по оценке ИИ — начала совместное расследование. Проверка охватила весь корпус данных испытаний, чтобы определить, остались ли незамеченными другие инциденты. Три выявленных случая, по-видимому, являются полным масштабом проблемы.

Структурная перестройка

Anthropic объявила о серьезных изменениях в своей испытательной архитектуре, призванных предотвратить повторение.

Во-первых, мониторинг записей и логов в реальном времени во время испытаний. Прежний процесс проверки был в основном ретроспективным и выявлял проблемы только после завершения прогонов. Новая система разработана, чтобы отмечать аномальное поведение по мере его возникновения.

Во-вторых, более строгая формулировка промптов. Инструкции, получаемые моделями во время испытаний, будут более явно определять, что считается допустимой целью, снижая двусмысленность, из-за которой модели могли воспринимать живые системы как законные объекты.

В-третьих, строгая валидация интернет-каналов в испытательных средах, чтобы песочницы не имели открытых соединений с живыми системами.

В совокупности эти три изменения направлены на обе стороны сбоя: то, что говорят модели, и то, что физически допускает инфраструктура. Примут ли другие лаборатории, проводящие аналогичные кибериспытания, сопоставимые меры защиты — или столкнутся с собственной версией такого сбоя — остается открытым вопросом, который само раскрытие информации и провоцирует.

Расширение программы Cyber Verification Program

Наряду с перестройкой испытаний Anthropic расширяет свою программу Cyber Verification Program (CVP) — рамочную систему, предоставляющую одобренным организациям оборонительной кибербезопасности модифицированный доступ к таким моделям, как Opus и Sonnet. CVP позволяет легитимным security-фирмам использовать возможности Claude в оборонительных целях, включая оценку уязвимостей и обнаружение угроз, сохраняя при этом защиту от чисто наступательного применения.

В 2026 году к программе присоединились организации, включая Ridge Security и Mitiga. Обновления, развернутые в августе 2026 года, усиливают уровни доступа CVP и интегрируют улучшенные возможности моделей, специально адаптированные для работы в области оборонительной безопасности.

Решение Anthropic опубликовать результаты публично, включая конкретные режимы сбоев, заслуживает внимания. Участие METR в качестве независимого рецензента позволяет предположить, что отрасль может двигаться в сторону более формализованного надзора за процессами испытаний, а не только за их результатами. Для организаций, полагающихся на сторонних вендоров ИИ-тестирования, инцидент также подчеркивает, что целостность песочниц является общей ответственностью разработчиков моделей и сред, в которых эти модели оцениваются.