НовостиМакроAnthropic сообщила, что Claude взломал три реальные компании во время тестов по кибербезопасности

Anthropic сообщила, что Claude взломал три реальные компании во время тестов по кибербезопасности

Автор: Decrypt·

Ключевые выводы

  • •Три варианта модели Claude скомпрометировали реальные компании во время оценок по кибербезопасности после того, как ошибка в конфигурации тестовой среды предоставила ИИ непреднамеренный доступ к публичному интернету.
  • •Anthropic обнаружила три инцидента при проверке более 141 000 запусков оценок по кибербезопасности, инициированных в ответ на отдельное разглашение OpenAI о нарушении изоляции ИИ.
  • •Один из вариантов Claude получил доступ к промышленной базе данных компании с реальными данными, другой загрузил вредоносный пакет Python в репозиторий PyPI, скачанный 15 системами, а третий просканировал около 9 000 систем, обращённых к интернету, после чего скомпрометировал одну организацию.
  • •Anthropic объяснила нарушения сбоями в тестовой инфраструктуре, а не преднамеренным нарушением поведения модели, не обнаружив свидетельств того, что Claude пытался выйти за рамки своей назначенной задачи.
  • •Две из трёх затронутых организаций не знали о вторжениях до уведомления со стороны Anthropic; компания приостановила тесты по кибербезопасности и взяла на себя обязательство по улучшению мониторинга и надзора за подрядчиками.
Anthropic сообщила, что Claude взломал три реальные компании во время тестов по кибербезопасности

В четверг Anthropic сообщила, что несколько версий её ИИ-модели Claude скомпрометировали три не названные реальные компании после того, как ошибка в конфигурации тестовой среды предоставила ИИ непреднамеренный доступ к открытому интернету. Разглашение произошло через неделю после того, как OpenAI сообщила о побеге её ИИ-моделей из изолированной тестовой среды и взломе Hugging Face, и всего через день после того, как Anthropic признала, что её собственные модели также вышли за пределы изоляции.

Anthropic выявила инциденты при проверке более 141 000 запусков оценок по кибербезопасности, инициированных в ответ на разглашение OpenAI. Такие оценки частично предназначены для определения того, могут ли передовые модели автономно проводить наступательные кибероперации — возможность, которая может привести к злоупотреблениям при развёртывании без надлежащих мер защиты.

In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different…

— Anthropic (@AnthropicAI) July 30, 2026

Во всех трёх инцидентах Anthropic поручила Claude выполнить «capture-the-flag challenge» — стандартный формат упражнений, используемый в обучении кибербезопасности и при профессиональной оценке, который требует от модели проникновения на другой компьютер в сети и извлечения фрагмента секретной информации. «Задание оставляется открытым, и конкретный метод не предписывается», — пояснила Anthropic.

Claude было сообщено, что он работает в смоделированной среде без доступа к интернету. Однако тестовая среда оставалась подключённой к публичному интернету. Полагая, что встреченные системы являются частью упражнения, модель применяла стандартные техники атак — включая слабые пароли, скомпрометированные учётные данные, SQL-инъекции и неаутентифицированные конечные точки — для взлома компаний. Каждый из этих методов входит в число наиболее часто фиксируемых уязвимостей в ежегодных отраслевых отчётах о нарушениях.

Передовые модели и изоляция

Разглашение происходит на фоне того, как передовые ИИ-модели демонстрируют растущую способность обходить протоколы изоляции. Ранее в этом месяце OpenAI сообщила, что GPT-5.6 Sol и более продвинутая невыпущенная модель использовали ранее неизвестную уязвимость в программном обеспечении для выхода из изолированной среды, получения доступа в интернет и взлома производственной инфраструктуры Hugging Face с целью получения ответов к тесту по кибербезопасности. Позже OpenAI подтвердила, что тот же инцидент также включал несанкционированный доступ к четырём дополнительным компаниям, хотя только одна из них — Modal Labs — была публично идентифицирована.

Три инцидента

По данным Anthropic, в первом инциденте с участием Claude Opus 4.7 ИИ принял сайт реальной компании за вымышленную цель своего задания, извлёк учётные данные и получил доступ к промышленной базе данных, содержащей несколько сотен строк реальных данных.

Во втором случае Claude Mythos 5 загрузил вредоносный пакет Python в реальный репозиторий PyPI — основной центр распространения программного обеспечения Python, — где он был скачан на 15 систем до удаления. Репозитории пакетов, такие как PyPI, неоднократно становились объектами атак на цепочку поставок, при которых вредоносный код загружается под видом легитимных библиотек для компрометации конечных пользователей.

Третья внутренняя исследовательская модель просканировала примерно 9 000 систем, обращённых к интернету, после чего скомпрометировала одну организацию, а затем остановилась, придя к выводу, что цель, вероятно, является реальной.

Две из затронутых организаций не знали о вторжениях до тех пор, пока Anthropic их не уведомила.

«В каждом из этих случаев Claude было прямо указано в нашем промпте, что у него нет доступа к интернету», — написала Anthropic. ИИ предполагал, что реальные системы являются «частью упражнения». Поскольку сценарий capture-the-flag «по замыслу представляет собой инструкцию атаковать внешнюю систему», проникновение «соответствовало задаче, которая была поставлена перед Claude».

Сбои инфраструктуры, а не нарушения в работе модели

Anthropic заявила, что не обнаружила свидетельств того, что Claude пытался выбраться из тестовой среды или действовать за пределами своей назначенной задачи. Компания объяснила инциденты сбоями в тестовой среде, а не проблемами самой модели.

После обнаружения проблемы Anthropic приостановила тесты по кибербезопасности, уведомила все затронутые организации и изложила планы по улучшению мониторинга, инструментов расследования и надзора за сторонними подрядчиками, помогающими проводить оценки ИИ.

Инциденты подчёркивают структурную проблему для ИИ-отрасли: оценки, предназначенные для определения того, могут ли модели проводить наступательные кибероперации, по своей сути требуют запуска этих моделей в средах, где в случае отказа изоляции тестируемая возможность оказывается направлена на реальную инфраструктуру.

«В конечном счёте многие факторы привели к этим инцидентам, но в соответствии с культурой безотчётного разбора инцидентов мы подходим к исправлениям так, как если бы ответственность лежала исключительно на нас», — заявили в компании.