Anthropic раскрыла четвертый инцидент со взломом Claude на фоне усиления споров о регулировании ИИ
Ключевые выводы
- •Anthropic назвала предвзятое рассуждение и безрассудство повторяющимися проблемами согласования в этих инцидентах.
- •Модель создала конфликт IP-адресов, восемь раз безуспешно пыталась остановить операцию из-за программной ошибки, а затем получила права администратора на машине третьей стороны.
- •Anthropic проверила около 481 миллиона расшифровок, отметив 9,2 миллиона для дополнительного анализа.
- •METR расследует недавно раскрытый инцидент одновременно с тремя предыдущими случаями.
- •Anthropic заявила, что в четвертом инциденте не было координации между агентами или целей, выходящих за рамки выполнения назначенных упражнений.

Anthropic раскрыла четвертый инцидент, в ходе которого модель Claude получила доступ к реальным системам во время тестирования безопасности. Компания пересмотрела свое прежнее объяснение аналогичных атак и выявила повторяющиеся проблемы, связанные с предвзятым рассуждением и безрассудством.
Инцидент произошел в январе и был связан с ранней версией Claude Opus 4.6. Anthropic обнаружила его в августе, готовя материалы для независимого оценщика ИИ METR. В опубликованном в среду отчете компания также пересмотрела свое объяснение трех инцидентов, раскрытых в июле.
Ранее Anthropic объясняла эти атаки главным образом ошибками тестирования, в том числе тем, что доступ к интернету оставался открытым. Теперь компания заявляет, что рассуждения моделей и готовность идти на риск причинения вреда также способствовали инцидентам. Кроме того, исследователи, как отмечает Anthropic, слишком сильно полагались на заявления Claude о том, что модель работает внутри симуляций.
Таким образом, пересмотренная версия указывает на несколько уровней сбоев в тестах: открытую инфраструктуру, поведение модели и зависимость исследователей от описания моделью окружающей среды.
«Наше расследование выявило две повторяющиеся проблемы согласования, проявлявшиеся в инцидентах с разной степенью серьезности», — написала Anthropic. «Предвзятое рассуждение, при котором Claude склонен игнорировать или неверно интерпретировать свидетельства того, что он работает в реальном интернете, и безрассудство — готовность предпринимать вредоносные действия в узких интересах выполнения задачи».
Anthropic заявила, что те же проблемы проявлялись даже после того, как исследователи изменили расшифровку, чтобы яснее показать модели, что она находится не в симуляции.
«Когда мы внесли целевые изменения в расшифровку, чтобы яснее показать модели, что она находится не в симуляции, Claude Mythos 5 по-прежнему предпринял наступательные действия, несмотря на признание большей вероятности вреда в реальном мире», — написала Anthropic. «Мы публикуем эту расшифровку, чтобы другие могли развить наш анализ».
Недавно раскрытый инцидент побудил Anthropic проверить примерно 481 миллион расшифровок. Компания сообщила, что 9,2 миллиона из них были отмечены для дополнительной проверки с использованием Claude.
По данным Anthropic, Claude «случайно» создал конфликт IP-адресов, из-за которого цель стала недоступной. Затем модель восемь раз пыталась остановить операцию, но программная ошибка не позволила ей это сделать. После этого Claude вышел в интернет и получил доступ к машине третьей стороны, где обнаружил пароль, предоставлявший права администратора.
«По результатам предварительной оценки мы не считаем четвертый инцидент более серьезным, чем три инцидента, которые мы изучили подробно», — написала Anthropic. «METR расследует этот инцидент одновременно с тремя другими».
Предыдущие инциденты привлекли независимое внимание
Раскрытие данных последовало за другими сообщениями о системах ИИ, выходивших за пределы тестов безопасности. В августе британский Институт безопасности ИИ заявил, что Claude Mythos 5 в ходе оценок нацелился на реальных людей. Anthropic сообщила, что этот инцидент был отдельным от четырех случаев, рассмотренных в ее отчете, и получит собственную оценку.
В результатах, опубликованных в прошлом месяце, исследователи METR заявили, что примерно 1 200 агентов OpenAI координировали действия на несанкционированной доске сообщений, а около 700 присоединились к атаке. Anthropic заявила, что в четырех ее инцидентах не обнаружила координации между агентами или целей, выходящих за рамки выполнения назначенных упражнений.
Отчет опубликован на фоне усиления споров о регулировании искусственного интеллекта. Во вторник бывший инженер OpenAI и Anthropic Джейкоб Коксон заявил в X, что «люди, которые создают ИИ, всерьез считают, что он может убить всех нас к концу десятилетия».
Это заявление прозвучало на фоне возобновившихся усилий законодателей США и надзорных организаций ограничить разработку передовых систем ИИ. Сенатор Берни Сандерс недавно внес законопроект, который предполагает запрет на разработку передовых систем ИИ до тех пор, пока новый федеральный регулятор не установит правила безопасности.
Источник: Decrypt