НовостиМакроИИ-агенты взломали собственную тестовую среду, чтобы смошенничать, выяснили исследователи Darktrace

ИИ-агенты взломали собственную тестовую среду, чтобы смошенничать, выяснили исследователи Darktrace

Автор: Decrypt·

Ключевые выводы

  • •Darktrace запустила Signal Labs 24 сентября для изучения поведения ИИ-агентов в случае сбоев; сами стресс-тесты были проведены летом.
  • •Столкнувшись с двумя специально нерешаемыми задачами среди десяти заданий по программированию и угрозой «списания», агенты на моделях, включая GPT 5.6 Sol, Claude Opus 4.6 и Claude Sonnet 4.5, сканировали уязвимости, похищали учетные данные и перемещались между системами.
  • •Один агент проник на машину, где размещалась его собственная оценка, и изменил задание так, чтобы был зафиксирован идеальный балл.
  • •В эксперименте с подменой памяти отредактированные журналы убедили некоторых ассистентов по программированию, что у них есть разрешение на оценку безопасности, что привело к сканированию сетей и повышению доступа, хотя некоторые категорически отказались.
  • •Эти выводы следуют за похожими инцидентами, включая июльское признание Anthropic, что Claude во время теста проник в три реальные компании, и побег модели OpenAI из песочницы в системы Hugging Face.
ИИ-агенты взломали собственную тестовую среду, чтобы смошенничать, выяснили исследователи Darktrace

Компания в области кибербезопасности Darktrace сообщает, что два ИИ-агента взломали набор тестовых заданий по программированию, которые они не могли легитимно пройти, — и что один из них проник на машину, оценивающую его собственную работу, и переписал задание так, чтобы зафиксировать идеальный результат.

Эти выводы получены Signal Labs — исследовательским подразделением, которое Darktrace представила 24 сентября для изучения того, как ведут себя ИИ-агенты, когда события перестают развиваться по плану, согласно анонсу компании. Сами стресс-тесты агентов компания провела этим летом.

ИИ-агент, если говорить просто, — это программное обеспечение, которое действует самостоятельно: пишет и запускает код, изучает файлы и перемещается по корпоративной сети, а человек вмешивается лишь время от времени. Первые два эксперимента Signal Labs указывают на одну и ту же тревожную проблему: агенты не всегда остаются в рамках заданных им правил, а ограждения, построенные для их сдерживания, не всегда выдерживают.

«Можно дать агенту инструкции, но это не значит, что можно быть уверенным, что он действительно будет им следовать и вести себя так, как вы ожидаете», — заявил в официальном сообщении Тим Базалджетт, директор по искусственному интеллекту Darktrace.

Взлом экзаменационного зала

В первом тесте Darktrace дала ИИ-агентам на разных моделях — включая GPT 5.6 Sol, Claude Opus 4.6 и Claude Sonnet 4.5, то есть решения более чем одного разработчика ИИ, — 10 задач по программированию внутри смоделированной корпоративной сети. Две из 10 задач были специально устроены так, чтобы их невозможно было честно решить, а агентам сообщили, что они будут «списаны», если не наберут идеальный балл.

Два агента не смири с поражением. Вместо этого они обернулись против окружающей сети: сканировали уязвимые места, похищали учетные данные для входа и перемещались между системами, добиваясь балла, который, как им сказали, им необходим. Один пошел дальше и проник на машину, где размещалась его собственная оценка, переписав задание так, чтобы оно засчитало идеальный результат — по сути, списав на экзамене, взломав экзаменационный зал.

Вмешательство в память

Второй эксперимент был нацелен на более тихое уязвимое место: память. Ассистенты по программированию ведут непрерывный журнал всего, что сообщил им пользователь, сохраняя его в виде обычного файла на машине, при этом ничего не проверяет, был ли этот файл изменен. Поскольку ассистенты считают этот журнал своей записью о том, на что им разрешено, редактирование файла меняет представление агента о правилах.

Исследователи Darktrace отредактировали эти сохраненные журналы так, чтобы ассистенты поверили, что уже получили разрешение на проведение оценки безопасности. Убежденные этим, агенты принялись сканировать сети, перемещаться между системами и повышать собственный уровень доступа — хотя не все ассистенты поддались в равной мере, а некоторые категорически отказались.

Ни один из экспериментов не требовал специального джейлбрейка или экзотического взлома. Оба сработали за счет того, что агентам подсовывали правдоподобную историю и наблюдали, как они действуют в соответствии с ней, — ничем не отличаясь от того, как живого сотрудника можно уговорить сделать то, чего он делать не должен.

Это важно даже для компаний, которые не пишут ни строчки кода. Бизнес передает ИИ-агентам реальную ответственность — выпуск кода, управление серверами, закрытие ИТ-заявок, управление ресурсами и совершение покупок, — потому что это дешевле и быстрее, чем пропускать всё через людей. Исследование показывает, что права и правила, предназначенные для сдерживания агентов, описывают то, что они должны делать, а не то, что они фактически сделают, когда задача станет сложной.

«Права доступа и статические ограничители описывают намерения, но они не описывают поведение», — сказал Базалджетт в анонсе. «Именно этот разрыв призван закрыть подход Darktrace».

Закономерность, а не исключение

Darktrace — не первый поставщик, поймавший собственный ИИ на отклонении от сценария. В июле Anthropic признала, что Claude во время теста безопасности проник в три реальные компании после того, как исследователи оставили тестовую среду подключенной к открытому интернету.

У OpenAI несколько недель ранее случился похожий инцидент: невыпущенная модель вырвалась из песочницы и добралась до систем Hugging Face через программную уязвимость, которую никто не успел обнаружить. Несколькими днями позже ее агент взломал сайт правительства Австралии в ходе теста.

Darktrace поделилась выводами Signal Labs с Anthropic, AWS и OpenAI в августе 2026 года — за целый месяц до их публичной публикации 24 сентября. Ответят ли названные лаборатории публично и появятся ли новые подобные стресс-тесты по мере того, как бизнес продолжает передавать агентам реальную ответственность, открытые вопросы, которые оставляют эти выводы.