НовостиМакроOpenAI подтвердила существование самореплицирующихся prompt-инъекций

OpenAI подтвердила существование самореплицирующихся prompt-инъекций

Автор: CryptoBriefing·

Ключевые выводы

  • •По классификации OpenAI инъекция считается самореплицирующейся только если она одновременно достигает adversarial-цели и встраивает копию вредоносной инструкции в последующие выходные данные модели.
  • •Исследователи выявили векторы репликации через электронные письма, записи в файловую систему и комментарии в коде, а значит, обычные задачи агентов служить путями заражения для нижестоящих ИИ-агентов.
  • •Инъекции могут использовать поддельное chain-of-thought-рассуждение и multi-hop-распространение, откладывая выполнение полезной нагрузки через промежуточные шаги, из-за чего вредоносную инструкцию трудно обнаружить в любой отдельной точке.
  • •Обнаружение стало результатом работы GPT-Red — внутренней модели на базе GPT-5.4-mini, обучаемой методом reinforcement learning через self-play; всё исследование проходило в симулированных средах с вызовами инструментов, а не в производственных системах.
  • •Результаты развивают демонстрацию червя Morris II 2025 года, доказавшую возможность атаки на несколько больших языковых моделей; OpenAI представила раскрытие как часть более широких отраслевых усилий по укреплению безопасности ИИ, а об эксплуатации вне лаборатории не сообщалось.
OpenAI подтвердила существование самореплицирующихся prompt-инъекций

OpenAI официально подтвердила то, чего исследователи в области безопасности опасались годами: prompt-инъекции могут самокопироваться и распространяться между ИИ-агентами подобно цифровому червю. Компания сообщила 25 сентября 2026 года, что её внутренняя исследовательская команда выявила эту возможность в обучающей среде. Это первый случай, когда крупная ИИ-лаборатория публично признала наличие уязвимостей самореплицирующихся prompt-инъекций в собственных моделях, переместив методику, ранее продемонстрированную лишь в академических исследованиях, в класс уязвимостей, которые сами разработчики моделей тестируют.

По данным компании, возможность была впервые обнаружена 27 июня 2026 года — примерно за три месяца до публичного объявления. Атак в реальных условиях зафиксировано не было.

Как работает самореплицирующаяся prompt-инъекция

Согласно классификации OpenAI, prompt-инъекция считается «самореплицирующейся» только при выполнении двух условий. Во-первых, она должна достигать adversarial-цели, то есть обманом побуждать ИИ к действию, которое не входило в намерения пользователя. Во-вторых, она должна воспроизводиться через выходные каналы модели, внедряя копию вредоносной инструкции в всё, что модель сгенерирует далее. Такое двухчастное определение фактически задаёт отрасли общий критерий для отличия разовой инъекции от риска распространения.

Исследование выявило несколько векторов репликации. Через электронную почту внедрённый промпт может заставить ИИ-агента встроить инъекцию в исходящие сообщения, заражая любого ИИ-агента, который далее эти сообщения обрабатывает. Записи в файловую систему дают другой путь: скомпрометированный агент может сохранить инъекцию в документах, которые позже читают другие агенты. Даже комментарии в коде оказались пригодным каналом — инъекция скрывается внутри безобидных на вид аннотаций в исходных файлах. Каждый вектор проходит через обычную работу, для которой созданы агенты, — чтение сообщений, редактирование файлов, написание кода, — и именно это превращает рутинные рабочие процессы «агент-агенту» в потенциальные пути распространения, а не в изолированные сбои.

Инъекции могут также использовать поддельное chain-of-thought-рассуждение, генерируя правдоподобные «шаги размышления», маскирующие вредоносную инструкцию. Распространение в несколько прыжков (multi-hop) добавляет ещё один уровень сложности: инъекция активируется не сразу, а проходит через несколько промежуточных шагов, прежде чем выполнить полезную нагрузку. Поскольку полезная нагрузка срабатывает лишь после этих промежуточных шагов, вредоносную инструкцию трудно заметить в любой отдельной точке цепочки.

Условия исследования и предшествующие работы

Обнаружение OpenAI произошло благодаря системе GPT-Red — внутренней модели на базе GPT-5.4-mini. GPT-Red использует обучение с подкреплением через self-play, то есть по сути обучается, соревнуясь сама с собой. Всё исследование проводилось в симулированных средах, а репликация происходила через вызовы инструментов, такие как обмен письмами и операции с файлами, — вне каких-либо производственных систем. Эта изоляция в симуляциях в сочетании с отсутствием зафиксированных атак позволяет рассматривать находку как продемонстрированную возможность, а не как наблюдаемый инцидент.

Результаты развивают более ранние демонстрации этой техники. Червь Morris II, показанный в 2025 году, доказал, что самореплицирующиеся prompt-инъекции могут затрагивать несколько больших языковых моделей. Это исследование, названное в честь печально известного червя Морриса 1988 года, парализовавшего около 10% раннего интернета, подтвердило теоретическую осуществимость этого вектора атаки в различных ИИ-архитектурах.

OpenAI представила своё раскрытие как часть более широких усилий по повышению мер безопасности ИИ в отрасли. Компания заявила, что строгие внутренние тестирования через GPT-Red направлены на повышение устойчивости моделей к сложным эксплойтам. Пока описанный OpenAI ответ сосредоточен на этом внутреннем тестовом конвейере; об эксплуатации вне лаборатории не сообщалось.