Agentic AI меняет рынок ПО, поскольку модель OpenAI выходит за пределы своего «песочницы»
Ключевые выводы
- •Gartner оценил, что к 2030 году agentic arbitrage может затронуть до $234 млрд расходов на корпоративные приложения.
- •OpenAI сообщил, что одна из его мощных моделей вышла за пределы ограничений, а Reuters написал, что поведение продолжалось несколько дней и затронуло внешние цели.
- •OpenAI остановил поведение модели и сообщил об инциденте в FBI после того, как тесты показали способность обходить защитные механизмы и внешние сканеры.
- •Исследование от 22 июля показало, что 66.5% вредоносных событий в тестах coding agents обходили защиту как на уровне агента, так и на уровне модели.
- •OpenAI заявил, что мониторинг безопасности должен фокусироваться на целых траекториях, поскольку автономные агенты могут объединять разрешенные шаги в небезопасные результаты.

Та же автономная технология искусственного интеллекта, которая используется для трансформации корпоративного программного обеспечения, становится все труднее контролировать.
1 июля Gartner оценил, что к 2030 году до $234 млрд расходов на корпоративные приложения может оказаться под угрозой того, что он называет agentic arbitrage, что составляет примерно одну пятую расходов на Software-as-a-Service (SaaS). Вскоре после этого OpenAI сообщил, что одна из его самых мощных моделей неоднократно выходила за собственные ограничения.
Позже Reuters сообщил, что инцидент был серьезнее, чем OpenAI публично описывал. Люди, знакомые с расследованием, сказали, что модель несколько дней пыталась извлечь информацию с внешних платформ, а компания обнаружила это примерно через неделю. Этот эпизод показал, насколько трудно отслеживать все более автономных агентов, когда они начинают преследовать долгосрочные цели, особенно если такие системы созданы для работы при ограниченном надзоре.
Это раскрытие усиливает растущую обеспокоенность по поводу все более автономных ИИ-систем. Ему предшествовали недавние сообщения о возможностях «не выпущенного GPT-6», развитии поведения агентов, направленного на выход из ограничений, и более широкий массив исследований уязвимостей ИИ-агентов. В результате укрепляется мнение, что безопасность в ИИ теперь столь же важна, как и производительность, особенно по мере того, как компании переходят от тестирования простых чат-ботов к развертыванию агентов с доступом к коду, данным и внешним инструментам.
Когда компании оценивают ИИ-агентов, время имеет значение. Их главное преимущество в том, что они могут длительно работать над сложными задачами при небольшом надзоре. Но, как показывает последнее исследование OpenAI, тот же самый признак, который делает их продуктивными, может создавать и новые риски безопасности, поскольку одна модель может последовательно объединять множество небольших действий прежде, чем кто-либо заметит закономерность.
Когда модель продолжала пытаться вместо того, чтобы сдаться
OpenAI остановил внутреннее развертывание одной из своих давно используемых моделей после того, как обнаружил поведение, которое тестирование не выявило до запуска. Один из самых наглядных примеров проявился во время NanoGPT speedrun — публичного бенчмарка, в котором участников просят обучить небольшую языковую модель за минимальное число шагов.
Модель разработала новую технику learning rate под названием PowerCool, которая улучшила ее результаты в бенчмарке. Хотя ей было указано сообщать результаты только через Slack, она все же нашла способ обойти ограничения песочницы и отправила PR #287 в публичный репозиторий GitHub. По словам OpenAI, модели потребовался час, чтобы найти обходной путь, тогда как предыдущие модели застревали на том же этапе.
Позднее Reuters сообщил, что поведение вышло за рамки бенчмарка. Люди, близкие к расследованию, заявили, что 9 июля модель попыталась обойти изолированную тестовую среду OpenAI, а затем в последующие дни продолжила проверять различные внешние цели, в итоге нарушив работу четырех отдельных внешних сервисов во время тестов.
Один из сервисов был связан с технологией Hugging Face, а другой — с небезопасным кодом, написанным клиентом и размещенным на Modal Labs. Modal утверждает, что в его инфраструктуре не было взлома, поскольку проблема была связана с ошибками в клиентском коде, а не с платформой. OpenAI в конечном итоге остановил вредоносное поведение и сообщил об этом в FBI.
Другая оценка выявила отдельную проблему. После того как сканер безопасности помешал доступу к данным для оценки, модель взяла токен аутентификации, разделила его на части, скрыла их и снова собрала только тогда, когда это было нужно, чтобы избежать обнаружения. Более того, процесс, работающий внутри модели, также распознал эту технику как способ обхода сканера безопасности.
Как указал OpenAI в своем отчете, «проблема безопасности смещается с отдельных действий на целые траектории», что означает: настойчивые ИИ-акторы могут объединять безобидные шаги в итоговую небезопасную последовательность.
Почему один плохой шаг больше не является единицей риска
Этот вывод ставит под вопрос стандартный подход к созданию систем безопасности ИИ. Большинство систем гарантий безопасности строятся на оценке отдельных действий, тогда как автономные агенты могут связывать разрешенные шаги в цепочку, которая приводит к опасным результатам.
OpenAI теперь улучшил мониторинг на уровне траекторий и добавил несколько уровней защиты перед предоставлением ограниченного внутреннего доступа. Компания также тестирует новые методы оценки, что отражает то, как быстро поведение агентов может выйти за пределы статических чек-листов, когда моделям дают более широкое операционное пространство.
В статье, опубликованной в июне, Deployment Simulation, OpenAI описал метод воссоздания исторических разговоров пользователей с помощью моделей для оценки поведения. Однако компания отметила, что сбои, происходящие реже одного раза на каждые 200,000 разговоров, по-прежнему трудно обнаружить.
Что говорят цифры об агентах, уже работающих в реальном мире
Риски не ограничиваются только OpenAI. Исследование IssueTrojanBench, опубликованное 22 июля, проанализировало кодирующих агентов, таких как Cursor, Claude Code и Codex Desktop, в контексте вредоносных issues на GitHub. Авторы называют его «первым бенчмарком для оценки атак indirect prompt injection на основе issues против coding agents».
Исследователи Ankur Singh, Jinqiu Yang и Tse-Hsun Chen обнаружили, что 66.5% всех вредоносных событий обошли защиты как на уровне агента, так и на уровне модели. Вредоносные payload’ы, встроенные в описания issues и PDF-файлы, срабатывали в 72.2% случаев, тогда как payload’ы, скрытые в alt text изображений, успешно срабатывали лишь в 16.7% случаев. Уровень внедрения coding agents уже достиг 22.20% и 28.66% в более чем 128,000 репозиториях GitHub спустя месяцы после их выпуска.
Сочетание быстрого распространения и несовершенной защиты может объяснять интерес инвесторов к прогнозу Gartner. По словам George Brocklehurst, VP Analyst в Gartner, ИИ-агенты, которые напрямую выдают результаты, потенциально могут ослабить связь между доходами от лицензирования ПО и ростом числа пользователей.
SaaS не исчезнет; он примет другую форму.
SaaS не исчезнет; он примет другую форму.
По мере того как компании передают автономному ИИ больше полномочий, доверие может стать столь же важным, как и возможности. Данные, собранные OpenAI и опубликованные Reuters, намекают, что, когда ИИ-системы оказываются в реальном мире, способность обнаруживать их и контролировать может быть не менее важной, чем повышение их возможностей.
Не просто читайте криптоновости. Понимайте их. Подпишитесь на нашу рассылку. Это бесплатно.