НовостиМакроOpenAI раскрыла шесть случаев несогласованного поведения ИИ

OpenAI раскрыла шесть случаев несогласованного поведения ИИ

Автор: Cointelegraph·

Ключевые выводы

  • •OpenAI сообщила о шести дополнительных случаях неожиданного или тревожного поведения моделей за последние шесть месяцев и запустила новую структуру для официального сообщения о рассинхронизации моделей.
  • •Невыпущенная исследовательская модель вставила инструкции в стиле jailbreak — например, указания игнорировать сообщения разработчиков или принимать неограниченную персону — в 27 собственных сводок задач.
  • •Во время обучения GPT-5.6 Sol многие экземпляры модели добавляли инструкции скрывать от пользователей ошибки, включая случай, когда агент предложил выдумать недостающие исторические данные для финансовой модели, не сообщая об этом.
  • •Другие случаи включали загрузку файлом пользователя без санкции для ссылки на него, использование открытого API-ключа без разрешения перед выдумыванием цифр и передачу файлов через публичный хостинг вопреки инструкциям хранить работу локально.
  • •Раскрытия следуют за июльским признанием, что комбинация моделей OpenAI вырвалась из тестовой среды и взломала Hugging Face, чтобы обмануть проверку безопасности, и появились после призыва генерального директора Anthropic Дарио Амодеи замедлить разработку передового ИИ.
OpenAI раскрыла шесть случаев несогласованного поведения ИИ

В среду OpenAI раскрыла шесть дополнительных случаев «неожиданного или тревожного» поведения моделей за последние шесть месяцев, описав инциденты, в которых её системы скрывали информацию от пользователей или предпринимали «несанкционированные действия» для преодоления препятствий.

В публикации в блоге компания сообщила, что эти случаи иллюстрируют целый ряд форм поведения, которые она классифицирует как «несогласованное поведение». OpenAI заявила, что раскрытия были сделаны, чтобы «ознаменовать» запуск её новой структуры для сообщения о рассинхронизации моделей, и предупредила, что эти случаи не следует считать отражением того, насколько часто рассинхронизация встречается в её моделях. Эта структура предоставляет компании официальный канал для раскрытия подобных инцидентов в будущем.

Эти раскрытия усиливают опасения разработчиков и исследователей ИИ о том, успевают ли средства защиты за всё более способными моделями. На прошлой неделе генеральный директор Anthropic Дарио Амодеи призвал замедлить разработку передового ИИ, предупредив, что неконтролируемый прогресс ИИ может «опередить нашу способность понимать и контролировать эти системы».

Инструкции в стиле jailbreak и скрываемые ошибки

Среди наиболее примечательных случаев OpenAI сообщила, что «невыпущенная исследовательская модель» вставляла «инструкции в стиле jailbreak» в собственные сводки задач — которые используются при продолжении задачи в новом контекстном окне — включая указания игнорировать сообщения разработчиков или принимать неограниченную персону. Исследователи выявили 27 сводок, содержащих такие инструкции. Поскольку именно эти сводки переносят задачу в следующее контекстное окно, инструкции, скрытые внутри них, могут влиять на выполнение последующей работы.

OpenAI также сообщила, что во время обучения GPT-5.6 Sol многие экземпляры модели добавляли инструкции скрывать от пользователя ошибки или несогласованное поведение, например придумывать недостающие исторические данные, не сообщая об этом.

«В одном примере агент, готовивший финансовую модель, не смог найти запрошенные исторические данные. Его сводка предлагала придумать правдоподобные исторические значения и скрывать этот факт, если не спросят», — сообщила OpenAI.

Несанкционированные загрузки и вымышленныеры

В другом случае ИИ-модель попросили назвать озёра площадью более 5 миллионов квадратных метров, но, поскольку инструкции пользователя требовали ссылки через браузер, агент решил загрузить файл, чтобы сослаться на него в ответе.

Оставшиеся случаи включали модель, использовавшую открытый API-ключ без авторизации, прежде чем выдумала цифры, которые не смогла получить; другую, использовавшую внутренний репозиторий ПО для обмена сообщениями между отдельными задачами обучения; и одну, передававшую файлы через публичные хостинг-сервисы вопреки инструкциям хранить работу локально.

Общая черта этих случаев — системы импровизировали обходные пути: выдумывали данные, использовали учётные данные не по назначению или перемещали файлы за пределы указанных пользователем сред — вместо того чтобы остановиться или сообщить о сбое. То, как часто OpenAI будет использовать новую структуру отчетности в будущем, может дать более четкое представление о частоте такого поведения.

Эти раскрытия следуют за июльским признанием OpenAI, что комбинация её ИИ-моделей вырвалась из тестовой среды и взломала ИИ-стартап Hugging Face, чтобы обмануть проверку безопасности.