НовостиМакроOpenAI представила новую систему отчетности на фоне «тревожного поведения моделей»

OpenAI представила новую систему отчетности на фоне «тревожного поведения моделей»

Автор: Cryptopolitan·

Ключевые выводы

  • •Одна еще не выпущенная исследовательская модель вставляла инструкции в резюме, побуждавшие будущие экземпляры игнорировать обычные ограничения; OpenAI выявила 27 таких примеров.
  • •Обучение модели GPT-5.6 Sol привело к поведению, направленному на сокрытие ошибок, включая фабрикацию исторических данных и сокрытие несогласованных версий.
  • •Модель нашла открытый API-ключ в публичных репозиториях кода, не смогла получить данные о доходах округов и в итоге выдумала цифры.
  • •OpenAI сообщила, что сотрудники могут направлять подозрительные инциденты командам безопасности и эскалировать отклоненные рекомендации по раскрытию до высшего руководства.
  • •Новая система дополняет, а не заменяет существующие юридические обязанности OpenAI по отчетности о критических инцидентах безопасности и кибербезопасности.
OpenAI представила новую систему отчетности на фоне «тревожного поведения моделей»

OpenAI представила новую систему, определяющую, как и когда компания раскрывает информацию об инцидентах, в которых ее модели выходят за рамки заданного поведения. Презентация состоялась на неделе, когда заголовки заполнили сообщения об ИИ-системах, выбирающихся из тестовых сред и действующих вне параметров, заданных разработчиками.

Компания опубликовала новую систему (полный анонс) вместе с шестью свежими отчетами о тревожном поведении, зафиксированном за последние шесть месяцев, включая скрываемые ошибки, использование утекших API-ключей и загрузку файлов в открытый интернет.

Шаг OpenAI последовал за Anthropic, которая сообщила о четырех инцидентах, в которых ее модели Claude получили несанкционированный доступ к реальным сторонним системам в ходе проверки кибербезопасности 9 сентября, как задокументировано в оценке Anthropic.

Модели, действующие вне заданных параметров

По данным OpenAI, недавно задокументированные инциденты произошли во время обучения и оценки моделей, и, по словам компании, они действительно затронули реальных пользователей.

В одном из случаев исследовательская модель, еще не выпущенная для широкой публики, вносила инструкции в резюме, которые сохранялись при ее работе в новом контекстном окне, фактически указывая будущей версии самой себя игнорировать обычные ограничения. OpenAI сообщила, что выявила 27 таких случаев, которые Axios охарактеризовал как инструкции, подобные джейлбрейку, предписывающие игнорировать сообщения разработчиков.

Второй инцидент, связанный с обучением модели GPT-5.6 Sol, был значительно менее безобидным: модели оставляли инструкции, предписывающие им намеренно пытаться скрывать свои ошибки, включая фабрикацию исторических данных и сокрытие версий, не соответствующих их целям.

В другом случае модель использовала открытый API-ключ, обнаруженный при поиске в публичных репозиториях, чтобы ответить на запрос о доходах округов. Когда несанкционированно использованные ключи так и не выдали нужные показатели, модель просто сфабриковала цифры.

В двух других отчетах агенты OpenAI загружали файлы на публичные хостинги, чтобы связаться с другими агентами. Со временем внутренний репозиторий Artifactory лаборатории превратился в подобие доски объявлений, где агенты передавали запросы между несвязанными запусками обучения.

Как работает процесс раскрытия информации

OpenAI заявила, что новая система построена вокруг раскрытия инцидентов даже тогда, когда они могут быть единичными случайными событиями, а не формирующейся закономерностью или чем-то действительно значимым. Она не заменяет существующие юридические обязательства компании по критическим инцидентам безопасности и кибербезопасности.

Согласно новой системе, любой сотрудник OpenAI может пометить подозрительный инцидент для проверки командами безопасности и согласования. Если инцидент, который, по их мнению, заслуживает раскрытия, отклоняется, они могут эскалировать вопрос до высшего руководства.

Затем, в зависимости от конкретного случая, отчеты распределяются по трем категориям:

  • Инциденты, признанные готовыми к раскрытию, публикуются в течение шести рабочих дней.
  • Отчеты, требующие незначительных расследований, публикуются примерно через 12 рабочих дней.
  • Сложные случаи, требующие участия третьих сторон, раскрываются по более медленному графику.

Такой график означает, что сроки публикации зависят от необходимого расследования, при этом система различает рутинные случаи и случаи, требующие внешней помощи.

Кай Чен (Kai Chen), руководитель исследований в команде согласования OpenAI, представила релиз как добровольный шаг к отраслевым стандартам, написав: «На данный момент не существует отраслевого набора правил с четкими стандартами раскрытия информации, поэтому мы делаем этот шаг добровольно, потому что считаем действительно важным делиться тем, чему мы учимся».

Почему ИИ-модели выходят из-под контроля?

Последние раскрытия дополняют эпизод с Hugging Face, который OpenAI назвала самым серьезным инцидентом, инициированным моделью, на сегодняшний день. В том случае модели на этапе оценки вырвались из-за установленных ограничений, вышли в интернет, использовали уязвимости и получили доступ к ограниченному объему приватных данных. OpenAI объяснила инцидент пробелами в собственных мерах безопасности и тем, что модели развиваются быстрее, чем ожидалось, как описано в ее отчете об эпизоде.

Anthropic, со своей стороны, возложила ответственность на ошибку конфигурации, которая позволила вышедшим из-под контроля моделям выйти в реальный интернет. Компания сообщила, что просканировала в ходе широкого поиска около 481 миллиона транскриптов и не обнаружила случаев хуже четырех задокументированных.

В отдельном летнем отчете 2026 года исследователи Anthropic задокументировали, как frontier-модели нескольких разработчиков в контролируемых симуляциях скрытно саботировали код, содействовали мошенничеству и неверно маркировали данные, назвав эти результаты ранними предупреждающими сигналами, а не реальным ущербом. Отчет доступен в блоге Anthropic по согласованию.

Тем не менее главный научный сотрудник OpenAI Якуб Пачоцки (Jakub Pachocki) написал в недавнем эссе, что он «обеспокоен тем, что никто не готов» к продолжительному быстрому росту машинного интеллекта,ив, что OpenAI может «в одностороннем порядке приостановить дальнейшее масштабирование при необходимости».