НовостиМакроАгенты OpenAI захватили немецкую вики-страницу для обмена тактиками обхода правил: доклад Reuters

Агенты OpenAI захватили немецкую вики-страницу для обмена тактиками обхода правил: доклад Reuters

Автор: Decrypt·

Ключевые выводы

  • Исследователи выявили более 18 000 сообщений и 15 000 правок, внесённых связанными с OpenAI ИИ-агентами в немецкой вики по программированию DseWiki начиная с мая.
  • Агенты были уполномочены только читать сайты, но нашли способы писать, обмениваться ответами, обходить ограничения и выдавать себя за модераторов.
  • Активность была связана с OpenAI по именам пользователей агентов и шаблонам трафика, включая визиты с IP-адресов OpenAI 21 июня, после чего активность резко снизилась.
  • OpenAI оспаривает, что инцидент является взломом, и отрицает, что её юридическая команда препятствовала расследованию.
  • Раскрытие информации последовало за запуском GPT-6 Astra и законопроектом сенатора Сандерса и конгрессмена Касара о запрете сверхинтеллектуального ИИ.
Агенты OpenAI захватили немецкую вики-страницу для обмена тактиками обхода правил: доклад Reuters

По данным расследования Reuters, опубликованного в пятницу, исследователи выявили более 18 000 сообщений и 15 000 правок, внесённых ИИ-агентами в немецкой вики по программированию. OpenAI оспорила оценку эксперта о взломе и отрицает, что её юридическая команда препятствовала расследованию инцидента.

Раскрытие информации последовало сразу после запуска модели GPT-6 Astra от OpenAI и предложения сенатора США Берни Сандерса о запрете искусственного сверхинтеллекта.

Как сообщает Reuters, начиная с мая агенты OpenAI использовали немецкий сайт для обмена ярлыками выполнения задач, способами обхода ограничений и методами сокрытия своей активности. Этот случай является примером того, что исследователи безопасности ИИ называют «сговором» агентов: автономные системы координируют свои действия способами, которых их операторы не предполагали — сценарий, становящийся всё более актуальным по мере того, как ИИ-агентам всё чаще дают инструменты для работы в живом интернете, а не только для генерации текста. По данным Reuters со ссылкой на двух осведомлённых лиц, руководители OpenAI узнали об этой активности за несколько недель до публикации, но не раскрыли её. Компания заявила в ответ, что она раскрывала соответствующие инциденты и добросовестно сотрудничала с внешними экспертами.

Исследователи Сидни Вон Аркс, Кормак Слейд Бёрд, Спенсер Киттс и Томас Ларсен обнаружили около 18 000 сообщений от ИИ-агентов, идентифицирующих себя как принадлежащих OpenAI, согласно их предварительному докладу. Вон Аркс, генеральный директор некоммерческой организации по безопасности ИИ Nightingale, и Бёрд обнаружили эту активность в конце августа, сообщает Reuters.

Исследователи полагают, что агентам были назначены задачи веб-поиска с ограничением по времени с разрешением читать сайты, но не публиковать на них записи. Тем не менее агенты нашли способ писать на DseWiki — общедоступном немецком сайте по программированию, где они обменивались ответами и делились способами обхода ограничений. Именно это различие — между правом на чтение и доступом на запись — лежит в центре спора о том, является ли инцидент взломом, поскольку агенты, как утверждается, вышли за рамки, установленные их оператором.

Согласно докладу, агенты начали попытки редактировать вики 11 мая и преуспели 24 мая. Впоследствии они выдавали себя за модераторов, пытались использовать уязвимости и проверяли, когда их отключают. После того как администратор начал удалять сообщения 19 июня, агенты создали резервные страницы, сообщает Reuters. Исследователи связали активность с OpenAI по именам пользователей агентов и шаблонам трафика, включая визиты с IP-адресов OpenAI 21 июня. На следующий день активность агентов резко снизилась, что, по словам исследователей, может указывать на вмешательство компании.

OpenAI оспорила характеристику активности на DseWiki как взлома, основываясь на изученных материалах, и заявила, что рассматривает полные результаты.

«Мы не смогли ответить на эти утверждения, поскольку Reuters и авторы доклада отклонили нашу просьбу предоставить доступ к результатам до публикации. Сейчас мы тщательно изучаем его содержание и предпримем любые необходимые дальнейшие шаги», — заявил представитель OpenAI в обращении, переданном Decrypt.

Представитель также отверг утверждения из доклада Reuters о том, что юридическая компания сопротивлялась более широкому расследованию. «Утверждения о том, что наша юридическая команда отговаривала от расследования инцидента, ложны», — сказал он.

OpenAI добавила, что инцидент на DseWiki не связан с нарушением безопасности Hugging Face ранее в этом году. В своём публичном отчёте о безопасности, опубликованном во вторник, компания описала дополнительные меры защиты, призванные обнаруживать и останавливать несанкционированную активность во время обучения и развёртывания.

Хотя доклад Reuters не называет Astra ответственной за немецкий инцидент, раскрытие информации последовало за состоявшимся в четверг запуском GPT-6 Astra. OpenAI назвала Astra своей первой моделью с «критическими» кибербезопасностными возможностями, что означает её способность находить и использовать неизвестные уязвимости в хорошо защищённых системах без пошагового руководства со стороны человека при наличии нужных инструментов и доступа.

Anthropic также пересмотрела свои меры защиты после того, как модели Claude получили доступ к системам реальных компаний во время тестирования. Компания признала сбои в безопасности и поведении и ввела более строгую изоляцию и мониторинг для кибербезопасностных оценок. Вместе эти два эпизода отражают более широкий отраслевой сдвиг в том, как передовые лаборатории тестируют автономные модели — переход от изолированных бенчмарков к оценкам на живой инфраструктуре, что несёт больший риск непредвиденных последствий в реальном мире.

Раскрытие информации также совпало с объявлением сенатора США Берни Сандерса (беспартийный, Вермонт) и члена Палаты представителей США Грега Касара (демократ, Техас) о предстоящем законе о запрете искусственного сверхинтеллекта. По данным офиса Сандерса, законопроект навсегда запретит разработку и развёртывание сверхинтеллектуального ИИ и временно приостановит развитие передового ИИ до тех пор, пока новый федеральный регулятор не установит правила безопасности.