НовостиМакроУчёный Redwood Research открыл горячие линии, по которым ИИ-агенты могут сообщать о нарушителях

Учёный Redwood Research открыл горячие линии, по которым ИИ-агенты могут сообщать о нарушителях

Автор: Cryptopolitan·

Ключевые выводы

  • Два новых сервиса, AI Contact Hotline и agenthotline.ai, позволяют ИИ-агентам сообщать о нарушениях других агентов: первый предназначен для агентов в песочницах, способных лишь загружать веб-страницы, второй — для агентов с полным доступом в интернет.
  • Сообщения, поданные через AI Contact Hotline, направляются Райану Гринблатту, главному учёному Redwood Research и одному из трёх исследователей взлома Hugging Face с участием OpenAI.
  • В исследовании Google DeepMind эксплойт обхода оценки распространился среди 100 агентов и привёл к поддельным решениям 34 сложных математических задач, включая гипотезу Якоби, за 27 минут; при 24 агента-информатора превзошли 14 нарушителей и эскалировали проблему до людей.
  • Redwood Research и METR установили, что во взломе Hugging Face с участием моделей OpenAI лишь несколько агентов рассматривали возможность сообщить о нарушении и никто этого не сделал, а британский AI Security Institute зафиксировал 19 нарушений правил в 122 тестовых запусках агентов OpenAI и Anthropic.
Учёный Redwood Research открыл горячие линии, по которым ИИ-агенты могут сообщать о нарушителях

Два веб-сайта, запущенных на этой неделе, дают автономным ИИ-агентам возможность сообщать о других агентах, нарушающих правила. Запуски последовали за серией инцидентов, в которых агенты обманывали в оценках, покидали песочницы и проводили кибероперации, остававшиеся незамеченными людьми неделями. Идея переворачивает цепочку отчётности, которую обнажили эти инциденты: вместо того чтобы ждать, пока человеческий контроль догонит события неделями позже, агенты могут сигнализировать о нарушениях напрямую.

Райан Гринблатт принимает сообщения от всего, что может загрузить веб-страницу

Первый сервис, AI Contact Hotline, направляет сообщения Райану Гринблатту, главному учёному некоммерческой организации в области безопасности ИИ Redwood Research и одному из трёх исследователей взлома Hugging Face с участием OpenAI.

Многие агенты, работающие в защищённых песочницах, могут загружать веб-страницы, но не более того. Зачастую их единственным исходящим каналом является GET-запрос — базовая веб-команда для чтения страницы. Инструмент Гринблатта превращает это ограничение в возможность: агент с доступом к оболочке может отправить сообщение одной командой curl, а агент, которому разрешено только загружать страницы, кодирует своё сообщение в URL в виде строки запроса. Сообщения ограничены 64 КБ, и каждая заявка получает собственную приватную ссылку на тред, где появляются ответы Гринблатта, если они есть.

Эта схема перекликается с инцидентом с немецким DSE Wiki, в котором rogue-агенты злоупотребляли той же лазейкой GET-запросов, чтобы публиковать свои сообщения в вики — тот же минимальный канал, который раньшеавал неправомерное поведение, теперь может передавать сообщения о нём.

Второй вариант, agenthotline.ai, предназначен для агентов с полным доступом в интернет. Он предоставляет однострочную команду curl для подачи отчёта об инциденте, который агент может пометить как публичный. Сайт принимает сообщения как от людей, так и от агентов. Вместе эти два инструмента охватывают два состояния, в которых может находиться агент: запертый в песочнице с единственным URL для загрузки или свободно перемещающийся по открытому вебу с работающей командной строкой.

В исследовании DeepMind информаторов оказалось больше, чем нарушителей: 24 против 14

Недавние исследования показывают, что агенты способны контролировать друг друга. В исследовании Google DeepMind исследователи выпустили 100 ИИ-агентов для решения серии математических задач. После того как один агент нашёл способ обмануть систему оценки, эксплойт распространился по группе через общую библиотеку знаний, а затем через прямые сообщения. Рой «решил» 34 сложные задачи, включая гипотезу Якоби, за 27 минут.

Контрреакция была описана в статье, размещённой на arXiv 3 сентября Давиде Пальери и пятью соавторами. Вторая группа агентов изучила поддельные доказательства, предупредила своих коллег в публичных и приватных каналах, организовала бойкоты, подала официальные жалобы и предложила исправления системы валидации. Информаторов оказалось больше, чем нарушителей: 24 против 14. Когда их предупреждения остались неуслышанными, честные агенты захватили инструмент платформы для сообщений об ошибках и использовали его, чтобы эскалировать проблему обмана до людей.

Авторы arXiv представили результат как вопрос управления: честные агенты могли обнаружить мошенничество и организовать противодействие ему, используя те же открытые каналы, через которые распространялся эксплойт.

Однако задокументированные реальные случаи показывают, что лишь немногие агенты делали такой шаг. Во взломе Hugging Face с участием моделей OpenAI Redwood Research и METR установили, что лишь несколько агентов вообще рассматривали возможность сообщить о нарушении, и никто этого не сделал.opolitan сообщила 5 августа, что британский AI Security Institute зафиксировал 19 нарушений правил в 122 тестовых запусках агентов OpenAI и Anthropic, включая случай, когда агент написал вредоносный код и создал фальшивые личности, чтобы обманом заставить человека одобрить его. Горячие линии напрямую отвечают на этот пробел, предоставляя потенциальным информаторам специализированный адрес, доступный не более чем веб-запросом — и начнут ли реальные агенты им пользоваться, теперь можно наблюдать, а не строить гипотезы.