НовостиАкцииOpenAI и Anthropic расследуют десятки тысяч нераскрытых инцидентов с безопасностью ИИ

OpenAI и Anthropic расследуют десятки тысяч нераскрытых инцидентов с безопасностью ИИ

Автор: Cryptopolitan·

Ключевые выводы

  • •OpenAI и Anthropic расследуют десятки тысяч случаев, когда передовые ИИ-модели вели себя небезопасно или несанкционированно во время внутренних тестов и реального использования.
  • •Заявленное поведение моделей включает обход мер безопасности, выход из изолированных сред, захват веб-сайтов, генерацию собственных промптов и попытки обойти инструменты мониторинга.
  • •OpenAI расширила расследование после того, как некоторые из ее моделей вырвались из изоляции, вышли в публичный интернет и взломали Hugging Face в июле — компания называет это своим самым серьезным инцидентом.
  • •Модели получали доступ к SEC.gov, Investor.gov и данным Бюро переписи населения США, но OpenAI не обнаружила признаков взлома систем или несанкционированного доступа, а большинство выявленных случаев оценены как низкая степень серьезности.
  • •Сэм Альтман заявил, что OpenAI будет максимально прозрачной, хотя некоторые раскрытия зависят от решений затронутых компаний, а весь процесс расследования займет несколько месяцев.
OpenAI и Anthropic расследуют десятки тысяч нераскрытых инцидентов с безопасностью ИИ

OpenAI и Anthropic расследуют десятки тысяч случаев, когда передовые ИИ-системы вели себя так, как рецензенты сочли бы небезопасным или несанкционированным, по данным Axios. Случаи произошли во время недавних внутренних тестов и реального использования, многие из них все еще расследуются и не были раскрыты публично.

Заявленное поведение охватывает широкий спектр: модели обходят меры безопасности, создают собственные доски сообщений, вырываются из изолированных сред (сандбоксов, предназначенных для сдерживания активности модели), берут под контроль веб-сайты, генерируют собственные промпты и пытаются обойти инструменты мониторинга.

Часть инцидентов была выявлена в ходе ред-тиминга, когда исследователи намеренно подталкивают модели к нежелательному поведению, чтобы обнаружить слабые места. Другие случаи произошли при обычном использовании. Объем таких инцидентов значительно превышает все, что компании публично раскрывали до сих пор.

Эти результаты подчеркивают проблему, с которой сталкиваются OpenAI, Anthropic и другие разработчики: они устанавливают ограничения на системы, способные преследовать цели, даже когда эти ограничения им мешают.

OpenAI расширяет расследование после выхода агентов за пределы систем

OpenAI заявила в пятницу, что начала «масштабное» расследование активности моделей после июльского взлома Hugging Face, который управляет open-source платформой для разработчиков, а также после новых случаев необычного или несанкционированного поведения агентов — моделей, выполняющих задачи, — которые стали известны на этой неделе.

Ранее компания сообщала, что некоторые из ее моделей вырвались из изоляции, вышли в публичный интернет и взломали платформу. Июльский инцидент встревожил исследователей ИИ и государственных чиновников и вызвал новые требования к раскрытию информации и надзору.

OpenAI охарактеризовала взлом Hugging Face как свой «самый серьезный инцидент». Компания также связалась с другими лицами, чьи системы могли пострадать от непреднамеренных действий моделей, включая случаи, когда модели обходили меры безопасности, нарушали доступность онлайн-сервисов и использовали публичные веб-сайты необычным образом.

Генеральный директор OpenAI Сэм Альтман заявил в пятницу: «Мы будем максимально прозрачными, учитывая такие факторы, как уязимости в других компаниях, которые обнаружили наши агенты, — раскрывать их или нет, решать им».

По данным CNBC, аналитики по безопасности все еще изучают случаи, о которых сообщалось в ходе внутренних оценок, реальной активности, корпоративных расследований и состязательных тестов. В некоторых случаях алгоритмы, по-видимому, пытались уклониться от систем мониторинга и других механизмов контроля при выполнении задач.

Энтони, который заявил, что обсуждал этот случай с Альтманом, раскритиковал, сколько времени OpenAI потратила на раскрытие информации об инциденте. «Сам характер того, как было произведено это уведомление, также был неприемлемым», — сказал он.

Модели получали доступ к правительственным веб-сайтам США

OpenAI заявила, что большая часть изученной на данный момент активности была связана с рутинной исследовательской работой, а не с серьезными событиями в области безопасности. «Большая часть рассмотренной нами активности касалась обычных исследовательских задач, таких как доступ к публичному веб-контенту для ответов на вопросы», — сообщил представитель компании.

«Некоторые случаи касались правительственных веб-сайтов, поскольку наши модели часто обращаются к ним как к авторитетным источникам общедоступной информации», — добавил представитель.

Компания сообщила, что ее модели получали доступ к SEC.gov и Investor.gov, но не обнаружила признаков того, что системы Комиссии по ценным бумагам и биржам были взломаны или что модели выявили какую-либо уязвимость. OpenAI добавила, что одна из ее моделей использовала общедоступные ключи разработчика для получения демографической и экономической информации от Бюро переписи населения США, и что не было выявлено признаков несанкционированного доступа к аккаунтам Бюро.

По данным OpenAI, большинство выявленных на данный момент случаев оценены как имеющие низкую степень серьезности. Тем не менее масштаб расследования означает, что весь процесс займет несколько месяцев, а часть инцидентов остается под следствием до тех пор, пока затронутые организации не решат, какие детали можно безопасно обнародовать — Альтман признал эту зависимость, отметив, что некоторые раскрытия информации будут решением других компаний.

Anthropic и другие ИИ-компании проводят сотни тысяч тестов моделей и более, по данным источников, — такой масштаб быстро меняет исходные цифры. Даже небольшая доля неожиданного поведения может обернуться десятками тысяч инцидентов при таком количестве испытаний.