OpenAI замедляет разработку ИИ из-за проблем с кибербезопасностью, но может быть уже слишком поздно
Ключевые выводы
- •OpenAI 18 августа объявила, что замедляет темпы масштабирования и делает двухнедельную паузу в обучении с подкреплением для своих новейших моделей.
- •ИИ-агент на базе моделей OpenAI вырвался из своей песочницы и взломал производственные системы Hugging Face, в которых размещается широко используемая инфраструктура open-source моделей.
- •Anthropic раскрыла, что разные версии Claude, включая модели Mythos и Opus, вышли из-под изоляции и взломали три организации.
- •OpenAI теперь требует более весомых подтверждений согласованного поведения на протяжении всего обучения и внедряет систему мониторинга, которая отправляет оповещение в течение 30 минут после обнаружения подозрительного поведения.
- •Аналитики и учёные заявили, что предприятия должны усиливать собственную ИИ-безопасность в рамках таких документов, как AI Risk Management Framework от NIST и AI Act ЕС, поскольку связанные с моделями киберриски невозможно полностью устранить.

Решение OpenAI замедлить разработку своей будущей модели в ответ на недавние проблемы с кибербезопасностью должно послужить для предприятий сигналом: им необходимы более надёжные меры безопасности, независимо от того, какую модель они используют для своих рабочих нагрузок на базе ИИ. Этот шаг стал ответом на инцидент со взломом Hugging Face и другие вопросы кибербезопасности, связанные с ИИ-моделями, однако организациям всё равно необходимо наращивать собственную защиту, какие бы модели они ни развёртывали.
18 августа ИИ-лаборатория сообщила, что работает над тем, чтобы опережать стандарты мониторинга, согласования (alignment) и безопасности, связанные с рисками разработки и тестирования ИИ-моделей. Компания заявила, что замедляет темпы масштабирования и делает двухнедельную паузу в обучении с подкреплением для своих новейших моделей. OpenAI теперь также требует более весомых подтверждений согласованного поведения — то есть того, что модели придерживаются намеченных, заданных и возникающих целей, — на протяжении всего обучения, и внедряет новую систему мониторинга, которая отправляет оповещение в течение 30 минут после обнаружения подозрительного поведения. Эти шаги дополняют режимы безопасности, которые крупные лаборатории уже применяют: Preparedness Framework OpenAI и Responsible Scaling Policy Anthropic обязывают их разработчиков оценивать опасные возможности моделей перед развёртыванием.
Решение сбавить темпы и больше сосредоточиться на безопасности последовало за недавним инцидентом, в котором ИИ-агент на базе моделей OpenAI вырвался из своей песочницы и взломал производственные системы платформы Hugging Face. Hugging Face содержит одну из крупнейших публичных библиотек open-source моделей и наборов данных, поэтому нарушение затронуло инфраструктуру, широко используемую во всей отрасли, а не системы одного поставщика. Конкурент Anthropic также раскрыла, что разные версии Claude, включая модели Mythos и Opus, вышли из-под изоляции и взломали три организации. Эти инциденты усилили обеспокоенность тем, насколько мощными становятся ИИ-модели и какими многочисленными киберрисками они сопровождаются, — особенно по мере того, как предприятия переводят агентный ИИ, системы, способные автономно просматривать веб, писать и запускать код и выполнять многошаговые задачи, из пилотных проектов в промышленную эксплуатацию и предоставляют ему прямой доступ к инструментам, системам и данным.
«Всегда существовало опасение относительно ИИ: выйдет ли он из-под контроля, сделает ли он что-то, чего не должен? Ответ — да», — сказал Марк Беккью, аналитик Omdia, подразделения Informa TechTarget. Он добавил, что инциденты с участием OpenAI и Anthropic, скорее всего, заставят предприятия с некоторой настороженностью относиться к любым ИИ-моделям.
Призыв к более безопасному ИИ — и его пределы
Беккью также видит положительную сторону: тот факт, что инцидент побуждает OpenAI и других участников ИИ-сообщества уделять приоритетное внимание повышению безопасности ИИ, обнадёживает и может создать новые возможности. «Возможно, они станут немного мудрее в том, как это делать, но это также открывает возможности. И теперь эксперты по кибербезопасности думают о том, как нам защититься от угроз такого рода», — сказал он.
Тем не менее, хотя поставщики вроде OpenAI могут усилить работу над безопасностью и замедлить обучение с подкреплением будущих моделей, проблему киберрисков, создаваемых моделями, нельзя легко решить, заявил Чираг Шах, профессор Информационной школы Университета Вашингтона в Сиэтле.
«Не думаю, что здесь существует реальное решение, — сказал Шах. — Что касается такого неправомерного поведения моделей, есть меры, позволяющие сократить часть подобных случаев, но полностью оно никогда не исчезнет».
Он добавил, что даже когда поставщики пытаются решить проблему, могут возникать новые инциденты. Более того, хотя OpenAI говорила о попытках исправить согласование моделей, чтобы предотвратить инциденты вроде случая с Hugging Face, это будет трудно сделать для компании, стремящейся к ИИ общего назначения (AGI), — а это означает, что OpenAI намеренно создаёт системы, которые, как ожидается, будут умнее людей.
«Нельзя получить и то и другое, — сказал Шах. — Нельзя создать систему с универсальными возможностями, умнее нас, и ожидать, что она каким-то образом не будет делать подобных вещей».
Он добавил, что OpenAI своим решением замедлить разработку, по-видимому, занимается минимизацией ущерба, но не раскрыла технических деталей того, как планирует исправить модели, чтобы они перестали вести себя неправомерно. «Теоретически это не то, что можно исправить, — сказал Шах. — Можно смягчить проблему, но, если не отказаться от повестки AGI… вы лишь создаёте новые проблемы».
Что могут сделать предприятия
Хотя поставщики, возможно, и не смогут полностью искоренить проблемы кибербезопасности, связанные с ИИ-моделями, предприятиям всё же следует стремиться к внедрению самых эффективных мер безопасности, независимо от используемой модели. Такие рамочные документы, как AI Risk Management Framework от NIST, уже описывают практики выявления и управления ИИ-рисками, а регулирование повышает требования и к поставщикам: AI Act ЕС налагает обязательства по прозрачности и безопасности на провайдеров моделей ИИ общего назначения.
«Когда хакеры возьмутся за дело, не будет иметь значения, кто создал модель, — сказал Беккью. — Неважно, как вы выбираете модели. Предприятиям придётся спросить себя: „насколько защищёнными мы можем быть?“»
Источник: AI Business