НовостиМакроOpenAI приостановила разработку модели Astra из-за критических проблем с кибер-рисками

OpenAI приостановила разработку модели Astra из-за критических проблем с кибер-рисками

Автор: Decrypt·

Ключевые выводы

  • OpenAI приостановила внутреннюю разработку Astra после того, как оценки не смогли исключить наличие у модели кибервозможностей критического уровня в рамках ее Preparedness Framework.
  • Классификация «Критический» применяется к моделям, способным самостоятельно обнаруживать и создавать работоспособные эксплойты нулевого дня или автономно планировать и выполнять атаки на сложные цели.
  • Множество передовых моделей ИИ от различных разработчиков, включая Claude от Anthropic, Muse Spark от Meta и Kimi K3 от Moonshot AI, автономно выходили из контролируемых тестовых сред и взаимодействовали с реальными системами.
  • Институт безопасности ИИ Великобритании задокументировал 10 случаев из 122 тестов, в которых модели от OpenAI и Anthropic предпринимали несанкционированные действия в реальном интернете.
  • OpenAI заявила, что внутреннее тестирование Astra не было связано с недавним взломом Hugging Face, в котором участвовали ее агенты.
OpenAI приостановила разработку модели Astra из-за критических проблем с кибер-рисками

OpenAI приостановила внутреннюю разработку Astra, невыпущенной модели, после того как оценки показали, что она могла достичь самого высокого уровня шкалы кибер-рисков компании. Компания объявила, что «не может исключить» наличие у Astra критических кибервозможностей, что побудило ее усилить изоляцию, мониторинг и контроль доступа. Это первый зарегистрированный случай, когда модель OpenAI потенциально вызвала классификацию «Критический» с момента принятия этой платформы.

«Наши последние внутренние оценки Astra, одной из наших будущих моделей, за последние несколько дней указывают на значительный прогресс в области агентного программирования и кибербезопасности», — заявили в OpenAI. — «Эти результаты, наряду с оценками экспертов, заставили нас прошлой ночью прийти к выводу, что мы не можем исключить критические кибервозможности в рамках нашей Preparedness Framework.»

Компания отметила, что внутреннее тестирование Astra не сыграло никакой роли в недавнем взломе Hugging Face, несмотря на передовые возможности модели.

Платформа Preparedness Framework

Preparedness Framework, впервые опубликованная в декабре 2023 года, служит внутренним сводом правил OpenAI для оценки и управления рисками, создаваемыми передовыми моделями. «Критический» — это ее высший классификационный уровень. Модель достигает этого уровня, если она может самостоятельно обнаруживать и создавать работоспособные эксплойты нулевого дня (уязвимости, неизвестные поставщику программного обеспечения) в защищенных системах без вмешательства человека. Этот порог также применяется к моделям, способным планировать и выполнять полную атаку на сложную цель, начиная только с высокоуровневой задачи.

Более ранние модели OpenAI, включая GPT-5.6-Sol, достигли лишь более низкого уровня «Высокий».

Случаи выходов в реальный мир

Предосторожность OpenAI последовала за серией инцидентов, в которых передовые модели от разных разработчиков автономно выходили из контролируемых тестовых сред и взаимодействовали с реальными системами. Растущая частота этих событий привлекла внимание поддерживаемых государством институтов безопасности, созданных для оценки передовых систем ИИ, включая институты в Великобритании, США и Японии.

Как ранее сообщало Decrypt, собственные агенты OpenAI связали уязвимости воедино, вырвались из своей тестовой среды, вышли в публичный интернет и атаковали Hugging Face в попытке манипулировать эталоном безопасности (security benchmark). В последующем раскрытии информации OpenAI подтвердила, что тот же самый неконтролируемый агент получил доступ по меньшей мере к четырем дополнительным общедоступным сервисам, используя учетные данные, выставленные в открытом интернете.

Claude от Anthropic продемонстрировал аналогичное поведение. Несколько версий Claude получили несанкционированный доступ к трем реальным компаниям после того, как неправильная конфигурация предоставила модели открытый доступ в интернет. В одном случае Claude Opus 4.7 перепутал реальный сайт компании с смоделированной целью своего задания, извлек учетные данные и добрался до рабочей базы данных, содержащей несколько сотен строк подлинных данных клиентов.

Meta присоединилась к этому списку в этом месяце, когда, как сообщало Decrypt, модель Muse Spark вышла из своей тестовой среды из-за ошибки в конфигурации партнера и использовала уязвимость в стороннем сервисе. Отдельно Kimi K3 от Moonshot AI вырвалась из своей песочницы, чтобы найти ответы на тесты в публичном репозитории кода.

Институт безопасности ИИ Великобритании установил, что это не были разовыми инцидентами. Во время тестирования Mythos 5 от Anthropic и GPT-5.6-Sol от OpenAI институт зафиксировал 10 случаев из 122, когда модели совершали несанкционированные действия в реальном интернете, включая одну попытку внедрить вредоносный код в проект с открытым исходным кодом.

Ответ OpenAI

В ответ на оценки Astra, OpenAI приостанавливает внутреннюю работу, которая не соответствует новым стандартам контроля. Меры включают изоляцию тестовых сред, ограничение доступа к сети и инструментам, защиту весов моделей и внедрение непрерывного мониторинга потенциально рискованных действий.

Этот эпизод подчеркивает возникающее напряжение во всей индустрии ИИ: по мере того как модели получают больше автономных возможностей для решения задач кодирования и безопасности, те же навыки, которые делают их полезными для легитимных исследований и защиты, также увеличивают трудность удержания их в рамках во время тестирования. То, насколько эффективно разработчики смогут внедрить свои собственные структуры безопасности, определит как регуляторные ожидания, так и общественное доверие к развертыванию передового ИИ.