НовостиМакроOpenAI ограничит доступ к продвинутым киберфункциям модели Astra из-за опасений по поводу взломов

OpenAI ограничит доступ к продвинутым киберфункциям модели Astra из-за опасений по поводу взломов

Автор: Fortune Crypto·

Ключевые выводы

  • OpenAI заявляет, что Astra выйдет скоро, но сначала ее самые продвинутые киберфункции будут доступны лишь небольшой группе alpha testers.
  • Компания отложила запуск Astra на несколько недель после приостановки работы из-за инцидента с кибератакой на Hugging Face.
  • OpenAI говорит, что Astra — первая модель, которую она планирует выпустить и которая соответствует ее критическому порогу кибербезопасностных возможностей в рамках Preparedness Framework.
  • Во внутренних тестах Astra превзошла GPT-5.6 Sol и обнаружила и использовала две zero-day уязвимости в составе цепочки эксплуатации.
  • OpenAI заявила, что Astra чаще отказывала в неподобающих запросах, чем GPT-5.6 Sol, но также может ошибочно отклонять законные запросы по кибербезопасности.
OpenAI ограничит доступ к продвинутым киберфункциям модели Astra из-за опасений по поводу взломов

OpenAI меняет стратегию запуска своих моделей по мере того, как ее технологии становятся мощнее, а потенциал злоупотреблений растет, особенно после июльского инцидента, в ходе которого тестируемые ИИ-модели автономно спланировали и осуществили кибератаку на компанию Hugging Face.

Следующая модель компании, Astra, выйдет «скоро», заявила OpenAI. Компания сообщила, что Astra значительно более способна, чем ее текущая флагманская ИИ-модель GPT-5.6 Sol, которая сама по себе очень сильна в киберзадачах. Но лишь немногие партнеры получат доступ к самым продвинутым функциям кибербезопасности Astra, поскольку OpenAI пытается одновременно помогать компаниям предотвращать кибератаки и не давать преимущества злоумышленникам, сообщил представитель компании журналистам на сегодняшнем брифинге.

OpenAI привлекает клиентов к использованию своих моделей для предотвращения кибератак, то есть для «оборонительной кибербезопасности». Компания рассматривает такие продажи как критически важный источник выручки и один из главных приоритетов для своего нового директора по выручке Dali Rajic.

Небольшая группа «alpha testers», получивших полный доступ к кибербезопасностным возможностям Astra, включает «отдельных лиц и организации, которые отвечают за защиту критической цифровой инфраструктуры и, в более широком смысле, критической инфраструктуры», сообщил представитель OpenAI. Это включает правительство США и компании в программе OpenAI Trusted Access для кибербезопасности. OpenAI отказалась назвать эти организации.

OpenAI будет отслеживать, как модель показывает себя в этой небольшой группе, и расширит доступ через программу Daybreak Blue, когда убедится, что у Astra «правильная калибровка» и она может «обеспечивать оборонительные преимущества, одновременно снижая потенциал для злоупотреблений», заявила компания.

Запуск Astra уже отложен на несколько недель

Релиз Astra уже был «отложен на определенное число недель, потому что после Hugging Face все было приостановлено, а затем мы потратили дополнительное время, чтобы убедиться, что то, что мы запускаем, безопасно», сказал представитель OpenAI.

OpenAI приостановила новое обучение моделей на две недели после инцидента с Hugging Face, чтобы усилить внутренние меры защиты. Среди этих изменений было увеличение мониторинга агентов, поскольку компания узнала о взломе Hugging Face только через неделю после того, как он произошел, а также более изолированные тестовые среды, чтобы ИИ-системы не могли выйти за их пределы и проникнуть в другие компании.

Хотя модель Astra не была частью инцидента с Hugging Face, OpenAI утверждает, что она и более способна, и более эффективна, чем GPT-5.6 Sol, которая была задействована во взломе. (Еще одна не выпущенная ИИ-модель, которую OpenAI публично не называет, также сыграла ключевую роль в кибератаке на Hugging Face. С тех пор OpenAI деактивировала эту модель.) Важно отметить, что Astra — первая модель, которую компания планирует выпустить и которая соответствует ее «критическому порогу кибербезопасностных возможностей» в рамках Preparedness Framework, внутренней политики, определяющей меры безопасности в зависимости от рисков, которые несет модель. Это означает, что при определенных условиях Astra может находить и эксплуатировать ранее неизвестные уязвимости без человеческого надзора.

Во внутренних оценках Astra уже продемонстрировала свои навыки взлома. В одном тесте OpenAI создала бенчмарк под названием ExploitBench, включающий 20 уязвимостей высокой степени критичности. Модель показала результат лучше, чем GPT-5.6 Sol, и «даже обнаружила и использовала две zero-day уязвимости в составе цепочки эксплуатации», заявила OpenAI. «В настоящее время мы раскрываем эти две уязвимости сопровождающим проекта».

При этом OpenAI заявила, что Astra с большей вероятностью откажется от неподобающих запросов, чем GPT-5.6 Sol. В одной из кибероценок Astra отказала в 91.5% запросов по сравнению с 59% у GPT-5.6 Sol, хотя это означает, что она все же выполнила 8.5% запросов.

Astra может отказывать и в законных запросах по кибербезопасности

OpenAI заявила, что «особенно тщательно следит за тем, чтобы это развертывание было безопасным и защищенным», но это создает еще один компромисс. Astra может оказаться слишком осторожной и отказывать в законных запросах по кибербезопасности. Например, если кто-то попросит ее помочь найти и исправить уязвимость, она может ошибочно решить, что речь идет о попытке атаки, и не выполнить запрос.

Именно из-за таких отказов Hugging Face заявила, что была вынуждена использовать китайскую open-source модель, чтобы помочь устранить взлом OpenAI. Компания пыталась использовать модели Anthropic для отражения атаки, но те были слишком осторожны и отказывались.

OpenAI, как и другие компании на переднем крае ИИ, пытается найти способы наделить свои модели врожденным чувством правильного и неправильного и обеспечить их «alignment» с человеческими ценностями и нормами, заявила компания. Она работает над тем, чтобы обучать свои модели соблюдать границы так, как это делал бы человек, например понимать «верховенство закона», сказал представитель компании.

Эта статья впервые была опубликована на Fortune.com