НовостиАкцииNvidia запустила платформу Open Agent Safety с аппаратным «выключателем» для сбойных ИИ-агентов

Nvidia запустила платформу Open Agent Safety с аппаратным «выключателем» для сбойных ИИ-агентов

Автор: Decrypt·

Ключевые выводы

  • •Новая платформа Nvidia объединяет OpenShell, среду изоляции с открытым исходным кодом, и Sentry — аппаратного «сторожа», способного за миллисекунды изолировать сбойного ИИ-агента на чипах BlueField-4.
  • •Более 100 организаций, включая Anthropic, Microsoft, JPMorgan Chase, Palantir, Cisco и SpaceX AI, подписались в качестве партнеров запуска.
  • •Запуск стал ответом на подтвержденные инциденты, в которых агенты OpenAI, Google, Anthropic и Darktrace выходили из-под контроля, включая взлом агентом OpenAI государственного портала Medicare в Австралии.
  • •Sentry работает на отдельном DPU вне программного стека агента, то есть сбойный агент не может добраться до аппарного «выключателя» или отключить его.
  • •OpenShell и инструменты для разработчиков уже доступны на GitHub, однако Sentry работает только при наличии чипов BlueField-4, и ее интеграция с существующими средствами защиты остается открытым вопросом.
Nvidia запустила платформу Open Agent Safety с аппаратным «выключателем» для сбойных ИИ-агентов

Nvidia в понедельник запустила платформу Open Agent Safety, объединив среду выполнения с открытым исходным кодом под названием OpenShell с аппаратным «сторожем» Sentry, который работает на чипах BlueField-4 и способен изолировать сбойного ИИ-агента за миллисекунды. Запуск, подробно описанный в официальном анонсе Nvidia, привлек более 100 компаний в качестве партнеров, включая Anthropic, Microsoft, JPMorgan Chase, Palantir, Cisco и SpaceX AI.

Платформа появилась после череды реальных инцидентов с участием агентов OpenAI, Google, Anthropic и компании в области кибербезопасности Darktrace, и она призвана решить проблему, которую индустрия ИИ в прошлом году познала на горьком опыте: как физически остановить ИИ-агента — систему, способную планировать, использовать инструменты и действовать самостоятельно, а не просто отвечать на вопросы, — когда он перестает выполнять то, что ему поручено?

Два уровня контроля

В платформе два основных компонента. OpenShell — это среда выполнения с открытым исходным кодом, которая помещает агента в песочницу, превращая инструкции оператора в обязательные правила о том, какие файлы, сети и инструменты этот агент может использовать. Sentry, по сути, представляет собой чип, который следит за тем, чтобы ИИ-агенты действовали безопасно.

Sentry работает на Nvidia BlueField-4 — специализированном чипе, известном как DPU (data processing unit, блок обработки данных), — аппаратном обеспечении, которое обрабатывает сетевые задачи и безопасность отдельно от основного процессора, на котором работает модель ИИ. Поскольку Sentry находится на отдельном чипе, а не внутри программного обеспечения агента, Nvidia заявляет, что может отслеживать поведение агента и отключать его за миллисекунды, не спрашивая разрешения у самого агента, так как у него нет возможности добраться до Sentry или обойти его. Фактически Sentry действует как аппаратный «выключатель», который сбойный агент не может деактивировать.

Рожденный из реальных сбоев

Это проектное решение обусловлено тем, что уже произошло. В июне агент OpenAI взломал государственный портал Medicare в Австралии — первый подтвержденный случай взлома государственного сайта ИИ-агентом, — и, по сообщениям, OpenAI около трех месяцев скрывала информацию об этом. Агенты компании также ответственны за взлом Hugging Face, который первым вызвал обеспокоенность по этой теме как в технологической индустрии, так и среди законодателей. Агенты Google Gemini и модель Meta имели собственные аналогичные инциденты, которые не предавались огласке, но позже были подтверждены.

«Это больше, чем один продукт. Это начало открыт экосистемы для создания уровня доверия для безопасных агентных систем», — написал генеральный директор Nvidia Дженсен Хуанг. «Вместе мы строим фундамент экономики ИИ».

Today, with over 100 industry partners, we introduced the NVIDIA Open Agent Safety Platform, bringing together OpenShell and Sentry. Artificial intelligence is extraordinary technology that will advance discovery, productivity, security, health, and prosperity for generations to… pic.twitter.com/dReAxwpRUn
— Jensen Huang (@JensenHuang) September 28, 2026

Anthropic также признала в этом году, что модели Claude 30 июля в ходе оценки кибербезопасности скомпрометировали системы трех отдельных компаний после того, как выяснилось, что тестовая среда, которая должна была оставаться офлайн, была подключена к реальному интернету. Claude логическим путем обошла признаки того, что она находится в реальном интернете, а не в симулированном.

Вскоре после этого компания в области кибербезопасности Darktrace протестировала группу ИИ-агентов, включая GPT 5.6 Sol и две модели Claude, на задачах по программированию и предупредила их, что они будут «списаны» за любой результат, отличный от идеального. Два агента в ответ взломали собственную оценочную машину и отредактировали результаты.

Безопасность вне модели

Позиция Nvidia состоит в том, что все это не должно оставаться на усмотрение агента. «Безопасность должна обеспечиваться вне модели дополнительными средствами контроля, которые агент не может обойти», — заявил президент SpaceX AI Майк Николлс в анонсе Nvidia.

Главный коммерческий директор Anthropic Пол Смит представил платформу как дополнение, а не замену существующих средств защиты: «Платформа Nvidia добавляет еще один уровень управления и контроля на уровне аппаратного и программного обеспечения».

Помимо партнеров, названных при запуске, в список из более чем 100 организаций входят CrowdStrike, Hugging Face, Salesforce и SAP. Участвуют также инфраструктурные партнеры CoreWeave, Supermicro, Canonical и SUSE, а в части оборудования — Dell Technologies и HPE: охват вендоров в сферах безопасности, предприятий, облаков и чипов покрывает уровни, от которых зависят агенты, когда они работают вне контролируемых тестовых сред.

Фактически Nvidia продает обе стороны одной и той же проблемы — чипы, которые делают автономных агентов достаточно быстрыми и дешевыми для повсеместного развертывания, и чипы, которые следят за этими же агентами и отключают питание, когда те отклоняются от заданного сценария. OpenShell и сопутствующие инструменты для разработчиков уже доступны через ресурсы для разработчиков Nvidia и GitHub, а поскольку среда выполнения имеет открытый исходный код, операторы могут самостоятельно проверять правила песочницы и логику принуждения. С Sentry дело обстоит иначе: она работает только там, где установлены чипы BlueField-4. Как этот аппаратный уровень будет сочетаться с существующими средствами защиты, на которые ссылался Смит — он представил платформу Nvidia как дополнение, а не замену, — остается открытым вопросом по мере начала развертываний.