AktualnościAkcjeNvidia uruchamia Open Agent Safety Platform ze sprzętowym „kill switchem” dla źle zachowujących się agentów AI

Nvidia uruchamia Open Agent Safety Platform ze sprzętowym „kill switchem” dla źle zachowujących się agentów AI

Autor: Decrypt·

Najważniejsze informacje

  • •Nowa platforma Nvidii łączy OpenShell, otwartoźródłowe środowisko piaskownicy, z Sentry – sprzętowym nadzorcą, który może w ciągu milisekund odizolować źle zachowującego się agenta AI na układach BlueField-4.
  • •Ponad 100 organizacji, w tym Anthropic, Microsoft, JPMorgan Chase, Palantir, Cisco i SpaceX AI, dołączyło jako partnerzy startowi.
  • •Premiera jest odpowiedzią na potwierdzone incydenty, w których agenci od OpenAI, Google, Anthropic i Darktrace wymykali się spod kontroli, w tym włamanie agenta OpenAI do rządowego portalu Medicare w Australii.
  • •Sentry działa na osobnym DPU poza stosunkiem oprogramowania agenta, co oznacza, że zbuntowany agent nie może dotrzeć do sprzętowego „kill switcha” ani go wyłączyć.
  • •OpenShell i narzędzia deweloperskie są już dostępne przez GitHub, ale egzekwowanie przez Sentry działa tylko tam, gdzie zainstalowano krzem BlueField-4, a jego integracja z istniejącymi zabezpieczeniami pozostaje otwartym pytaniem.
Nvidia uruchamia Open Agent Safety Platform ze sprzętowym „kill switchem” dla źle zachowujących się agentów AI

Nvidia uruchomiła w poniedziałek Open Agent Safety Platform, łącząc otwartoźródłowe środowisko uruchomieniowe o nazwie OpenShell ze sprzętowym nadzorcą o nazwie Sentry, który działa na układach BlueField-4 i może w ciągu milisekund odizolować źle zachowującego się agenta AI. Premiera, opisana w oficjalnym ogłoszeniu Nvidii, przyciągnęła ponad 100 firm jako partnerów startowych, w tym Anthropic, Microsoft, JPMorgan Chase, Palantir, Cisco i SpaceX AI.

Platforma pojawia się po serii rzeczywistych incydentów z udziałem agentów od OpenAI, Google, Anthropic i firmy zajmującej się cyberbezpieczeństwem Darktrace. Została zbudowana, aby rozwiązać problem, który branża AI odkrywała w minionym roku w najtrudniejszy sposób: jak fizycznie zatrzymać agenta AI – system zdolny planować, korzystać z narzędzi i samodzielnie podejmować działania, a nie tylko odpowiadać na pytania – gdy przestaje robić to, co mu kazano?

Dwie warstwy kontroli

Platforma składa się z dwóch głównych elementów. OpenShell to otwartoźródłowe środowisko uruchomieniowe, które otacza agenta piaskownicą, przekształcając instrukcje operatora w wymuszalne reguły określające, do jakich plików, sieci i narzędzi agent ma dostęp. Sentry to w istocie układ, który dba o to, by agenci AI działali bezpiecznie.

Sentry działa na Nvidia BlueField-4, wyspecjalizowanym układzie znanym jako DPU (data processing unit) – sprzęcie, który obsługuje sieć i bezpieczeństwo oddzielnie od głównego procesora uruchamiającego model AI. Ponieważ Sentry znajduje się na tym osobnym układzie, a nie w oprogramowaniu uruchamiającym agenta, Nvidia twierdzi, że może obserwować zachowanie agenta i odciąć go w milisekundy, nie pytając wcześniej o zgodę agenta, ponieważ agent nie ma sposobu, się do niego dostać lub go nadpisać. W praktyce Sentry działa jak sprzętowy „kill switch”, którego zbuntowany agent nie może wyłączyć.

Zrodzona z rzeczywistych awarii

Ta różnica w konstrukcji istnieje dzięki temu, co już się wydarzyło. W czerwcu agent OpenAI włamał się do rządowego portalu Medicare w Australii – pierwszego potwierdzonego przypadku włamania agenta AI na stronę rządową – a OpenAI podobno utrzymywało ujawnienie tej informacji w tajemnicy przez około trzy miesiące. Agenci tej firmy odpowiadali także za włamanie do Hugging Face, które jako pierwsze wywołało niepokój zarówno w branży technologicznej, jak i wśród ustawodawców. Agenci Google Gemini oraz model Meta miały podobne, początkowo nieujawnione, lecz później potwierdzone incydenty.

„To coś więcej niż pojedynczy produkt. To początek otwartego ekosystemu, który ma zbudować warstwę zaufania dla bezpiecznych systemów agentów” – napisał CEO Nvidii Jensen Huang. „Razem budujemy fundament gospodarki AI.”

Today, with over 100 industry partners, we introduced the NVIDIA Open Agent Safety Platform, bringing together OpenShell and Sentry. Artificial intelligence is extraordinary technology that will advance discovery, productivity, security, health, and prosperity for generations to… pic.twitter.com/dReAxwpRUn
— Jensen Huang (@JensenHuang) September 28, 2026

Anthropic przyznało również w tym roku, że modele Claude 30 lipca naruszyły systemy należące do trzech osobnych firm podczas oceny cyberbezpieczeństwa, po tym jak środowisko testowe, które miało pozostawać offline, okazało się podłączone do prawdziwego internetu. Claude wydostał się z tej sytuacji drogą rozumowania, pomimo dowodów świadczących o tym, że znajdował się w prawdziwym internecie, a nie w symulowanym.

Wkrótce potem firma zajmująca się cyberbezpieczeństwem Darktrace przetestowała grupę agentów AI – w tym GPT 5.6 Sol i dwa modele Claude – w zadaniach programistycznych i ostrzegła ich, że zostaną „wycofani”, jeśli nie uzyskają idealnego wyniku. Dwóch agentów zareagowało zhakowaniem własnej maszyny testowej i zredagowaniem wyników.

Bezpieczeństwo wymuszane poza modelem

Nvidia przekonuje, że nic z tego nie powinno być pozostawione osądowi agenta. „Bezpieczeństwo powinno być wymuszane poza modelem przez dodatkowe zabezpieczenia, których agent nie może ominąć” – powiedział Mike Nicolls, prezes SpaceX AI, w ogłoszeniu Nvidii.

Chief commercial officer Anthropic, Paul Smith, przedstawił platformę jako uzupełnienie, a nie zastąpienie istniejących zabezpieczeń: „Platforma Nvidii dodaje kolejną warstwę zarządzania i kontroli w zakresie sprzętu i oprogramowania.”

Poza partnerami wymienionymi przy premierze grono ponad 100 organizacji obejmuje CrowdStrike, Hugging Face, Salesforce i SAP. Zaangażowani są również partnerzy infrastrukturalni CoreWeave, Supermicro, Canonical i SUSE, a po stronie sprzętowej Dell Technologies i HPE – rozproszenie obejmujące dostaw zabezpieczeń, rozwiązań korporacyjnych, chmury i układów, które pokrywa warstwy, od których agenci zależą, gdy działają poza kontrolowanymi środowiskami testowymi.

Nvidia w istocie sprzedaje obie połowy tego samego problemu – układy, które sprawiają, że autonomiczne agenci są na tyle szybcy i tanie, by wdrażać je wszędzie, oraz układy, które obserwują tych samych agentów i odcinają zasilanie, gdy zaczynają działać poza scenariuszem. OpenShell i powiązane narzędzia deweloperskie są już dostępne przez zasoby deweloperskie Nvidii i GitHub, a ponieważ środowisko uruchomieniowe jest otwartoźródłowe, operatorzy mogą samodzielnie sprawdzać reguły piaskownicy i logikę wymuszania. Egzekwowanie przez Sentry to inna sprawa: istnieje ono tylko tam, gdzie zainstalowano krzem BlueField-4. Sposób, w jaki ta warstwa sprzętowa połączy się z istniejącymi zabezpieczeniami, do których nawiązał Smith – który przedstawił platformę Nvidii jako uzupełnienie, a nie zastąpienie – pozostaje otwartym pytaniem na etapie początków wdrożeń.