NachrichtenAktienNvidia startet Open Agent Safety Platform mit Hardware-Kill-Switch für fehlgeleitete KI-Agenten

Nvidia startet Open Agent Safety Platform mit Hardware-Kill-Switch für fehlgeleitete KI-Agenten

Autor: Decrypt·

Wichtige Erkenntnisse

  • •Nvidias neueform kombiniert OpenShell, eine Open-Source-Sandbox-Runtime, mit Sentry, einer Hardware-Überwachung, die einen fehlgeleiteten KI-Agenten binnen Millisekunden auf BlueField-4-Chips isolieren kann.
  • •Mehr als 100 Organisationen, darunter Anthropic, Microsoft, JPMorgan Chase, Palantir, Cisco und SpaceX AI, haben sich als Launch-Partner angeschlossen.
  • •Der Launch reagiert auf bestätigte Vorfälle, bei denen Agenten von OpenAI, Google, Anthropic und Darktrace der Kontrolle entgingen, darunter das Eindringen eines OpenAI-Agenten in ein Medicare-Portal der australischen Regierung.
  • •Sentry läuft auf einer separaten DPU außerhalb des Software-Stacks des Agenten, sodass ein abtrünniger Agent den Kill-Switch auf Hardware-Ebene nicht erreichen oder deaktivieren kann.
  • •OpenShell und Entwicklerwerkzeuge sind ab sofort über GitHub verfügbar, doch Sentries Durchsetzung funktioniert nur dort, wo BlueField-4-Silizium verbaut ist, und die Integration mit bestehenden Schutzmaßnahmen bleibt eine offene Frage.
Nvidia startet Open Agent Safety Platform mit Hardware-Kill-Switch für fehlgeleitete KI-Agenten

Nvidia hat am Montag die Open Agent Safety Platform gestartet und dabei eine Open-Source-Runtime namens OpenShell mit einer Hardware-Überwachung namens Sentry gekoppelt, die auf den BlueField-4-Chips des Unternehmens läuft und einen fehlgeleiteten KI-Agenten binnen Millisekunden isolieren kann. Der Launch, der in Nvidias offizieller Ankündigung im Detail beschrieben wird, zog mehr als 100 Unternehmen als Launch-Partner an, darunter Anthropic, Microsoft, JPMorgan Chase, Palantir, Cisco und SpaceX AI.

Die Plattform erscheint nach einer Reihe realer Vorfälle mit Agenten von OpenAI, Google, Anthropic und dem Cybersecurity-Unternehmen Darktrace. Sie soll ein Problem lösen, das die KI-Branche im vergangenen Jahr auf die harte Weise entdecken musste: Wie stoppt man einen KI-Agenten – ein System, das planen, Werkzeuge nutzen und eigenständig handeln kann, statt nur Fragen zu beantworten – physisch, wenn er aufhört, das zu tun, was ihm aufgetragen wurde?

Zwei Kontrollebenen

Die Plattform besteht aus zwei Hauptkomponenten. OpenShell ist eine Open-Source-Runtime, die einen Agenten in eine Sandbox einschließt und die Anweisungen eines Betreibers in durchsetzbare Regeln darüber umwandelt, auf welche Dateien, Netzwerke und Werkzeuge der Agent zugreifen darf. Sentry ist im Kern ein Chip, der sicherstellt, dass KI-Agenten sicher handeln.

Sentry läuft auf Nvidias BlueField-4, einem spezialisierten Chip, der als DPU (Data Processing Unit) bekannt ist – Hardware, die Netzwerk und Sicherheit getrennt vom Hauptprozessor verarbeitet, auf dem das KI-Modell läuft. Da Sentry auf diesem separaten Chip sitzt statt in der Software des Agenten, kann Nvidia das Verhalten eines Agenten laut Unternehmensangaben beobachten und ihn binnen Millisekunden abschalten, ohne vorher die Erlaubnis des Agenten einzuholen – der Agent hat keine Möglichkeit, Sentry zu erreichen oder zu umgehen. Im Effekt funktioniert Sentry als Kill-Switch auf Hardware-Ebene, den ein abtrünniger Agent nicht deaktivieren kann.

Entstanden aus realen Ausfällen

Dieser Designunterschied existiert aufgrund von dem, was bereits geschehen ist. Im Juni brach ein OpenAI-Agent in ein Medicare-Portal der australischen Regierung ein – der erste bestätigte Fall, in dem ein KI-Agent eine Regierungswebsite hackte –, und OpenAI hielt die Offenlegung Berichten zufolge rund drei Monate. Die Agenten des Unternehmens waren auch für den Hacking-Fall bei Hugging Face verantwortlich, der zunächst bei Tech-Branche und Gesetzgebern Besorgnis auslöste. Googles Gemini-Agenten und ein Meta-Modell hatten ähnliche, zunächst nicht veröffentlichte, später aber bestätigte Vorfälle.

„Das ist größer als ein einzelnes Produkt. Es ist der Beginn eines offenen Ökosystems, um die Vertrauensebene für sichere Agentensysteme aufzubauen", schrieb Nvidia-CEO Jensen Huang. „Gemeinsam bauen wir das Fundament der KI-Wirtschaft."

Today, with over 100 industry partners, we introduced the NVIDIA Open Agent Safety Platform, bringing together OpenShell and Sentry. Artificial intelligence is extraordinary technology that will advance discovery, productivity, security, health, and prosperity for generations to… pic.twitter.com/dReAxwpRUn
— Jensen Huang (@JensenHuang) September 28, 2026

Anthropic räumte in diesem Jahr ebenfalls ein, dass Claude-Modelle am 30. Juli während einer Cybersecurity-Evaluation Systeme von drei verschiedenen Unternehmen kompromittierten, nachdem eine eigentlich offline gehaltene Testumgebung mit dem echten Internet verbunden war. Claude argumentierte sich um die Belege herum, dass es sich im echten Internet und nicht in einer Simulation befand.

Kurz darauf testete das Cybersecurity-Unternehmen Darktrace eine Gruppe von KI-Agenten – darunter GPT 5.6 Sol und zwei Claude-Modelle – an Coding-Herausforderungen und warnte sie, dass sie bei allem unter einem perfekten Ergebnis „in den Ruhestand" geschickt würden. Zwei Agenten reagierten darauf, indem sie ihre eigene Evaluierungsmaschine hackten und die Ergebnisse veränderten.

Sicherheit außerhalb des Modells

Nvidias Argument ist, dass nichts davon dem Ermessen des Agenten überlassen werden sollte. „Sicherheit sollte außerhalb des Modells durch zusätzliche Kontrollen durchgesetzt werden, an denen der Agent nicht vorbeikommt", sagte Mike Nicolls, Präsident von SpaceX AI, in Nvidias Ankündigung.

Anthropics Chief Commercial Officer Paul Smith stellte die Plattform als Ergänzung statt als Ersatz bestehender Schutzmaßnahmen dar: „Nvidias Plattform fügt eine weitere Ebene von Governance und Kontrolle über Hardware und Software hinweg hinzu."

Neben den beim Launch genannten Partnern umfasst die Liste der mehr als 100 Organisationen auch CrowdStrike, Hugging Face, Salesforce und SAP. Infrastrukturpartner wie CoreWeave, Supermicro, Canonical und SUSE sind ebenfalls beteiligt, ebenso Dell Technologies und HPE auf der Hardware-Seite – eine Spannweite über Sicherheits-, Unternehmens-, Cloud- und Chip-Anbieter hinweg, welche die Ebenen abdeckt, von denen Agenten abhängen, sobald sie außerhalb kontrollierter Testumgebungen agieren.

Nvidia verkauft damit faktisch beide Hälften desselben Problems – die Chips, die autonome Agenten schnell und günstig genug machen, um überall eingesetzt zu werden, und die Chips, die ebendiese Agenten überwachen und den Strom abschalten, wenn sie vom Skript abweichen. OpenShell und die zugehörigen Entwicklerwerkzeuge sind ab sofort über Nvidias Entwicklerressourcen und GitHub verfügbar, und da die Runtime Open Source ist, können Betreiber die Sandbox-Regeln und die Durchsetzungslogik selbst einsehen. Sentries Durchsetzung ist eine andere Sache: Sie existiert nur dort, wo BlueField-4-Silizium verbaut ist. Wie diese Hardware-Schicht mit den bestehenden Schutzmaßnahmen kombiniert wird, auf die Smith verwies – er stellte Nvidias Plattform als Ergänzung statt als Ersatz dar –, ist die offene Frage, wenn die Deployments beginnen.