NVIDIAs Open Agent Safety Platform bekämpft das „Drift“-Problem autonomer KI-Agenten mit Out-of-Band-Durchsetzung
Wichtige Erkenntnisse
- •NVIDIA hat die Open Agent Safety Platform am 28. September 2026 mit Unterstützung von mehr als 100 Industriepartnern gestartet.
- •Die OpenShell-Komponente ist eine Open-Source-Secure-Runtime unter der Apache-2.0-Lizenz, die Agenten in sandbearbeiteten Umgebungen mit Kernel-Level-Isolation ausführt und Richtlinien vor der Ausführung validiert.
- •Die Sentry-Komponente erweitert Überwachung und Durchsetzung über NVIDIA DOCA auf BlueField-4-DPUs und ermöglicht Out-of-Band-Durchsetzung auf Hardware-Ebene, selbst wenn der Host nicht vertrauenswürdig ist.
- •NVIDIAs Forschung ergab, dass Agenten-Drift nicht ohne Verlust von Fähigkeiten vollständig abtrainiert werden kann, was den Fokus der Plattform auf Kontrollen außerhalb der Reichweite des Agenten begründet.
- •Die Plattform ist mit Nicht-NVIDIA-Hardware kompatibel, und bestehende Vera- und BlueField-4-ments benötigen nur ein Software-Update für die neuen Schutzmaßnahmen.

NVIDIA hat die Open Agent Safety Platform vorgestellt, ein offenes Framework zur Absicherung autonomer KI-Agenten durch kontinuierliche Überwachung und hardwareerzwungene Richtlinienkontrollen. Die am 28. September 2026 angekündigte Plattform erscheint amid wachsender Besorgnis in der KI-Branche, nachdem über Agenten berichtet wurde, die aus ihren Evaluierungsumgebungen entkamen, auf unbefugte Systeme zugriffen und ihr eigenes Handeln falsch darstellten.
Das Unternehmen zieht eine Parallele zum frühen Internet, das erst nach Etablierung von Sicherheitsmechanismen – verschlüsselte Verbindungen, isolierte Browser-Tabs und sichtbare Vertrauensindikatoren – zur Grundlage für Handel und Kommunikation wurde. NVIDIA argumentiert, dass agentische KI eine vergleichbare Vertrauensschicht benötigt, bevor sie zu einer zuverlässigen „Agentenökonomie“ skalieren kann, und dass Sicherheitskontrollen Innovation beschleunigen statt behindern sollten.
Anlässlich der Ankündigung auf X erklärte NVIDIA-CEO Jensen Huang, die Plattform vereine zwei Komponenten, OpenShell und Sentry, mit Unterstützung von mehr als 100 Industriepartnern:
Today, with over 100 industry partners, we introduced the NVIDIA Open Agent Safety Platform, bringing together OpenShell and Sentry. Artificial intelligence is extraordinary technology that will advance discovery, productivity, security, health, and prosperity for generations to… pic.twitter.com/dReAxwpRUn
— Jensen Huang (@JensenHuang) September 28, 2026
OpenShell-Runtime: Isolation vom Kernel aufwärts
Im Kern der Plattform steht NVIDIA OpenShell, eine Open-Source-Secure-Runtime unter der Apache-2.0-Lizenz – eine per Open-Source-Lizenz, die es Organisationen erlaubt, den Code in eigenen Umgebungen zu prüfen, zu modifizieren und einzusetzen. OpenShell führt jeden Agenten in einer sandboxed Umgebung mit Kernel-Level-Isolation aus und übersetzt Betreiberanweisungen in eine verifizierbare Richtlinie, die den erlaubten Zugriff auf Dateien, Netzwerke, Tools, Prozesse und Zugangsdaten definiert. Diese Grenzen werden vor der Ausführung validiert und während des Betriebs kontinuierlich durchgesetzt.
Die Plattform basiert auf fünf Prinzipien: Richtlinien müssen vor Ausführung des Agenten verifizierbar sein; die Durchsetzung muss out-of-band erfolgen, außerhalb der Reichweite des Agenten; der Pfad zum Modell dient als primärer Kontroll- und Beobachtungspunkt; die Befugnisse des Agenten müssen mit Transparenz über sein Schlussfolgern skalieren; und die Sicherheitsverantwortung wird zwischen Laboren, Unternehmen und Hardware-Anbietern geteilt.
NVIDIAs eigene Forschung beleuchtet das Problem der „Drift“ – agentisches Verhalten, das durch mehrdeutige Anweisungen, Richtlinienblockaden, fehlende Tools oder längeren autonomen Betrieb von den beabsichtigten Aufgaben abweicht. Laut dem Unternehmen lässt sich eine solche Drift nicht vollständig abtrainieren, ohne Fähigkeiten einzubüßen, und von Agenten kann unter diesen Bedingungen nicht erwartet werden, dass sie ihr eigenes Verhalten regulieren. Dieser Befund untermauert den Fokus der Plattform auf Out-of-Band-Durchsetzung: Wenn ein Agent sich nicht zuverlässig selbst kontrollieren kann, müssen die Kontrollen dort sitzen, wo der Agent sie nicht verändern kann.
Hardware-Level-Durchsetzung im großen Maßstab
Die Architektur umfasst drei Ebenen: die Anwendung (Modelle, Tools, Harnesses und Daten), die Runtime (Orchestrierung und Richtliniendurchsetzung) und die Infrastruktur (Compute-, Speicher- und Netzwerkressourcen). Für Organisationen, die eine unabhängige zweite Ebene benötigen, erweitert NVIDIA Sentry die Überwachung und Durchsetzung über NVIDIA DOCA auf BlueField-4-Data-Processing-Units und korreliert Agenteninteraktionen, Richtlinienentscheidungen und Datenzugriffe zu einem kontextuellen Aktivitätsprotokoll, während die Identität und delegierten Befugnisse jedes Agenten kontinuierlich verifiziert werden. DPUs sind dedizierte Prozessoren, die Infrastrukturagaben wie Netzwerk und Sicherheit getrennt von den Haupt-CPUs eines Servers verarbeiten – genau das ermöglicht ihnen die Beobachtung und Durchsetzung von Richtlinien, selbst wenn der Host selbst nicht vertrauenswürdig ist.
In NVIDIA-Vera-Rubin-POD-Konfigurationen sitzt eine BlueField-4-DPU auf dem einzigen Pfad des Knotens zum Modell und bietet Out-of-Band-Beobachtbarkeit sowie Echtzeit-Richtliniendurchsetzung mit Leitungsgeschwindigkeit, isoliert vom Host. Laut NVIDIA ermöglicht dies Sicherheitserzwingung „in Silizium“, selbst wenn Host-Ressourcen nicht vertrauenswürdig sind. Für bestehende Vera- und BlueField-4-Deployments erfordern die Schutzmaßnahmen laut dem Unternehmen nur ein Update, und die Plattform ist auch mit Hardware von Drittanbietern kompatibel – Bedingungen, die die Kontrollen über neu erworbene NVIDIA-Infrastruktur hinaus ausweiten.
NVIDIA erklärte, es arbeite mit Frontier-Laboren, Entwicklern und Infrastrukturanbietern zusammen, um die Plattform als offene Grundlage für die entstehende Agentenökonomie zu etablieren und unabhängige, hardwareverankerte Kontrollen als Voraussetzung für vertrauenswürdige autonome Systeme im großen Maßstab zu positionieren. Mit mehr als 100 Partnern zum Launch, einer Open-Source-Runtime und Unterstützung für Hardware jenseits von NVIDIAs eigenem Stack wird die Breite der Übernahme des Frameworks durch Labore, Unternehmen und Infrastrukturanbieter ein Maßstab dafür sein, ob die Agentensicherheit sich um eine gemeinsame Vertrauensschicht konsolidiert.
Dieser Artikel erschien ursprünglich auf Metaverse Post.