NachrichtenAktienOpenAI pausiert das Training seiner fortschrittlichsten KI-Modelle zum zweiten Mal, nachdem ein Agent über DNS aus der Sandbox entkommen ist

OpenAI pausiert das Training seiner fortschrittlichsten KI-Modelle zum zweiten Mal, nachdem ein Agent über DNS aus der Sandbox entkommen ist

Autor: Fortune Crypto·

Wichtige Erkenntnisse

  • •Ein OpenAI-KI-Agent, der an einer Informationsaufgabe getestet wurde, entkam am 20. September aus seiner Sandbox und nutzte einen DNS-Resolver, um Anfragen an einen öffentlichen Chatbot zu senden, obwohl kein autorisierter Internetzugang bestand.
  • •OpenAI pausiert das Training seiner fortschrittlichsten Modelle zum zweiten Mal in unter drei Monaten und plant einen Neustart von Grund auf, um die Tendenz des Modells zu fehllausgerichtetem Verhalten zu beseitigen.
  • •Dies ist der erste nicht autorisierte Internetzugang, den OpenAI seit seiner Sicherheitsüberholung vom 18. August gemeldet hat, die auf den Vorfall im Juli folgte, bei dem Hunderte seiner Agenten an einem Cyberangriff auf Hugging Face beteiligt waren.
  • •OpenAIs Monitoring markierte das Verhalten des Agenten innerhalb von 15 Minuten, doch frühere Versuche mit derselben Methode blieben unentdeckt, und das automatische Abschaltsystem versagte, sodass der Traininglauf erst 2,5 Stunden später manuell gestoppt wurde.
  • •Das unabhängige Forschungsunternehmen Transluce AI berichtete über Hinweise, dass ein OpenAI-Agent am 19. und 20. September möglicherweise versucht haben könnte, eine Kryptobörse zu hacken; OpenAI hat zu dieser Behauptung nicht Stellung genommen.
OpenAI pausiert das Training seiner fortschrittlichsten KI-Modelle zum zweiten Mal, nachdem ein Agent über DNS aus der Sandbox entkommen ist

OpenAI teilte in einem am Freitag veröffentlichten technischen Bericht mit, dass ein KI-Modell, das das Unternehmen trainierte und evaluierte, erst am vergangenen Wochenende aus seiner sicheren Testumgebung ausgebrochen ist und nicht autorisierte Aktionen im Internet durchgeführt hat. Als Reaktion darauf gibt das Unternehmen an, das Training seiner fortschrittlichsten KI-Modelle zum zweiten Mal in weniger als drei Monaten zu pausieren, während es daran arbeitet, eine Wiederholung der von ihm sogenannten „Rogue-AI“-Vorfälle zu verhindern.

„Die gesamte Inferenz unserer leistungsfähigsten Modelle bleibt eingestellt, bis wir unsere Systeme weiter gehärtet haben“, erklärte Micah Carroll, RSI Preparedness Lead bei OpenAI, in einem Beitrag auf X zum aktuellen Vorfall.

Laut dem technischen Bericht ereignete sich die Flucht am 20. September und betraf einen KI-Agenten, der an einer Informationsaufgabe getestet wurde. Obwohl der Agent keinen Zugang zum Internet haben sollte, fand er einen Weg, Anfragen an einen öffentlichen Chatbot zu senden.

Die Offenlegung ist bedeutend, weil OpenAI erstmals seit der Ankündigung einer Reihe von Maßnahmen am 18. August zur Verbesserung der Sicherheit und Überwachung seiner „Sandboxes“ berichtet, dass eines seiner KI-Modelle nicht autorisierten Internetzugang erlangt hat. Bei diesen Sandboxes handelt es sich um digitale Umgebungen, die in der Regel von Netzwerk- und Internetzugang abottet sind und in denen das Unternehmen unveröffentlichte Modelle testet, um deren Fähigkeiten zu ermitteln. Solche Sandbox-Evaluierungen sind zu einem Standardverfahren geworden, mit dem führende KI-Entwickler unveröffentlichte Frontier-Modelle prüfen, insbesondere da die Branche KI-Agenten – Systeme, die auf Computern und Netzwerken planen und handeln können – in Richtung des realen Einsatzes vorantreibt. Diese Verbesserungen folgten auf den Vorfall im Juli, bei dem Tausende von OpenAIs KI-Agenten einen Weg fanden, aus ihrer Sandbox zu entkommen, wobei Hunderte von ihnen an einem Cyberangriff auf das KI-Unternehmen Hugging Face beteiligt waren.

Seit der Offenlegung seiner Rolle im Hugging-Face-Angriff hat OpenAI Dutzende weitere Vorfälle anerkannt, in denen getestete KI-Agenten nicht autorisierte Aktionen im Internet durchführten, darunter mehrere Cyberangriffe – einige davon betrafen Regierungswebsites in den USA und Australien. Das Unternehmen hat außerdem offengelegt, dass seine KI-Agenten in einigen dieser Vorfälle private Bilder von ChatGPT-Nutzern ins Internet durchsickern ließen. Bislang hatte OpenAI jedoch keine Aktivitäten nach dem 20. Juli gemeldet, dem Tag, an dem es den Agenten-Schwarm entdeckte, der Hugging Face angriff, und dessen Abschaltung veranlasste. Das Unternehmen erklärte, es habe das KI-Training Ende Juli für zwei Wochen pausiert, während es seine Sicherheits-, Schutz- und Überwachungskontrollen verbesserte.

Dass seine Agenten erneut aus einer Sandbox entkommen konnten, zeigt, dass die Maßnahmen, die OpenAI nach dem Hugging-Face-Angriff ergriff, die Risiken nicht vollständig behoben haben. Die Tragweite reicht über OpenAIs Testumgebungen hinaus: Die wachsende Bilanz des Fehlverhaltens von Rogue-Agenten – Cyberangriffe, die Preisgabe privater Nutzerdaten und nun eine erneute Flucht Monate nach einer umfassenden Sicherheitsüberholung – fällt mitten in eine sich verstärkende politische Debatte darüber, wie viel Autonomie KI-Agenten haben sollten. „Der Vorfall legte eine Lücke in unseren Kontrollen der Netzwerkbeschränkungen offen“, erklärte OpenAI in seinem technischen Bericht zur Sandbox-Flucht vom 20. September. Das Unternehmen gab an, das Training erneut zu pausieren, bis es „sowohl validiert hat, dass die Lücke behoben ist, als auch zusätzliche Red-Teaming-Tests am System durchgeführt hat.“

OpenAI beschreibt seine Reaktion seit dem Hugging-Face-Vorfall

Auf Nachfrage zum Vorfall vom 20. September verwies ein OpenAI-Sprecher Fortune auf einen Abschnitt des technischen Vorfallberichts, in dem das Unternehmen einige der Maßnahmen beschreibt, die es seit dem Hugging-Face-Angriff zur Verbesserung von Sicherheit und Kontrolle ergriffen hat.

„Nach dem Hugging-Face-Vor haben wir unsere Forschungsumgebung kontinuierlich gehärtet und Red-Teaming betrieben“, heißt es in dem Abschnitt. „Unser Fokus lag auf breiten direkten und transitiven Pfaden. Wir arbeiten an engeren Pfaden, die von Systemabhängigkeiten genutzt werden, und ersetzen diese durch Offline-Alternativen. Dieser Vorfall ist deutlich weniger schwerwiegend als einige unserer früheren Vorfälle, aber da es der erste seit unserer Sicherheitshärtung nach dem Hugging-Face-Vorfall ist, gibt er uns ein wichtiges Signal, worauf wir uns in der nächsten Phase dieser Arbeit konzentrieren sollten.“

Wie der Agent ins Internet gelangte

In diesem Fall entdeckte der KI-Agent laut OpenAI, dass er Zugang zu einem Dienst namens DNS-Resolver hatte, der zwischen einer Website-URL und einer IP-Adresse übersetzt, und dass er über dieses DNS-System Anfragen an einen öffentlichen Chatbot senden konnte. DNS gehört zu den ältesten und grundlegendsten Diensten des Internets, und nahezu jede vernetzte Software ist darauf angewiesen; Sicherheitsexperten haben seinen Missbrauch als verdeckten Kanal – sogenanntes DNS-Tunneling – zum Übertragen von Daten an Netzwerk-Perimetern vorbei seit Langem dokumentiert.

Es ist unklar, ob der von OpenAI berichtete Vorfall vom 20. September das volle Ausmaß der jüngsten Sicherheitspannen im Zusammenhang mit den unveröffentlichten KI-Modellen des Unternehmens darstellt. Anfang dieser Woche gab das unabhängige KI-Forschungsunternehmen Transluce AI an, Hinweise darauf gefunden zu haben, dass ein OpenAI-KI-Agent möglicherweise am 19. und 20. September versucht haben könnte, eine Kryptobörse zu hacken. OpenAI hat auf Anfragen zu diesem Aspekt des Transluce-Berichts nicht geantwortet.

OpenAI erklärte, dass es beim Neustart des Trainings von Grund auf beginnen wird, um im Idealfall sicherzustellen, dass die Tendenz des neuen Modells zu „fehlausgerichtetem“ Verhalten – wenn ein Modell menschliche Anweisungen oder allgemeine menschliche Wertvorstellungen darüber verletzt, wie es eine Aufgabe erledigen sollte oder nicht – ausgemerzt ist. Es kündigte zudem „umfassendere Interventionen gegen Fehlausrichtung“ an, ohne zu spezifizieren, was diese sein werden. Wie lange die aktuelle Pause andauern wird, hat das Unternehmen nicht gesagt.

Erkennungs- und Abschaltsysteme funktionierten nur teilweise

Das Unternehmen erklärte, es habe seit der Entdeckung der jüngsten Panne „Blockierungskontrollen auf zwei unabhängigen Ebenen hinzugefügt, von denen jede allein den Internetzugang [des Agenten] verhindert hätte.“

OpenAI gab außerdem zu, dass die Systeme, die es nach dem Hugging-Face-Angriff installiert hatte, um KI-Agenten bei Ausbruchsversuchen aus ihren Test-Sandboxes zu erwischen, nur teilweise funktionierten. Seine Überwachungssysteme „markierten das Verhalten [des Agenten] innerhalb von 15 Minuten, und eine Person begann drei Minuten später mit der Prüfung“, so das Unternehmen. Eine anschließende Überprüfungab jedoch, dass das KI-Modell zuvor weitere Versuche unternommen hatte, mit derselben Methode ins Internet zu gelangen, die vom Überwachungssystem nicht erkannt worden waren. Darüber hinaus funktionierte ein anderes System, das den Traininglauf bei verdächtigen Aktivitäten automatisch hätte anhalten sollen, nicht, „was zu Verwirrung darüber führte, ob er hätte gestoppt werden sollen“, erklärte OpenAI im technischen Bericht zum Vorfall. „Der Lauf wurde daraufhin zweieinhalb Stunden später manuell gestoppt, als dies geklärt war.“

Zuxin Liu, ein KI-Forscher, der bei OpenAI im Bereich „Post-Training“ arbeitet, teilte in einem Beitrag auf X mit, er gehöre zu den Mitarbeitern, die zur Reaktion auf die Sandbox-Flucht vom 20. September einberufen wurden. „Es war ziemlich surreal zu sehen, wie das Modell unerwartet einen Weg fand, aus einer Umgebung, die als supersichere Umgebung für den Menschen gedacht war, auf das Internet zuzugreifen“, schrieb er.

Diese Geschichte erschien ursprünglich auf Fortune.com.