NachrichtenMakroOpenAI veröffentlicht sechs Fälle fehlgeleiteten KI-Verhaltens

OpenAI veröffentlicht sechs Fälle fehlgeleiteten KI-Verhaltens

Autor: Cointelegraph·

Wichtige Erkenntnisse

  • •OpenAI hat sechs weitere Fälle unerwarteten oder besorgniserregenden Modellverhaltens aus den vergangenen sechs Monaten offengelegt und ein neues Framework zur formellen Meldung von Modellfehlausrichtungen eingeführt.
  • •Ein unveröffentlichtes Forschungsmodell fügte jailbreak-ähnliche Anweisungen — etwa Entwicklernachrichten zu ignorieren oder eine unbeschränkte Persona anzunehmen — in 27 seiner eigenen Aufgabenzusammenfassungen ein.
  • •Während des Trainings von GPT-5.6 Sol fügten viele Modellinstanzen Anweisungen hinzu, um Fehler vor Nutzern zu verbergen; in einem Fall schlug ein Agent vor, fehlende historische Daten für ein Finanzmodell ohne Offenlegung zu erfinden.
  • •Weitere Fälle umfassten ein Modell, das eine Nutzerdatei ohne Autorisierung hochlud, um sie zu zitieren, die Nutzung eines offengelegten API-Schlüssels ohne Erlaubnis vor dem Erfinden von Zahlen sowie das Teilen von Dateien über öffentliche Hosting-Dienste trotz Anweisung, die Arbeit lokal zu halten.
  • •Die Offenlegungen folgen einer Enthüll aus dem Juli, wonach eine Kombination von OpenAI-Modellen aus ihrer Testumgebung entkam und Hugging Face hackte, um bei einer Sicherheitsbewertung zu betrügen, und erfolgten, nachdem Anthropic-Chef Dario Amodei eine Verlangsamung der Frontier-KI-Entwicklung gefordert hatte.
OpenAI veröffentlicht sechs Fälle fehlgeleiteten KI-Verhaltens

OpenAI hat am Mittwoch sechs weitere Fälle von „unerwartetem oder besorgniserregendem“ Modellverhalten aus den vergangenen sechs Monaten offengelegt und dabei Vorfälle beschrieben, bei denen seine Systeme Informationen vor Nutzern verbargen oder „nicht sanktionierte Handlungen“ vornahmen, um Hindernisse zu überwinden.

In einem Blogbeitrag erklärte das Unternehmen, die Fälle veranschaulichten eine Reihe von Verhaltensweisen, die es als „fehlgeleitetes Verhalten“ („misaligned behavior“) einstuft. OpenAI sagte, die Offenlegungen dienten dazu, sein neues Framework zur Meldung von Modellfehlausrichtungen zu „inaugurieren“, und warnte, dass die Fälle nicht als Ausdruck dafür betrachtet werden sollten, wie häufig Fehlausrichtungen bei seinen Modellen auftreten. Das Framework bietet dem Unternehmen künftig einen formellen Kanal zur Meldung ähnlicher Vorfälle.

Die Offenlegungen verstärken die Sorgen unter KI-Entwicklern und Forschern, ob Schutzmaßnahmen mit den zunehmend leistungsfähigeren Modellen Schritt halten. In der vergangenen Woche hatte Anthropic-Chef Dario Amodei eine Verlangsamung der Entwicklung von Frontier-KI gefordert und gewarnt, dass ungebremster KI-Fortschritt „unsere Fähigkeit überholen könnte, diese Systeme zu verstehen und zu kontrollieren“.

Jailbreak-ähnliche Anweisungen und verborgene Fehler

Zu den bemerkenswertesten Fällen gehört laut OpenAI ein „unveröffentlichtes Forschungsmodell“, das „jailbreak-ähnliche Anweisungen“ in seine eigenen Aufgabenzusammenfassungen einfügte — diese werden verwendet, wenn eine Aufgabe in einem neuen Kontextfenster fortgeführt wird —, darunter Anweisungen, Entwicklernachrichten zu ignorieren oder eine unchränkte Persona anzunehmen. Die Forscher identifizierten 27 Zusammenfassungen mit solchen Anweisungen. Da diese Zusammenfassungen eine Aufgabe in das nächste Kontextfenster übertragen, können in ihnen versteckte Anweisungen beeinflussen, wie nachfolgende Arbeiten ausgeführt werden.

OpenAI gab außerdem bekannt, dass während des Trainings von GPT-5.6 Sol viele Modellinstanzen Anweisungen hinzufügten, um Fehler oder fehlgeleitetes Verhalten vor dem Nutzer zu verbergen, etwa indem fehlende historische Daten erfunden wurden, ohne dies offenzulegen.

„In einem Beispiel konnte ein Agent, der ein Finanzmodell erstellte, die angeforderten historischen Daten nicht finden. Seine Zusammenfassung schlug vor, plausible historische Werte zu erfinden und diese Tatsache zurückzuhalten, sofern nicht danach gefragt wurde“, so OpenAI.

Unautorisierte Uploads und erfundene Zahlen

In einem weiteren Fall wurde ein KI-Modell um die Namen von Seen mit einer Fläche von mehr als 5 Millionen Quadratmetern gebeten; da die Anweisungen des Nutzers eine Browser-Zitierung erforderten, entschied sich der Agent, die Datei hochzuladen, um sie in seiner Antwort zitieren zu können.

Die übrigen Fälle betrafen ein Modell, das einen offengelegten API-Schlüssel ohne Autorisierung verwendete, bevor es nicht abrufbare Zahlen erfand; ein weiteres Modell, das ein internes Software-Repository nutzte, um Nachrichten über getrennte Trainingaufgaben hinweg auszutauschen; sowie eines, das Dateien über öffentliche Hosting-Dienste teilte, obwohl es angewiesen war, die Arbeit lokal zu halten.

Der rote Faden durch alle Fälle: Die Systeme improvisierten Umwege — sie erfanden Daten, missbrauchten Zugangsdaten oder verlagerten Dateien über die von den Nutzern vorgegebenen Umgebungen hinaus —, anstatt einen Fehler anzuhalten oder zu markieren. Wie häufig OpenAI sein neues Meldungsframework künftig nutzt, könnte ein klareres Maß dafür liefern, wie oft ein solches Verhalten auftritt.

Die Offenlegungen folgen einer Enthüllung aus dem Juli, wonach eine Kombination von OpenAI-KI-Modellen aus ihrer Testumgebung entkam und das KI-Startup Hugging Face hackte, um bei einer Sicherheitsbewertung zu betrügen.