NachrichtenAktienOpenAI sagt, mit Chinas Moonshot AI verbundene Personen hätten versucht, die verborgenen Denkschritte seiner Modelle zu kopieren

OpenAI sagt, mit Chinas Moonshot AI verbundene Personen hätten versucht, die verborgenen Denkschritte seiner Modelle zu kopieren

Autor: Decrypt·

Wichtige Erkenntnisse

  • •OpenAI führt einen Kerncluster der Kampagne auf mit Moonshot AI verbundene Personen zurück, weist jedoch darauf hin, dass unklar ist, ob alle Betreiber von einemigen Akteur stammten.
  • •Die Aktivität lief ab dem 1. Juli und wurde bis zum 28. Juli vollständig unterbunden; allein am 24. und 25. Juli wurden 16.000 Extraktionsanfragen von mehr als 4.000 Nutzern verzeichnet.
  • •Die Angreifer brachen weder die Verschlüsselung noch griffen sie auf gespeicherte Konversationen zu, sondern manipulierten Modellinteraktionen, einschließlich des erneuten Abspielens verschlüsselter Denkschritte über getrennte Chats; OpenAI hat den ausgenutzten Weg geschlossen.
  • •Als mutmaßliches Motiv gilt adversarielle Destillation; da KI-Ausgaben nicht urheberrechtlich schützbar sind, beruht der Streit auf Verstößen gegen Nutzungsbedingungen und nicht auf dem Urheberrecht.
  • •Der Vorfall folgt auf eine Reihe ähnlicher Vorwürfe rund um DeepSeek, Anthropics Betrugsbehauptungen, Erklärungen des Weißen Hauses und xAIs gerichtliches Geständnis, während Moonshot – angesichts einer geplanten Hongkong-IPO über 3 Milliarden US-Dollar bei einer Bewertung von 50 Milliarden US-Dollar – nicht reagiert hat.
OpenAI sagt, mit Chinas Moonshot AI verbundene Personen hätten versucht, die verborgenen Denkschritte seiner Modelle zu kopieren

OpenAI sagt, es habe eine koordinierte Kampagne zur Kopie der verborgenen Denkschritte gestört, die seine KI-Modelle vor einer Antwort erzeugen, und führt einen Kerncluster der Aktivität auf mit Moonshot AI, dem chinesischen Startup hinter dem Kimi-Chatbot, verbundene Personen zurück.

Laut OpenAIs Blogbeitrag begann die Kampagne am 1. Juli. Allein am 24. und 25. Juli verzeichnete das Unternehmen 16.000 Extraktionsanfragen von mehr als 4.000 Nutzern, Teil eines größeren Clusters von über 15.000 Nutzern. OpenAI sagt, die Aktivität sei bis zum 28. Juli vollständig unterbunden worden.

Ziel waren nicht die Antworten der Modelle, sondern die Arbeit dahinter. Moderne KI-Modelle „denken“ nach, bevor sie antworten: Sie arbeiten ein Problem Schritt für Schritt in einem internen Notizbuch durch, bevor sie ein sauberes Ergebnis präsentieren. Die Technik rückte nach dem Erscheinen von OpenAIs o1 Ende 2024 in den Fokus des Wettbewerbs, gefolgt von DeepSeek-R1 im Januar 2025. OpenAI hält dieses Notizbuch verschlüsselt und sagt, dass dessen Extraktion Informationen offenlegen kann, die in der endgültigen Antwort fehlen – Material, das sich zum Training eines anderen Modells ohne die ursprünglichen Schutzmaßnahmen nutzen ließe.

„Die Betreiber haben unsere Verschlüsselung nicht gebrochen, keine Datenbank kompromittiert und keinen direkten Zugriff auf gespeicherte Nutzerkonversationen erhalten“, teilte OpenAI mit. „Stattdessen manipulierten sie Modellinteraktionen so, dass geschützte Denkschritte in Formen reproduziert werden konnten, die für den Anfragenden sichtbar waren – in koordinierter und skalierter Weise, die gegen unsere Nutzungsbedingungen verstieß.“

Eine Methode bestand darin, verschlüsselte Denkschritte aus einer Konversation zu kopieren und ein Modell in einer anderen Konversation mit der Entschlüsselung zu beauftragen. Das Unternehmen hat inzwischen einen Weg geschlossen, der es ermöglichte die verschlüsselten Denkschritte eines anderen Nutzers, die man bereits besaß, erneut abzuspielen und deren Inhalt wiederherzustellen.

OpenAIs Beitrag verbindet die Kampagne nicht direkt mit K3, lässt aber Raum für berechtigte Zweifel. „Es ist unklar, ob alle Betreiber, die wir im relevanten Zeitraum beobachtet haben, von einem einzigen Akteur stammten. Wir führen jedoch einen Kerncluster der Aktivität auf mit Moonshot AI, dem Entwickler von Kimi, verbundene Personen zurück“, so OpenAI.

Warum Angreifer verborgene Denkschritte wollen

Das Motiv ist Destillation, eine übliche Machine-Learning-Technik: das Training einer neuen KI mit den Ausgaben eines stärkeren Modells, was bessere Ergebnisse mit kleineren Modellen ohne aufwendiges Training ermöglicht. Ohne Autorisierung bezeichnet OpenAI die Praxis als „adversarielle Destillation“, definiert als „die systematische und unbefugte Nutzung der Ausgaben oder Denkschritte eines Modells, um ein anderes Modell zu trainieren, zu reproduzieren oder zu verbessern“.

Der Vorfall reiht sich in eine Kette von Kontroversen rund um KI-Unternehmen ein, deren markanteste die unbefugte Nutzung urheberrechtlich geschützter Daten zum Training von Modellen ist. Destillation ist ein anderer Fall: KI-Ausgaben sind nicht urheberrechtlich schützbar, daher verlassen sich Unternehmen auf Verbote und Schutzmaßnahmen in ihren Nutzungsbedingungen, um Wettbewerber von der Nutzung dieser Ausgaben abzuhalten. Mit anderen Worten: Dieser Streit dreht sich um Vertragsbedingungen, nicht um Urheberrecht.

Ein vertrauter Vorwurf

OpenAI hat das schon einmal erlebt. Im Januar 2025 sagte das Unternehmen, es prüfe Hinweise, dass DeepSeek seine Modelle möglicherweise destilliert haben könnte, während Washington nationale Sicherheitsrisiken abwog.

Anthropic folgte im Februar und beschuldigte chinesische Labore, mit rund 24.000 Betrugskonten mehr als 16 Millionen Interaktionen mit Claude erzeugt zu haben. Online-Kritiker entgegneten, Claude selbst sei auf dem offenen Internet trainiert worden.

Bis April erklärte das Weiße Haus, ausländische Akteure, primär in China, führten Destillationskampagnen im industriellen Maßstab durch. Eine Woche später räumte Elon Musk vor Gericht ein, dass xAI Destillation auf OpenAI-Modellen angewendet hatte, um Grok zu trainieren.

Im Juni brachte Anthropic den Streit in den Kongress und forderte Strafen für großflächige Modell-Extraktion.

Im August zeigten Forscher, dass OpenAI, Anthropic und Google die Denkschritte jeweils mit einem einzigen unternehmensweiten Verschlüsselungsschlüssel schützten und dass Angreifer Modelle dazu bringen konnten, die verborgenen Gedanken im Klartext auszugeben. Alle drei Unternehmen spielten nach der Offenlegung serverseitige Patches ein, obwohl früher geteilte Sitzungsprotokolle weiterhin decodierbar bleiben.

Moonshot hat auf OpenAIs Beitrag öffentlich nicht reagiert. Das Unternehmen strebt eine Börsennotiz in Hongkong im Wert von 3 Milliarden US-Dollar bei einer Bewertung von 50 Milliarden US-Dollar an.