OpenAI zegt dat personen gelinkt aan China's Moonshot AI de verborgen redenering van zijn modellen probeerden te kopiëren
Belangrijkste punten
- •OpenAI schrijft een kerncluster van de campagne toe aan personen verbonden aan Moonshot AI, met de kanttekening dat het onduidelijk is of alle operatoren van één actor afkomstig waren.
- •De activiteit liep vanaf 1 juli en werd op 28 juli volledig verstoord met alleen al op 24-25 juli 16.000 extractieverzoeken van meer dan 4.000 gebruikers.
- •Aanvallers braken geen versleuteling en kregen geen toegang tot opgeslagen gesprekken, maar manipuleerden modelinteracties, waaronder het opnieuw afspelen van versleutelde redenering in aparte chats; OpenAI heeft de misbruikte routekaart gesloten.
- •Het vermoedelijke motief is adversarial distillation, en omdat AI-output niet auteursrechtelijk beschermd is, rust het geschil op schending van servicevoorwaarden in plaats van auteursrecht.
- •De affaire volgt op een reeks vergelijkbare beschuldingen rond DeepSeek, fraudeclaims van Anthropic, uitspraken van het Witte Huis en de rechterlijke toegeving van xAI, terwijl Moonshot niet heeft gereageerd amid plannen voor een beursgang van $3 miljard in Hong Kong bij een waardering van $50 miljard.

OpenAI zegt een gecoördineerde campagne te hebben verstoord om de verborgen redenering te kopiëren die zijn AI-modellen genereren vóór het geven van antwoorden, en spoort een kerncluster van de activiteit terug naar personen verbonden aan Moonshot AI, het Chinese startup achter de Kimi-chatbot.
Volgens de blogpost van OpenAI begon de campagne op 1 juli. Alleen al op 24 en 25 juli registreerde het bedrijf 16.000 extractieverzoeken van meer dan 4.000 gebruikers, onderdeel van een breder cluster van meer dan 15.000 gebruikers. OpenAI zegt de activiteit op 28 juli volledig te hebben verstoord.
Het doel waren niet de antwoorden van de modellen, maar het werk erachter. Moderne AI-modellen "redeneren" voordat ze antwoorden: ze doorlopen een probleem stap voor stap in een intern kladblok voordat ze een schoon resultaat presenteren. De techniek werd een competitieve focus na de komst van OpenAI's o1 eind 2024, gevolgd door DeepSeek's R1 in januari 2025. OpenAI houdt dat kladblok versleuteld en zegt dat het extraheren ervan informatie kan onthullen die het uiteindelijke antwoord achterwege laat—materiaal dat zou kunnen worden gebruikt om een ander model te trainen zonder de oorspronkelijke beveiligingsmaatregelen.
"De operatoren braken onze versleuteling niet, compromiteerden geen database en kregen geen directe toegang tot opgeslagen gebruikersgesprekken", zei OpenAI. "In plaats daarvan manipuleerden ze modelinteracties zodat beschermde redenering kon worden gereproduceerd in vormen die zichtbaar waren voor de aanvrager, op een gecoördineerde, geschaalde manier die onze servicevoorwaarden schond."
Eén methode bestond er volgens OpenAI uit versutelde redenering uit het ene gesprek te kopiëren en een model te vragen deze in een ander gesprek te decoderen. Het bedrijf heeft inmiddels een routekaart gesloten die iemand die al de versleutelde redenering van een andere gebruiker had, in staat stelde deze opnieuw af te spelen en de inhoud te herstellen.
De post van OpenAI verbindt de campagne niet rechtstreeks met K3, maar laat ruimte voor redelijke twijfel. "Het is onduidelijk of alle operatoren die we in de relevante periode waarnamen van één actor afkomstig waren. Wij schrijven echter een kerncluster van de activiteit toe aan personen verbonden aan Moonshot AI, de ontwikkelaar van Kimi", zei OpenAI.
Waarom aanvallers verborgen redenering willen
Het motief is distillatie, een standaard machine-learningtechniek: het trainen van een nieuwe AI op de output van een sterker model, wat betere resultaten oplevert bij kleinere modellen zonder zware training. Zonder autorisatie noemt OpenAI de praktijk "adversarial distillation", gedefinieerd als "het systematische en ongeautoriseerde gebruik van de output of redenering van één model om een ander model te trainen, reproduceren of verbeteren."
De affaire voegt zich bij een reeks controverses rondom AI-bedrijven, waarvan de meest prominente het ongeautoriseerde gebruik van auteursrechtelijk beschermde data voor het trainen van modellen is. Distillatie is een andere kwestie: AI-output valt niet onder het auteursrecht, dus bedrijven vertrouwen op verboden en beveiligingsmaatregelen in hun servicevoorwaarden om te voorkomen dat concurrenten die output gebruiken. Met andere woorden, dit geschil draait om contractvoorwaarden in plaats van auteursrecht.
Een vertrouwde beschuldiging
OpenAI is hier eerder geweest. In januari 2025 zei het bedrijf tekenen te onderzoeken dat DeepSeek zijn modellen mogelijk had gedistilleerd, terwijl Washington nationale veiligheidsrisico's afwoog.
Anthropic volgde in februari en beschuldigde Chinese labs ervan ongeveer 24.000 frauduleuze accounts te gebruiken om meer dan 16 miljoen uitwisselingen met Claude te genereren. Online critici reageerden dat Claude zelf op het open internet was getraind.
In april zei het Witte Huis dat buitenlandse entiteiten, voornamelijk in China, distillatiecampagnes op industriële schaal uitvoerden. Een week later gaf Elon Musk in de rechtbank toe dat xAI distillatie had gebruikt op OpenAI-modellen om Grok te trainen.
In juni bracht Anthropic de kwestie naar het Congres en vroeg om sancties op grootschalige modelextractie.
In augustus toonden onderzoekers aan dat OpenAI, Anthropic en Google redenering elk beschermden met één versleutelingssleutel voor de hele provider, en dat aanvallers modellen konden verleiden om verborgen gedachten in platte tekst uit te spugen. Alle drie de bedrijven brachten na openbaarmaking server-side patches uit, hoewel eerder gedeelde sessielogboeken decodeerbaar blijven.
Moonshot heeft niet publiekelijk gereageerd op de post van OpenAI. Het bedrijf streeft een beursgang van $3 miljard in Hong Kong na bij een waardering van $50 miljard.