OpenAI twierdzi, że osoby powiązane z chińskim Moonshot AI próbowały skopiować ukryte rozumowanie jej modeli
Najważniejsze informacje
- •OpenAI przypisuje główny klaster kampanii osobom powiązanym z Moonshot AI, zaznaczając jednocześnie, że nie jest jasne, czy wszyscy operatorzy pochodzili od jednego podmiotu.
- •Aktywność trwała od 1 lipca i została całkowicie przerwana do 28 lipca, przy czym 24–25 lipca odnotowano 16 000 żądań ekstrakcji od ponad 4 000 użytkowników.
- •Atakujący nie złamali szyfrowania ani nie uzyskali dostępu do przechowywanych rozmów, lecz manipulowali interakcjami z modelem, w tym odtwarzali zaszyfrowane rozumowanie w oddzielnych czatach, a OpenAI zamknął wykorzystywaną ścieżkę.
- •Podejrzewanym motywem jest destylacja adversarialna, a ponieważ wyniki AI nie podlegają prawu autorskiemu, spór opiera się na naruszeniu warunków korzystania z usługi, a nie na prawie autorskim.
- •Zdarzenie następuje po serii podobnych oskarżeń dotyczących DeepSeek, zarzutów oszustw ze strony Anthropic, oświadczeń Białego Domu i przyznania xAI przed sądem, podczas gdy Moonshot nie odpowiedział, planując IPO w Hongkongu o wartości 3 miliardów dolarów przy wycenie 50 miliardów dolarów.

OpenAI twierdzi, że przerwała skoordynowaną kampanię mającą na celu skopiowanie ukrytego rozumowania generowanego przez jej modele AI przed udzieleniem odpowiedzi, śledząc główny klaster tej aktywności do osób powiązanych z Moonshot AI, chińskim startupem stojącym za chatbotem Kimi.
Według wpisu na blogu OpenAI kampania rozpoczęła się 1 lipca. Samego 24 i 25 lipca firma odnotowała 16 000 żądań ekstrakcji od ponad 4 000 użytkowników, w ramach szerszego klastra liczącego ponad 15 000 użytkowników. OpenAI twierdzi, że do 28 lipca całkowicie przerwała tę aktywność.
Celem nie były odpowiedzi modeli, lecz praca, która za nimi stoi. Nowoczesne modele AI „rozumują” przed odpowiedzią — przechodzą przez problem krok po kroku w wewnętrznym notatniku, zanim przedstawią czysty wynik. Technika stała się obiektem rywalizacji po pojawieniu się o1 od OpenAI pod koniec 2024 roku, któremu w styczniu 2025 roku dorównał R1 od DeepSeek. OpenAI utrzymuje ten notatnik w formie zaszyfrowanej i twierdzi, że jego wydobycie może ujawnić informacje pominięte w ostatecznej odpowiedzi — materiał, który mógłby posłużyć do wytrenowania innego modelu bez pierwotnych zabezpieczeń.
„Operatorzy nie złamali naszego szyfrowania, nie skompromitowali bazy danych ani nie uzyskali bezpośredniego dostępu do przechowywanych rozmów użytkowników” — oświadczyło OpenAI. „Zamiast tego manipulowali interakcjami z modelem tak, aby chronione rozumowanie mogło być odtwarzane w formach widocznych dla żądającego w skoordynowany, wyskalowany sposób naruszający nasze warunki korzystania z usł.”
Jedna z metod, według OpenAI, polegała na skopiowaniu zaszyfrowanego rozumowania z jednej rozmowy i poproszeniu modelu o jego zdekodowanie w innej rozmowie. Firma od tego czasu zamknęła ścieżkę, która pozwalała osobie posiadającej już zaszyfrowane rozumowanie innego użytkownika na jego ponowne odtworzenie i odzyskanie zawartości.
Wpis OpenAI nie łączy bezpośrednio tej kampanii z K3, ale pozostawia miejsce na rozsądne wątpliwości. „Nie jest jasne, czy wszyscy operatorzy zaobserwowani w badanym okresie pochodzili od jednego podmiotu. Niemniej jednak przypisujemy główny klaster tej aktywności osobom powiązanym z Moonshot AI, twórcą Kimi” — oświadczyło OpenAI.
Dlaczego atakujący chcą ukrytego rozumowania
Motywem jest destylacja, standardowa technika uczenia maszynowego: trenowanie nowego AI na wynikach mocniejszego modelu, co daje lepsze rezultaty przy mniejszych modelach bez kosztownego treningu. Przeprowadzana bez autoryzacji, jest przez OpenAI nazywana „destylacją adversarialną”, którą definiuje jako „systematyczne i nieautoryzowane wykorzystanie wyników lub rozumowania jednego modelu do trenowania, odtwarzania lub ulepszania innego modelu”.
To zdarzenie dołącza do serii kontrowersji dotyczących firm AI, z których najbardziej znana dotyczy nieautoryzowanego wykorzystania danych objętych prawem autorskim do trenowania modeli. Destylacja to inna sprawa: wyniki AI nie podlegają prawu autorskiemu, więc firmy opierają się na zakazach i zabezpieczeniach w warunkach korzystania z usługi, aby uniemożliwić konkurentom korzystanie z tych wyników. Innymi słowy, ten spór opiera się na warunkach umowy, a nie na prawie autorskim.
Znane oskarżenie
OpenAI już wcześniej znajdowało się w podobnej sytuacji. W styczniu 2025 roku firma powiedziała, że analizuje sygnały sugerujące, iż DeepSeek mógł przeprowadzić destylację jej modeli, podczas gdy Waszyngton rozważał ryzyka dla bezpieczeństwa narodowego.
W lutym dołączyło Anthropic, oskarżając chińskie laboratoria o użycie około 24 000 oszukańczych kont do wygenerowania ponad 16 milionów wymian z Claude. Krytycy w internecie odpowiadali, że sam Claude był trenowany na otwartym internecie.
W kwietniu Biały Dom oświadczał, że podmioty zagraniczne, głównie w Chinach, prowadzą destylację w skali przemysłowej. Tydzień później Elon Musk przyznał przed sądem, że xAI wykorzystywało destylację modeli OpenAI do trenowania Grok.
W czerwcu Anthropic przeniósł sprawę do Kongresu, wzywając do wprowadzenia kar za ekstrakcję modeli na dużą skalę.
W sierpniu badacze wykazali, żeAI, Anthropic i Google chroniły rozumowanie jednym kluczem szyfrującym obejmującym cały dostawcę, a atakujący mogli nakłonić modele do wypisania ukrytych myśli w postaci zwykłego tekstu. Wszystkie trzy firmy wdrożyły poprawki po stronie serwera po ujawnieniu problemu, choć wcześniej udostępnione logi sesji pozostają możliwe do zdekodowania.
Moonshot nie odpowiedział publicznie na wpis OpenAI. Firma planuje IPO w Hongkongu o wartości 3 miliardów dolarów przy wycenie 50 miliardów dolarów.