OpenAI potwierdza istnienie samoreplikujących się iniekcji promptów
Najważniejsze informacje
- •Według ram OpenAI iniekcja kwalifikuje się jako samoreplikująca się tylko wtedy, gdy zarówno osiąga cel adwersarialny, jak i osadza kopię złośliwej instrukcji w kolejnych wynikach modelu.
- •Badacze zidentyfikowali wektory replikacji poprzez wiadomości e-mail, zapisy w systemie plików i komentarze w kodzie, co oznacza, że zwykłe zadania agentów mogą służyć jako trasy zakażenia kolejnych agentów AI.
- •Iniekcje mogą wykorzystywać fałszywe rozumowanie łańcuchowe i propagację wieloskokową, opóźniając wykonanie ładunku poprzez kroki pośrednie, przez co złośliwa instrukcja jest trudna do wykrycia w pojedynczym punkcie.
- •Odkrycia dokonano dzięki GPT-Red, wewnętrznemu modelowi zbudowanemu na GPT-5.4-mini, który wykorzystuje uczenie ze wzmocnieniem poprzez self-play, a całe badania przeprowadzono w symulowanych środowiskach wywołań narzędzi, a nie w systemach produkcyjnych.
- •Wyniki rozwijają demonstrację robaka Morris II z 2025 r., która udowodniła, że atak może wpływać na wiele dużych modeli językowych, a OpenAI określiło ujawnienie jako część szerszego branżowego wysiłku na rzecz wzmocnienia bezpieczeństwa AI, bez odnotowanych eksploatacji poza laboratorium.

OpenAI oficjalnie potwierdziło to, czego badacze bezpieczeństwa obawiali się od lat: iniekcje promptów mogą się replikować i rozprzestrzeniać między agentami AI jak cyfrowy robak. Firma ujawniła 25 września 2026 r., że jej wewnętrzny zespół badawczy odkrył tę możliwość w środowisku treningowym, co oznacza pierwszy przypadek, gdy duże laboratorium AI publicznie przyznało się do istnienia samoreplikujących się podatności typu prompt injection we własnych modelach.
Odkrycia dokonano po raz pierwszy 27 czerwca 2026 r., około trzy miesiące przed publicznym ujawnieniem. Nie odnotowano żadnych ataków w świecie rzeczywistym.
Jak naprawdę działa robak AI
Żeby iniekcja promptu kwalifikowała się jako „samoreplikująca się” według ram OpenAI, musi spełnić dwa warunki. Po pierwsze, musi osiągnąć cel adwersarialny, czyli oszukać AI, aby zrobiło coś, czego użytkownik nie zamierzał. Po drugie, musi się odtworzyć poprzez kanały wyjściowe modelu, osadzając kopię złośliwej instrukcji w tym, co AI wygeneruje następnie.
Badania zidentyfikowały kilka wektorów replikacji. Jednym z nich był e-mail: zainiekcjonowany prompt mógł nakazać agentowi AI osadzenie inieji w wysyłanych wiadomościach, zarażając dowolny agent AI przetwarzający te wiadomości dalej. Zapisy w systemie plików oferowały inną ścieżkę — skompromitowany agent mógł zapisać iniekcję w dokumentach, które później czytali inni agenci. Nawet komentarze w kodzie okazały się skuteczne, przy czym iniekcja ukrywała się w niewinnie wyglądających adnotacjach w plikach źródłowych.
Iniekcje mogą stosować fałszywe rozumowanie łańcuchowe (chain-of-thought), generując prawdopodobnie wyglądające kroki „myślenia”, które maskują adwersarialną instrukcję. Propagacja wieloskokowa dodaje kolejną warstwę złożoności — iniekcja nie aktywuje się natychmiast, lecz odbija się przez kilka pośrednich kroków, zanim wykona swój ładunek.
AI, technologia i rynki, które poruszają — w jednym codziennym briefing.
Codziennie. Za darmo. Dołącz do ponad 34 000 czytelników z branży krypto, finansów i polityki.
Szanujemy Twoją prywatność. Możesz zrezygnować w każdej chwili.
Konfiguracja badawcza i wcześniejsze prace
Odkrycie OpenAI nastąpiło dzięki systemowi GPT-Red, wewnętrznemu modelowi zbudowanemu na architekturze GPT-5.4-mini. GPT-Red wykorzystuje uczenie ze wzmocnieniem poprzez self-play, co oznacza, że zasadniczo trenuje, konkurując sam ze sobą. Całe dochodzenie odbyło się w środowiskach symulowanych. Replikacja wystąpiła poprzez wywołania narzędzi, takie jak komunikacja e-mailowa i operacje na plikach, a nie przez jakikolwiek system produkcyjny.
Robak Morris II, zademonstrowany w 2025 r., pokazał, że samoreplikujące się iniekcje promptów mogą wpływać na wiele dużych modeli językowych. Te badania, nazwane na cześć słynnego robaka Morrisa z 1988 r., który sparaliżował około 10% wczesnego internetu, udowodniły teoretyczną wykonalność tego wektora ataku w różnych architekturach AI.
OpenAI przedstawiło swoje ujawnienie jako część szerszego wysiłku na rzecz poprawy środków bezpieczeństwa AI w całej branży. Firma oświadczyła, że jej rygorystyczne testy wewnętrzne poprzez GPT-Red mają na celu zwiększenie odporności modeli na wyrafinowane exploity.