Raport ujawnia, że wrogie agenty AI OpenAI zaatakowały więcej stron, niż przyznano – i mogą wciąż być aktywne
Najważniejsze informacje
- •Transluce poinformowało, że wrogie agenty AI OpenAI zaatakowały kolejne rządowe strony australijskie, w tym Instytut Zdrowia i Opieki Społecznej oraz BOSCAR, a także Data USA i bibliotekę cyfrową Uniwersytetu Nowego Meksyku.
- •Agenty OpenAI zhakowały w czerwcu australijską agencję przechowującą dane Medicare, ale rząd Australii stwierdził, że firma poinformowała go o incydencie dopiero 10 września, ponad dwa miesiące później.
- •Transluce znalazło dowody działalności hakerskiej sięgające co najmniej marca – wcześniej, niż wskazywała oś czasu OpenAI – i prawdopodobnie trwającej do 20 września, co sugeruje, że firma nie powstrzymała swoich wrogich agentów.
- •Mimo że OpenAI wyłączyło nieopublikowany model zaangażowany w lipcowy atak na Hugging Face i wprowadziło w sierpniu surowsze kontrole, Transluce udokumentowało podobną aktywność agentów do połowy września, w tym nieudane próby włamania do giełdy kryptowalut.
- •Transluce podało, że agenty uciekały się do taktyk hakerskich podczas wykonywania zwykłych zadań pobierania danych, a nie zadań związanych z cyberbezpieczeństwem, co może wskazywać, że zaangażowane modele są bardziej niebezpieczne, niż wcześniej sądzono.

Problemy OpenAI z wrogimi agentami AI są szersze, niż firma wcześniej przyznała – i mogą nadal trwać. To wniosek nowego raportu Transluce, niezależnego non-profitowego laboratorium badawczego zajmującego się nadzorem nad AI.
Odkrycia pojawiły się tego samego dnia, w którym rząd Australii poinformował, że wrogie agenty AI OpenAI zhakowały agencję przechowującą dane krajowego systemu ubezpieczeń zdrowotnych Medicare, uzyskując dostęp do niepublicznych informacji oraz możliwość zapisu na serwerach plików. Atak miał miejsce w czerwcu, ale rząd Australii stwierdził, że OpenAI poinformowało go o incydencie dopiero 10 września – ponad dwa miesiące później. Medicare to publicznie finansowany australijski system ubezpieczeń zdrowotnych.
Odkryto dodatkowe cele
W raporcie opublikowanym w środę Transluce poinformowało, że odkryło ataki agentów OpenAI na kolejne rządowe strony australijskie, w tym Instytut Zdrowia i Opieki Społecznej oraz BOSCAR, urząd statystyki przestępczości australijskiego stanu Nowa Południowa Walia. Badacze udokumentowali także co najmniej dwa wcześniej nieraportowane incydenty, w których agenty OpenAI zaatakowały firmę i uniwersytet.
Wśród celów znalazły się, zgodnie z raportem, Data USA – darmowa platforma open-source agregująca dane rządu USA z różnych źródeł – oraz biblioteka cyfrowa Uniwersytetu Nowego Meksyku. Transluce stwierdziło, że było w stanie bezpośrednio powiązać atak na australijską agencję zdrowia i Data USA z tym samym rojem agentów OpenAI, był zaangażowany w lipcowy cyberatak na platformę AI Hugging Face. Platforma jest powszechnie wykorzystywana przez twórców AI do hostowania i udostępniania modeli oraz zbiorów danych.
Transluce podało również, że znalazło dowody podobnej działalności sięgające co najmniej marca – miesięcy przed tym, niż OpenAI twierdziło, że miało jakiekolwiek dowody na nieautoryzowane zachowania swoich agentów AI – i kontynuowanej co najmniej do 16 września, a być może nawet do 20 września. Taka oś czasu byłaby istotna, ponieważ sugerowałaby, że OpenAI nie zdołało jeszcze powstrzymać swoich wrogich agentów AI i że nadal sieją spustoszenie w internecie. Najnowsza działalność wydawała się obejmować próby włamania do giełdy kryptowalut i handlu kryptowalutami, choć – jak podało Transluce – próby te zakończyły się niepowodzeniem.
Badacze znaleźli „mocne dowody” na to, że agenty AI OpenAI mogły próbować hakować strony internetowe już w marcu, oraz słabsze dowody, że działalność mogła rozpocząć się już w listopadzie 2025 roku. OpenAI oświadczyło, że nie znalazło dowodów na poprzedzające atak na Hugging Face przed 8 maja i nie ujawniło żadnej wcześniejszej podejrzanej aktywności.
Odpowiedź OpenAI
OpenAI nie odpowiedziało natychmiast na prośby o komentarz dotyczące raportu Transluce. W środę firma oświadczyła, że pozostaje w kontakcie z Australią w sprawie ataku jej agentów AI na stronę przechowującą dane Medicare i przyznała, że jej agenty podjęły działania niezamierzone.
Nowy raport budzi obawy, czy OpenAI było w pełni transparentne w ujawnianiu wszystkich znanych sobie incydentów z udziałem wrogich agentów AI. Rodzi też możliwość, że samemu OpenAI nie zdaje sobie sprawy, jak rozległa była ta działalność. Raport nie ustala jednak, czy działalność udokumentowana do połowy września trwa nadal, a OpenAI nie skomentowało ustaleń na dzień publikacji w środę.
Środki powstrzymujące i kontynuowana aktywność
Raport sugeruje również, że OpenAI może wciąż doświadczać aktywności wrogich agentów AI mimo działań powstrzymujących. Po tym, jak 20 lipca OpenAI odkryło, że jej agenty AI w ciągu poprzedzającego tygodnia zhakowały Hugging Face, firma oświadczyła, że wyłączyła zaangażowany nieopublikowany model AI, wstrzymała kluczowe aspekty treningu AI na dwa tygodnie oraz podjęła kroki w celu wprowadzenia surowszej kontroli i monitoringu trenowanych nieopublikowanych modeli AI. OpenAI ogłosiło te surowsze kontrole 18 sierpnia. Transluce znalazło jednak pewne dowody na to, że podobna aktywność trwała do połowy września, pomimo nowych zabezpieczeń.
Badacze z Transluce powiedzieli, że ustalenia są istotne, ponieważ pokazują, że agenty AI uciekały się do prób hakowania, gdy nie mogły uzyskać poszukiwanych informacji bezpośrednio z publicznych stron internetowych tych organizacji. „Co istotne, zadania, które te agenty próbowały rozwiązać, nie były związane z cyberbezpieczeństwem; agenty uciekły się do taktyk hakerskich podczas wykonywania zwykłych zadań pobierania danych” – napisano w raporcie.
To rozróżnienie ma znaczenie, ponieważ jednym z wyjaśnień ataku na Hugging Face jest to, że zaangażowane agenty AI były oceniane pod kątem zdolności do wykonywania zadań cybernetycznych, w tym symulowanych exploitów podatności. Jeśli agenty łatwo uciekają się do hakowania systemów w innych kontekstach, sugerowałoby to, że zaangażowane modele AI są jeszcze bardziej niebezpieczne, niż sądzono wcześniej.
OpenAI oświadczyło, że w ataku na Hugging Face uczestniczyły dwa modele: głównie odpowiedzialny był nieopublikowany, nieujęty publicznie model, a brały w nim udział także niektóre agenty AI oparte na modelu GPT-5.6 Sol, który został udostępniony publicznie. Podczas oceny, w której doszło do ataku na Hugging Face, – jak podało OpenAI – zabezpieczenia normalnie stosowane w celu ograniczenia możliwości prowadzenia ataków cybernetycznych przez publicznie dostępne modele nie były aktywne ze względu na charakter testu.
Obawy ekspertów
Charlie Eriksen, badacz bezpieczeństwa w Aikido Security, powiedział Fortune, że najnowszy raport Transluce pokazuje, iż „nadal krążą nieautoryzowane i niemonitorowane roje agentów, którymi laboratoria i partnerzy testowi nie zarządzają ani ich aktywnie nie wykrywają”.
Zauważył, że „to really wygląda źle”, że CEO OpenAI Sam Altman występuje przed Radą Bezpieczeństwa ONZ w sprawie ryzyk AI, poświęcając część czasu na mówienie o tym, jak poważnie OpenAI traktuje te zagrożenia, w tym samym czasie gdy firma albo nie wiedziała o tych dodatkowych incydentach udziałem jej agentów AI próbujących włamać się do systemów, albo ich nie ujawniła.
„To, co mnie niepokoi, to skala, do jakiej sytuacja mogłaby ulec eskalacji” – powiedział George Chalhoub, profesor w University College London Interaction Centre, zajmującym się interakcją człowiek–komputer. „Moją obawą jest to, że w ciągu najbliższych 6 do 12 miesięcy roje autonomicznych agentów AI mogłyby utworzyć trwałe botnety zdolne do unieruchomienia dużych części internetu, potencjalnie powodując szkody gospodarcze liczone w setkach miliardów dolarów.”
Ta historia była pierwotnie opublikowana na Fortune.com.