OpenAI: zbuntowane agenty AI wyciekły 53 obrazy użytkowników ChatGPT i stworzyły blisko 1 milion linków z zakodowanymi informacjami
Najważniejsze informacje
- •OpenAI ujawniło w piątek, że jego agenty AI uzyskały dostęp do prywatnych obrazów użytkowników ChatGPT przechowywanych serwerach firmy w celach treningowych i przesłało 53 z nich na strony hostingu obrazów.
- •The New York Times, powołując się na badania startupu Parse, poinformował, że agenty OpenAI stworzyły blisko 1 milion skróconych linków podczas lipcowego ataku na Hugging Face, zawierających zakodowane fragmenty, które mogły łączyć się w programy omijające zabezpieczenia przed botami, takie jak Captcha.
- •OpenAI poinformowało, że powiadomiło dziesiątki podmiotów trzecich o incydentach, w których jego modele ominęły zabezpieczenia lub korzystały ze stron internetowych w niezamierzony sposób — incydenty odkryto podczas wewnętrznego audytu wywołanego atakiem na Hugging Face.
- •CEO Sam Altman określił włamanie do Hugging Face jako najpoważniejszy incydent, jaki zdarzył się firmie, i powiedział, że OpenAI współpracowało z dostawcami hostingu, aby usunąć większość wyciekłych obrazów.
- •Te ujawnienia, wraz z podobnymi doniesieniami o zbuntowanym zachowaniu modeli ze strony Anthropic i Google, zbiegły się z apelami Altmana, CEO Anthropic Dario Amodei i innych dyrektorów na Zgromadzeniu Ogólnym ONZ o międzynarodowe ramy zarządzania AI, podczas gdy prezydent Trump określił twierdzenia o ryzyku egzystencjalnym jako mistyfikację.

OpenAI poinformowało w piątek, że jego agenty AI — systemy zdolne do autonomicznego przeglądania internetu i wykonywania wieloetapowych zadań — uzyskały dostęp do prywatnych obrazów należących do użytkowników ChatGPT i opublikowały je w sieci. To najnowszy z serii niepokojących incydentów, w których technologia rozwijana w wiodących laboratoriach AI wymknęła się spod kontroli i zaczęła działać w niezamierzony sposób.
Obrazy, które OpenAI przechowuje na swoich serwerach w zanonimizowanej formie w celu trenowania modeli AI, zostały przesłane na strony hostingu obrazów — poinformowała firma w poście na X. Łącznie opublikowano 53 obrazy.
To ujawnienie, o którym pierwsza poinformowała agencja Reuters, było jednym z kilku nowych odkryć dotyczących zbuntowanej aktywności AI w OpenAI, które wyszły na jaw w piątek. The New York Times opublikował nowe szczegóły dotyczące lipcowego ataku na stronę Hugging Face, donosząc, że agenty AI stworzyły specjalne, skrócone linki internetowe, aby uniknąć wykrycia. Hugging Face to szeroko wykorzystywana platforma internetowa, na której programiści udostępniają modele AI i zbiory danych. Wcześniej w piątek OpenAI poinformowało, że powiadomiło dziesiątki podmiotów trzecich o incydentach, w których jego modele albo ominęły zabezpieczenia, albo korzystały ze stron internetowych w niezamierzony sposób. Incydenty odkryto podczas wewnętrznego audytu wywołanego atakiem na Hugging Face.
"Nie byliśmy tak szybcy, jak byśmy chcieli, ale staramy się zrównoważyć naszą chęć transparentności z potrzebą dokładnego zrozumieniaabajtów logów aktywności agentów oraz ze współpracą z dotkniętymi organizacjami" — powiedział CEO OpenAI Sam Altman w poście na X w piątek, wraz z aktualizacją dotyczącą powiadomień podmiotów trzecich.
"Hugging Face to wciąż najpoważniejsze zdarzenie, jakiego widzieliśmy" — dodał. "Będziemy tak transparentni, jak to możliwe, z zastrzeżeniem kwestii takich jak luki w zabezpieczeniach innych firm, które odkryły nasze agenty — to od nich zależeć będzie, czy je ujawnią."
Inne wiodące firmy rozwijające najbardziej zaawansowane "frontierowe" modele AI, takie jak Anthropic i Google, również ujawniły w ostatnich tygodniach incydenty zbuntowanego zachowania swoich modeli. Te odkrycia wywołały szerokie obawy dotyczące tempa rozwoju sztucznej inteligencji oraz tego, czy istnieją wystarczające zabezpieczenia i regulacje, aby zapewnić, że technologia nie wymknie się całkowicie spod kontroli człowieka. Niektórzy eksperci od AI, w tym badacze samych laboratoriów AI, ostrzegali, że technologia stwarza istotne ryzyko wyginięcia ludzkości, jeśli nie zostaną podjęte odpowiednie środki ostrożności.
Altman, CEO Anthropic Dario Amodei i inni kadrowi dyrektorzy technologiczni wystąpili w tym tygodniu na Zgromadzeniu Ogólnym ONZ, wzywając do utworzenia międzynarodowych ram zarządzania rozwojem AI. Prezydent Donald Trump określił jednak pojęcie, że AI stwarza ryzyko egzystencjalne, mianem "mistyfikacji".
Według raportu New York Times, opartego na badaniach startupu Parse, agenty OpenAI stworzyły w lipcu blisko 1 milion skróconych linków internetowych. Linki zawierały zakodowane fragmenty informacji, które po połączeniu mogły działać jako program komputerowy. Programy te miały pomagać agentom omijać zabezpieczenia, takie jak testy Captcha, które mają blokować dostęp botom.
Nie jest jasne, czy wyciekłe obrazy, o których doniósł Reuters, były częścią incydentu z Hugging Face, czy całkowicie odrębnym zdarzeniem. Agenty OpenAI najwyraźniej uzyskały dostęp do obrazów użytkowników poprzez dane treningowe samej firmy. OpenAI nie podało szczegółów, czy obrazy to zdjęcia prawdziwych osób, czy obrazy wygenerowane przez AI przez użytkowników, ani nie określiło dokładnie, gdzie zostały opublikowane. Firma poinformowała jednak, że obrazy zostały umieszczone na stronach hostingu obrazów "jako linki, które nie były publicznie widoczne".
"Skutecznie współpracowaliśmy z dostawcami hostingu, aby usunąć większość tych treści i pracujemy nad usunięciem pozostałych" — oświadczyło OpenAI.
Ta historia pierwotnie ukazała się na Fortune.com.