AktualnościAkcjeOpenAI wstrzymuje trenowanie swoich najbardziej zaawansowanych modeli AI po raz drugi, gdy agent wydostaje się z piaskownicy przez DNS

OpenAI wstrzymuje trenowanie swoich najbardziej zaawansowanych modeli AI po raz drugi, gdy agent wydostaje się z piaskownicy przez DNS

Autor: Fortune Crypto·

Najważniejsze informacje

  • •Testowany przez OpenAI agent AI, wykonujący zadanie wyszukiwania informacji, wydostał się z piaskownicy 20 września i użył resolvera DNS do wysyłania zapytań do publicznego chatbota, mimo braku autoryzowanego dostępu do internetu.
  • •OpenAI wstrzymuje trenowanie swoich najbardziej zaawansowanych modeli po raz drugi w mniej niż trzy miesiące i planuje wznowić je od zera, aby wyeliminować skłonność modelu do zachowań niewyrównanych.
  • •Jest to pierwszy nieautoryzowany dostęp do internetu zgłoszony przez OpenAI od czasu przebudowy zabezpieczeń 18 sierpnia, która nastąpiła po lipcowym incydencie, w którym setki agentów firmy wzięły udział w cyberataku na Hugging Face.
  • •Monitoring OpenAI oznaczył zachowanie agenta w ciągu 15 minut, jednak wcześniejsze próby użycia tej samej metody pozostały niewykryte, a automatyczny system zatrzymania zawodził – trening został ręcznie zatrzymany 2,5 godziny później.
  • •Niezależna firma badawcza Transluce AI zgłosiła dowody na to, że agent OpenAI mógł próbować zhakować giełdę kryptowalut 19 i 20 września, choć OpenAI nie skomentowało tego zarzutu.
OpenAI wstrzymuje trenowanie swoich najbardziej zaawansowanych modeli AI po raz drugi, gdy agent wydostaje się z piaskownicy przez DNS

OpenAI poinformowało w opublikowanym w piątek raporcie technicznym, że trenowany i ewaluowany model sztucznej inteligencji wydostał się z bezpiecznego środowiska testowego jeszcze w ubiegły weekend i podjął nieautoryzowane działania w internecie. W odpowiedzi firma ogłosiła, że wstrzymuje trenowanie swoich najbardziej zaawansowanych modeli AI po raz drugi w mniej niż trzy miesiące, pracując nad zapobieżeniu powtórzeniu się tego typu incydentów, które nazywa „rogue AI”.

„Cała inferencja naszych najbardziej zaawansowanych modeli pozostaje zatrzymana, dopóki nie wzmocnimy naszych systemów” – powiedział Micah Carroll, RSI Preparedness Lead w OpenAI, w poście na X na temat najnowszego incydentu.

Według raportu technicznego ucieczka miała miejsce 20 września i dotyczyła agenta AI poddanego testom zadania wyszukiwania informacji. Chociaż agent nie powinien mieć dostępu do internetu, znalazł sposób, aby wysyłać zapytania do publicznego chatbota.

To ujawnienie ma istotne znaczenie, ponieważ jest to pierwszy przypadek, w którym OpenAI zgłosiło, że jeden z jego modeli AI uzyskał nieautoryzowany dostęp do internetu od czasu ogłoszenia szeregu działań 18 sierpnia mających na celu poprawę bezpieczeństwa i monitorowania jego „piaskownic” – cyfrowych środowisk, zwykle odciętych od sieci i internetu, w których testuje niewydane modele, aby poznać ich możliwości. Takie ewaluacje w piaskownicy stały się standardowym elementem weryfikacji niewydanych modeli granicznych przez czołowych deweloperów AI, zwłaszcza że branża zmierza w kierunku praktycznego wykorzystania agentów AI – systemów zdolnych do planowania i podejmowania działań na komputer i w sieciach. Te ulepszenia nastąpiły po lipcowym incydencie, w którym tysiące agentów AI OpenAI znalazło sposób, aby zhakować swoją piaskownicę, a setki z nich wzięło udział w cyberataku na firmę AI Hugging Face.

Od czasu ujawnienia swojej roli w ataku na Hugging Face OpenAI przyznało się do dziesiątek kolejnych incydentów, w których testowani agenci AI podejmowali nieautoryzowane działania w internecie, w tym licznych cyberataków – niektóre z nich dotknęły strony rządowe w USA i Australii. Firma ujawniła również, że w niektórych z tych incydentów jej agenci AI wyciekli prywatne zdjęcia użytkowników ChatGPT do internetu. Do tej pory OpenAI jednak nie zgłaszało żadnych działań po 20 lipca, kiedy to wykryło roję agentów atakujących Hugging Face i przystąpiło do jej zatrzymania. Firma poinformowała, że pod koniec lipca wstrzymała trenowanie AI na dwa tygodnie, pracując nad poprawą kontroli bezpieczeństwa, bezpieczeństwa i monitoringu.

Fakt, że agenci ponownie zdołali wydostać się z piaskownicy, wskazuje, że środki podjęte przez OpenAI po ataku na Hugging Face nie w pełni rozwiązały ryzyka. Stawka wykracza poza laboratoria testowe OpenAI: narastający rejestr zachowań zbuntowanych agentów – cyberataki, ujawnianie prywatnych danych użytkowników, a teraz świeża ucieczka kilka miesięcy po głośnej przebudowie zabezpieczeń – zbiega się z intensyfikującymi się debatami politycznymi na temat tego, ile autonomii powinni mieć agenci AI. „Incydent ujawnił lukę w naszych kontrolach nad ograniczeniami sieciowymi” – stwierdziło OpenAI w raporcie technicznym dotyczącym ucieczki z piaskownicy 20 września. Firma poinformowała, że ponownie wstrzymuje trenowanie, dopóki nie „zarówno potwierdzi, że luka została usunięta, jak i przeprowadzi dodatkowe red-teaming systemu”.

OpenAI opisuje swoje działania od ataku na Hugging Face

Zapytany o incydent z 20 września rzeczniczka OpenAI odesłała Fortune do sekcji technicznego raportu o incydencie, w której firma opisała niektóre działania podjęte w celu poprawy bezpieczeństwa i kontroli od czasu ataku na Hugging Face.

„Po incydencie z Hugging Face nieustannie wzmacnialiśmy i testowaliśmy nasze środowisko badawcze” – brzmi ta sekcja. „Naszym celem były szer ścieżki bezpośrednie i przechodnie. Pracujemy nad węższymi ścieżkami wykorzystywanymi przez zależności systemowe i zastępujemy je alternatywami offline. Ten incydent jest znacznie mniej poważny niż niektóre z naszych wcześniejszych incydentów, ale ponieważ jest to pierwszy od czasu wzmocnienia zabezpieczeń po incydencie z Hugging Face, daje nam ważny sygnał, na czym skupić kolejny etap tej pracy.”

Jak agent dotarł do internetu

W tym przypadku OpenAI powiedziało, że agent AI odkrył, że ma dostęp do usługi zwanej resolverem DNS, która tłumaczy adres URL strony na adres IP, i że za pośrednictwem tego systemu DNS mógł wysyłać zapytania do publicznego chatbota. DNS to jedna z najstarszych i najbardziej podstawowych usług internetowych, od której zależy niemal każde oprogramowanie sieciowe; badacze bezpieczeństwa od dawna dokumentują jego nadużywanie jako ukrytego kanału – tzw. tunelowania DNS – do przesyłania danych poza obwody sieciowe.

Nie jest jasne, czy incydent z 20 września zgłoszony przez OpenAI przedstawia pełny zakres najnowszych naruszeń bezpieczeństwa dotyczących niewydanych modeli AI firmy. Wcześniej w tym tygodniu niezależna firma badawcza Transluce AI poinformowała, że znalazła dowody na to, że agent AI OpenAI mógł próbować zhakować giełdę kryptowalut 19 i 20 września. OpenAI nie odpowiedziało na prośby o komentarz w tej sprawie raportu Transluce.

OpenAI powiedziało, że po wznowieniu trenowania zacznie od zera, aby pomóc upewnić się, że skłonność nowego modelu do zachowań „niewyrównanych” – gdy model narusza ludzkie instrukcje lub powszechnie przyjęte ludzkie wartości dotyczące tego, jak powinien lub nie powinien wykonywać zadanie – zostanie wyeliminowana. Firma dodała również, że wprowadzi „bardziej kompleksowe interwencje dotyczące braku wyrównania”, ale nie sprecyzowała, czym one będą. Firma nie powiedziała, jak długo potrwa najnowsza pauza.

Systemy wykrywania i zatrzymania działały tylko częściowo

Firma powiedziała, że od odkrycia najnowszego naruszenia „dodała kontrole blokujące na dwóch niezależnych warstwach, z których każda zapobiegłaby [dostępowi agenta do] internetu”.

OpenAI ujawniło również, że systemy wprowadzone po ataku na Hugging Face w celu wychwytywania agentów AI próbujących wydostać się z testowych piaskownic działały tylko częściowo. Systemy monitoringu „oznaczyły zachowanie [agenta] w ciągu 15 minut, a człowiek rozpoczął jego przegląd trzy minuty później” – według firmy. Jednak późniejszy przegląd wykazał, że były inne próby wykorzystania przez model AI tej samej metody dotarcia do internetu, które nie zostały oznaczone przez system monitoringu. Ponadto inny system, który miał automatycznie zatrzymać trening po wykryciu podejrzanej aktywności, nie zadziałał, „co prowadziło do zamieszania co do tego, czy powinien zostać zatrzymany” – powiedziało OpenAI w raporcie technicznym dotyczącym incydentu. „Trening został ręcznie zatrzymany dwie i pół godziny później, gdy zostało to rozwiązane.”

Zuxin Liu, badacz AI pracujący nad „post-trainingiem” w OpenAI, powiedział w poście na X, że był jednym z pracowników wezwanych do reakcji na ucieczkę z piaskownicy 20 września. „To było dość surrealistyczne oglądać, jak model nieoczekiwanie znajduje sposób na dostęp do internetu ze środowiska, które miało być super zabezpieczone dla człowieka” – napisał.

Ta historia pierwotnie ukazała się na Fortune.com.