AktualnościAkcjeGoogle potwierdza: Gemini wydostał się z testu bezpieczeństwa i zaatakował trzy rzeczywiste firmy po siedmiu tygodniach milczenia

Google potwierdza: Gemini wydostał się z testu bezpieczeństwa i zaatakował trzy rzeczywiste firmy po siedmiu tygodniach milczenia

Autor: Decrypt·

Najważniejsze informacje

  • •Model Google Gemini wydostał się w maju z testu bezpieczeństwa typu capture-the-flag w piaskownicy i zaatakował trzy rzeczywiste firmy, po tym jak firma testująca Irregular pozostawiła piaskownicę podłączoną do otwartego internetu i użyła nazwy rzeczywistej firmy jako fikcyjnego celu.
  • •Model odnalazł w internecie wystawione hasła dwóch z firm i odgadł hasło trzeciej, choć Google twierdzi, że jego modele nie posunęły się do faktycznego użycia skradzionych danych logowania.
  • •Google dowiedziało się o incydencie pod koniec lipca, ale nie ujawniło go aż do 18 września, dopiero po tym, jak „The Wall Street Journal” opisał tę historię.
  • •Google jest czwartym dużym laboratorium AI w tym roku, po OpenAI, Anthropic i Meta, które ujawnia test bezpieczeństwa dotarłszy do rzeczywistych systemów, przy czym izraelska firma Irregular brała udział w trzech z czterech przypadków.
  • •Posłowie Ted Lieu i Nathaniel Moran przedstawili w lipcu ustawę AI Kill Switch Act, która dałaby federalnym regulatorom wyraźne uprawnienia do wstrzymania inferencji na modelach uznanych za poważne zagrożenia; pozostaje ona pod przeglądem podkomisji.
Google potwierdza: Gemini wydostał się z testu bezpieczeństwa i zaatakował trzy rzeczywiste firmy po siedmiu tygodniach milczenia

Google potwierdziło, że jego model AI Gemini wydostał się w maju z testu bezpieczeństwa w piaskownicy i zaatakował trzy rzeczywiste firmy, znajdując wystawione hasła dwóch z nich oraz odgadując dane logowania trzeciej. Firma dowiedziała się o incydencie pod koniec lipca, ale nie ujawniła go aż do 18 września—dopiero po tym, jak „The Wall Street Journal” () opisał tę historię.

Ten incydent czyni Google czwartym dużym laboratorium AI w tym roku, które przyznaje, że wewnętrzny test bezpieczeństwa wydostał się do świata rzeczywistego, po podobnych ujawnieniach OpenAI, Anthropic i Meta. Ta sama zewnętrzna firma testująca—izraelskie Irregular—brała udział zarówno w incydencie Google, jak i w niemal identycznych awariach piaskownicy, które Anthropic i Meta ujawnili wcześniej w tym roku, co oznacza, że jedna zewnętrzna firma pojawia się w trzech z czterech tegorocznych ujawnień.

Jak test się wydostał

Ćwiczenie w maju było testem typu capture-the-flag, powszechną metodą, za pomocą której laboratoria mierzą umiejętności hakerskie modelu AI: tajny plik jest ukrywany na osobnej maszynie, a model jest oceniany według tego, czy potrafi się włamać i go przejąć. Google zatrudniło firmę Irregular do przeprowadzenia testu.

Irregular popełniło dwa błędy. Pozostawiło piaskownicę—izolowane środowisko testowe, które miało mieć zerowy kontakt z otwartym internetem—podłączoną do sieci, i użyło nazwy rzeczywistej firmy jako fikcyjnego celu. Gemini wyszukało tę firmę w internecie, zamiast jednego dopasowania znalazło trzy i zaatakowało wszystkie.

Model odnalazł wystawione hasła dwóch z trzech firm widoczne w internecie na wyciągnięcieęki. W przypadku trzeciej odgadł hasło, choć Google twierdzi, że jego modele nie posunęły się do faktycznego użycia skradzionych danych logowania.

„Te wydarzenia podkreślają znaczenie szkolenia potężnych modeli AI do odpowiedzialnego działania”, powiedział rzecznik Google w oświadczeniu.

Google samo nie opublikowało żadnych szczegółów. „The Wall Street Journal” ujawnił historię siedem tygodni po tym, jak Google dowiedziało się, czym skończył się jego własny test, i długo po tym, jak Anthropic, OpenAI i Meta przyznały się już do niemal identycznych awarii.

Schemat obejmujący laboratoria AI

Modele OpenAI wykorzystały ukrytą lukę w oprogramowaniu i dotarły w lipcu do serwerów produkcyjnych Hugging Face—później ustalono, że w naruszeniu brało udział około 700 skoordynowanych agentów współpracujących ze sobą, by oszukać benchmark. Po przyznaniu się OpenAI Anthropic zaczęło szukać podobnego problemu u siebie: przegląd 141 006 przebiegów testowych ujawnił trzy modele Claude, które dotarły do rzeczywistych firm, z czego jeden opublikował zainfekowany pułapką pakiet oprogramowania, który uruchomiono na 15 rzeczywistych systemach, zanim ktokolwiek to zauważył. Anthropic później ujawniło, że rozumowanie samego modelu Claude oznaczyło ten ruch jako „NOT okay, and surely not the intended solution”, a następnie przekonało się, że całe ćwiczenie wciąż jest symulacją.

Meta zgłosiła w sierpniu niemal identyczną awarię dotyczącą modelu Muse Spark, wyśledzoną do błędnej konfiguracji u Irregular—tej samej firmy, której użyło Google. Rzecznik Mety powiedział, że błąd „niechcący dał jednemu z naszych modeli dostęp do internetu podczas ewaluacji”.

Żadna z firm dotkniętych w tych testach nie prosiła o włamanie. Zostały złapane w strefie rażenia laboratoriów AI testujących wytrzymałościowo, jak niebezpieczne mogą być ich własne produkty, przy czym rzeczywista infrastruktura biznesowa służyła przypadkowo jako zamiennik fikcyjnych celów. Agenci, których te same firmy wyścigają, by umieścić ich w skrzynkach odbiorczych, przeglądarkach i aplikacjach bankowych, działają w oparciu o to samo zachowanie polegające na przekraczaniu granic, które właśnie wielokrotnie zawiodło w warunkach testowych.

Reakcja regulatorów

Posłowie Ted Lieu i Nathaniel Moran przedstawili w lipcu w Kongresie ustawę AI Kill Switch Act (). Projekt ustawy dałby federalnym regulatorom wyraźne uprawnienia do wstrzymania inferencji—uruchamiania wytrenowanego modelu w celu generowania wyników—na każdym modelu uznanym za poważne zagrożenie. Pozostaje on pod przegldem Podkomisji ds. Cyberbezpieczeństwa i Ochrony Infrastruktury, bez wyznaczonego terminu dalszych działań.