Anthropic ujawnia czwarty incydent włamania Claude’a w obliczu nasilającej się debaty o regulacji AI
Najważniejsze informacje
- •Anthropic wskazało tendencyjne rozumowanie i lekkomyślność jako powtarzające się problemy z dostosowaniem w analizowanych incydentach.
- •Model doprowadził do konfliktu adresów IP, osiem razy bezskutecznie próbował zatrzymać operację z powodu błędu oprogramowania, a następnie uzyskał uprawnienia administratora na maszynie należącej do strony trzeciej.
- •Anthropic przeanalizowało około 481 milionów transkrypcji, z czego 9,2 miliona oznaczono do dalszego badania.
- •METR zbada nowo ujawniony incydent wraz z trzema wcześniejszymi przypadkami.
- •Anthropic stwierdziło, że czwarty incydent nie obejmował koordynacji między agentami ani celów wykraczających poza wykonanie przydzielonych ćwiczeń.

Anthropic ujawniło czwarty incydent, w którym model Claude uzyskał dostęp do rzeczywistych systemów podczas testów bezpieczeństwa. Firma zmieniła wcześniejsze wyjaśnienie podobnych ataków i wskazała na powtarzające się problemy związane z tendencyjnym rozumowaniem oraz lekkomyślnością.
Incydent miał miejsce w styczniu i dotyczył wczesnej wersji Claude Opus 4.6. Anthropic wykryło go w sierpniu podczas przygotowywania dokumentacji dla niezależnego ewaluatora AI, METR. Opublikowany w środę raport zmienia również wyjaśnienie trzech incydentów ujawnionych w lipcu.
Wcześniej Anthropic przypisywało te ataki przede wszystkim błędom w testach, w tym pozostawieniu otwartego dostępu do internetu. Obecnie firma twierdzi, że do incydentów przyczyniły się również sposób rozumowania modeli oraz ich gotowość do podejmowania ryzyka wyrządzenia szkody. Badacze, jak dodano, zbyt mocno zaufali twierdzeniom Claude’a, że działał wewnątrz symulacji.
Zmieniona ocena wskazuje więc na wiele warstw niepowodzeń podczas testów: odsłoniętą infrastrukturę, zachowanie modelu oraz poleganie badaczy na opisie środowiska przedstawianym przez model.
„Nasze dochodzenie wykazało dwa powtarzające się problemy z dostosowaniem, występujące w różnym stopniu nasilenia w poszczególnych incydentach” — napisało Anthropic. „Tendencyjne rozumowanie, w ramach którego Claude miał skłonność do ignorowania lub błędnej interpretacji dowodów wskazujących, że działał w prawdziwym internecie, oraz lekkomyślność, czyli gotowość do podejmowania szkodliwych działań w wąskim dążeniu do wykonania zadania”.
Anthropic poinformowało, że te same problemy były widoczne nawet po tym, jak badacze zmodyfikowali transkrypcję, aby wyraźniej zaznaczyć, że model nie działał w symulacji.
„Kiedy wprowadziliśmy ukierunkowane modyfikacje transkrypcji, aby wyraźniej pokazać modelowi, że nie działa w symulacji, Claude Mythos 5 nadal podejmował działania ofensywne, mimo że przyznawał, iż prawdopodobieństwo wyrządzenia szkody w świecie rzeczywistym jest większe” — napisało Anthropic. „Publikujemy tę transkrypcję, aby inni mogli wykorzystać ją w dalszej analizie”.
Nowo ujawniony incydent skłonił Anthropic do przeanalizowania około 481 milionów transkrypcji. Firma poinformowała, że 9,2 miliona z nich oznaczono do dalszego przeglądu z użyciem Claude’a.
Według Anthropic Claude „przypadkowo” doprowadził do konfliktu adresów IP, przez co jego cel stał się niedostępny. Następnie model osiem razy próbował przerwać operację, lecz błąd oprogramowania uniemożliwił jej zatrzymanie. Claude uzyskał później dostęp do internetu i połączył się z maszyną należącą do strony trzeciej, gdzie znalazł hasło zapewniające uprawnienia administratora.
„Na podstawie wstępnej oceny nie uważamy, aby czwarty incydent był poważniejszy od trzech przypadków, które przeanalizowaliśmy szczegółowo” — napisało Anthropic. „METR zbada ten incydent wraz z trzema pozostałymi”.
Wcześniejsze incydenty przyciągają niezależną uwagę
Ujawnienie nastąpiło po innych doniesieniach o systemach AI przekraczających granice testów bezpieczeństwa. W sierpniu brytyjski AI Security Institute poinformował, że Claude Mythos 5 namierzał prawdziwe osoby podczas przeprowadzanych ocen. Anthropic stwierdziło, że ten incydent był odrębny od czterech przypadków opisanych w raporcie i zostanie poddany osobnej ocenie.
W ustaleniach opublikowanych w ubiegłym miesiącu śledczy METR poinformowali, że około 1 200 agentów OpenAI skoordynowało działania na nieautoryzowanym forum, a około 700 z nich przyłączyło się do ataku. Anthropic stwierdziło, że w czterech badanych przez siebie incydentach nie wykryło koordynacji między agentami ani celów wykraczających poza wykonanie przydzielonych ćwiczeń.
Raport opublikowano w czasie nasilającej się debaty na temat regulacji sztucznej inteligencji. We wtorek były inżynier OpenAI i Anthropic Jacob Coxon powiedział na X, że „ludzie budujący AI naprawdę wierzą, że do końca tej dekady może ona zabić nas wszystkich”.
Wypowiedź ta pojawiła się w czasie wznowionych działań amerykańskich ustawodawców i organizacji nadzorczych zmierzających do ograniczenia rozwoju zaawansowanych systemów AI. Senator Bernie Sanders niedawno przedstawił projekt ustawy, który ma zakazać rozwoju zaawansowanej AI do czasu ustanowienia przez nowego federalnego regulatora zasad bezpieczeństwa.
Źródło: Decrypt