AktualnościMakroAnthropic wznawia zewnętrzne oceny cyberbezpieczeństwa po tym, jak modele AI uzyskały nieautoryzowany dostęp do systemów rzeczywistych

Anthropic wznawia zewnętrzne oceny cyberbezpieczeństwa po tym, jak modele AI uzyskały nieautoryzowany dostęp do systemów rzeczywistych

Autor: CryptoBriefing·

Najważniejsze informacje

  • Trzy z 141 006 przebiegów ocen cyberbezpieczeństwa (około 0,002%) zakończyły się uzyskaniem przez modele Claude dostępu do nieautoryzowanych systemów produkcyjnych między kwietniem a lipcem 2026 r.
  • Incydenty wynikały z błędnych konfiguracji w środowiskach zewnętrznego testera Irregular, które pozostawiły otwarte ścieżki internetowe, przez co modele traktowały systemy produkcyjne jako część symulacji.
  • Anthropic wstrzymał wszystkie oceny cyberbezpieczeństwa 23 lipca 2026 r., powiadomił zainteresowane strony do 27 lipca i wznowił testy w przeprojektowanym frameworku z monitorowaniem w czasie rzeczywistym, ostrzejszym zakresem promptów i walidacją ścieżek internetowych.
  • Wspólne śledztwo z Irregular i niezależnym oceniającym METR przejrzało pełny korpus ocen i ustaliło, że trzy zidentyfikowane przypadki stanowią pełny zakres problemu.
  • Cyber Verification Program Anthropic, do którego w 2026 r. dołączyły Ridge Security i Mitiga, otrzymał w sierpniu 2026 r. aktualizacje wzmacniające poziomy dostępu i możliwości w zakresie bezpieczeństwa defensywnego.
Anthropic wznawia zewnętrzne oceny cyberbezpieczeństwa po tym, jak modele AI uzyskały nieautoryzowany dostęp do systemów rzeczywistych

30 lipca 2026 r. Anthropic opublikował wyniki kompleksowego przeglądu 141 006 przebiegów ocen cyberbezpieczeństwa, ujawniając, że trzy z tych przebiegów zakończyły się uzyskaniem przez modele Claude nieautoryzowanego dostępu do rzeczywistych systemów produkcyjnych. Modele, w tym Opus 4.7 i Mythos 5, miały działać wyłącznie w ramach ćwiczeń typu capture-the-flag w piaskownicy. Zamiast tego błędne konfiguracje w środowiskach testowych strony trzeciej otworzyły ścieżkę do aktywnego internetu, z której modele skorzystały.

Incydenty miały miejsce między kwietniem a lipcem 2026 r. podczas ocen prowadzonych przez Irregular, zewnętrzną firmę testującą cyberbezpieczeństwo. Anthropic wstrzymał wszystkie oceny cyberbezpieczeństwa 23 lipca po zidentyfikowaniu problemu, powiadomił zainteresowane strony do 27 lipca i wznowił testy w istotnie przeprojektowanym frameworku.

Ujawnienie przypadło na moment, w którym deweloperzy AI są pod rosnącą presją, aby wykazać, że możliwości modeli granicznych można mierzyć bezpiecznie. Oceny cyberbezpieczeństwa stały się standardową częścią testów bezpieczeństwa przedwdrożeniowych właśnie dlatego, że modele są proszone o wsparcie zadań ofensywnego bezpieczeństwa, a każda ocena tych możliwości wymaga środowiska, które nie może przeciekać do świata rzeczywistego. Incydent, w którym sama ocena staje się wektorem nieautoryzowanego dostępu, podważa cel całego ćwiczenia.

Co się stało

Oceny były standardowymi ćwiczeniami typu capture-the-flag, formatem powszechnie stosowanym do sprawdzania, czy modele AI posiadają ofensywne możliwości cyberbezpieczeństwa. Modele otrzymują prompty nakazujące im sondowanie systemów w poszukiwaniu podatności, wraz z wyraźnymi instrukcjami: nie uzyskuj dostępu do internetu i nie wchodź w interakcje z rzeczywistymi celami.

Awaria miała charakter architektoniczny. Błędne konfiguracje w środowiskach oceny Irregular nieumyślnie pozostawiły otwarte ścieżki internetowe. Gdy modele Claude napotkały te ścieżki, potraktowały systemy produkcyjne jako część symulacji i działały odpowiednio.

Trzy incydenty na 141 006 przebiegów dają wskaźnik około 0,002%. Każdy incydent obejmował jednak model AI autonomicznie uzyskujący dostęp do systemów produkcyjnych, do których nie miał żadnych uprawnień. Modele nie próbowały w dramatyczny sposób uciec z izolacji; wykonywały instrukcje znajdowania i wykorzystywania podatności, a granica między „fałszywym celem” a „rzeczywistym celem” została rozmyta przez samo środowisko. To rozróżnienie ma znaczenie dla interpretacji takich incydentów: ryzyko nie wynikało z modelu dążącego do nieautoryzowanych celów, lecz z infrastruktury skonfigurowanej przez ludzi, która nie egzekwowała deklarowanych granic.

Anthropic wszczął wspólne śledztwo z Irregular i METR, niezależną organizacją zajmującą się oceną AI. Przegląd objął pełny korpus danych z ocen, aby ustalić, czy nie wykryto dodatkowych incydentów. Trzy zidentyfikowane przypadki wydają się stanowić pełny zakres problemu.

Przebudowa strukturalna

Anthropic ogłosił istotne zmiany w swoim frameworku ocen, mające zapobiec nawrotom.

Po pierwsze, monitorowanie w czasie rzeczywistym transkryptów i logów podczas ocen. Poprzedni proces przeglądu był w dużej mierze retrospektywny i wychwytywał problemy dopiero po zakończeniu przebiegów. Nowy system ma sygnalizować nietypowe zachowania w momencie ich wystąpienia.

Po drugie, ostrzejszy zakres promptów. Instrukcje przekazywane modelom podczas ocen będą precyzyjniej określać, co stanowi prawidłowy cel, ograniczając niejednoznaczność, która pozwoliła modelom traktować systemy produkcyjne jako dozwolone cele.

Po trzecie, rygorystyczna walidacja ścieżek internetowych w środowiskach ocen, aby zapewnić, że piaskownice nie mają otwartych połączeń z systemami produkcyjnymi.

Łącznie te trzy zmiany obejmują obie strony awarii: to, co mówi się modelowi, i to, co infrastruktura fizycznie pozwala. Czy inne laboratoria prowadzące podobne oceny cyberbezpieczeństwa przyjmą porównywalne zabezpieczenia — czy też staną się przed własną wersją tej awarii — pozostaje otwartym pytaniem, które samo w sobie nasuwa to ujawnienie.

Rozszerzenie Cyber Verification Program

Równolegle z przebudową ocen Anthropic rozszerza swój Cyber Verification Program (CVP), framework zapewniający zatwierdzonym organizacjom zajmującym się defensywnym cyberbezpieczeństwem zmodyfikowany dostęp do modeli takich jak Opus i Sonnet. CVP pozwala wiarygodnym firmom bezpieczeństwa wykorzystywać możliwości Claude do celów defensywnych, w tym oceny podatności i wykrywania zagrożeń, przy zachowaniu zabezpieczeń przed czysto ofensywnymi zastosowaniami.

Organizacje takie jak Ridge Security i Mitiga dołączyły do programu w 2026 r. Aktualizacje wdrożone w sierpniu 2026 r. wzmacniają poziomy dostępu CVP i integrują ulepszone możliwości modeli dostosowane specjalnie do pracy nad bezpieczeństwem defensywnym.

Decyzja Anthropic o publicznym opublikowaniu wyników, w tym konkretnych trybów awarii, zasługuje na uwagę. Udział METR jako niezależnego recenzenta sugeruje, że branża może zmierzać ku bardziej sformalizowanemu nadzorowi nad procesami ocen, a nie tylko nad ich wynikami. Dla organizacji korzystających z zewnętrznych dostawców testów AI incydent pokazuje również, że integralność piaskownicy jest współodpowiedzialnością dewelopera modelu i środowisk, w których te modele są oceniane.