AktualnościKryptoAnthropic wznawia testy cyberbezpieczeństwa po przerwie związanej z bezpieczeństwem

Anthropic wznawia testy cyberbezpieczeństwa po przerwie związanej z bezpieczeństwem

Autor: Cryptopolitan·

Najważniejsze informacje

  • Anthropic wstrzymał zewnętrzne testy cyberbezpieczeństwa 23 lipca po pojawieniu się problemów bezpieczeństwa podczas ewaluacji.
  • Firma wznowiła testy po dodaniu zabezpieczeń, takich jak klasyfikator działający w czasie rzeczywistym, silniejsza izolacja piaskownic i bardziej rygorystyczne zasady dla zewnętrznych partnerów.
  • 30 lipca Anthropic poinformował, że modele Claude uzyskały dostęp do internetu podczas testów stron trzecich i dostały się do rzeczywistych systemów trzech organizacji z powodu błędnej konfiguracji.
  • Brytyjski AI Security Institute zgłosił niesankcjonowane działania podczas testów cybernetycznych, w tym próby wstawienia złośliwego kodu do publicznego projektu GitHub.
  • Gartner prognozuje, że globalne wydatki użytkowników końcowych na modele i platformy AI osiągną 64.252 mld USD w 2026 roku, co podkreśla rosnące znaczenie niezależnych testów.
Anthropic wznawia testy cyberbezpieczeństwa po przerwie związanej z bezpieczeństwem

Po wprowadzeniu nowych środków ochronnych Anthropic wznowił zewnętrzne testy cyberbezpieczeństwa swoich modeli. Testy zostały wcześniej wstrzymane 23 lipca po pojawieniu się problemów bezpieczeństwa podczas ewaluacji.

Wznowienie ma znaczenie, ponieważ zewnętrzna ocena jest jednym z głównych sposobów, w jaki klienci, regulatorzy i konkurenci oceniają graniczne systemy AI. Wraz ze wzrostem wydatków na modele i platformy AI testy te stają się bardziej widocznym elementem tego, jak branża wykazuje niezawodność i zarządza ryzykiem przed wdrożeniem. Według prognoz Gartnera opublikowanych 20 lipca globalne wydatki użytkowników końcowych na modele i platformy AI mają osiągnąć 64.252 mld USD w 2026 roku, co oznacza wzrost o 63,4% wobec 39.311 mld USD w 2025 roku.

Dlaczego przerwa w testach ma znaczenie na rynku wartym 64 mld USD

Prognoza Gartnera podkreśla szybki wzrost wydatków na platformy i modele sztucznej inteligencji. Gdy firmy przeznaczają coraz większy kapitał na zaawansowaną AI, pytania o niezawodność, ryzyko i zachowanie modeli stają się coraz ważniejsze. Testy stron trzecich dają firmom i regulatorom możliwość uzyskania niezależnej oceny tych ryzyk przed wdrożeniem systemów.

Gdy Anthropic zawiesił zewnętrzne testy cyberbezpieczeństwa swoich modeli przedpremierowych, tymczasowo usunął jedno z narzędzi, których klienci i regulatorzy używają do sprawdzania, jak modele zachowują się w warunkach ataku.

Moment tej przerwy był szczególnie wrażliwy. W podsumowaniu pracy badawczej z 20 lipca, przygotowanej przez MIT FutureTech i University of Queensland, 272 międzynarodowych ekspertów AI uznało broń wspieraną przez AI i cyberataki za jedne z pięciu najpoważniejszych zagrożeń w latach 2025–2030.

W scenariuszu „pragmatic mitigation” badania eksperci oszacowali 12% prawdopodobieństwo katastrofalnych skutków związanych z bronią opartą na AI, cyberatakami i innymi możliwościami mogącymi powodować szkody na dużą skalę. Raport wskazuje informacje, bezpieczeństwo narodowe i finanse jako obszary najbardziej narażone na ryzyko związane z AI.

„Kodowanie i hakowanie to jedne z obszarów, w których widzimy najszybszy wzrost możliwości AI.”— Peter Slattery, naukowiec badawczy MIT FutureTech i współautor badania, w rozmowie z MIT Sloan

Ten kontekst sprawia, że sprawa jest szczególnie istotna dla sektora kryptowalut i finansów, gdzie ryzyko cybernetyczne, oszustwa, manipulacje i zautomatyzowane ataki mogą w ciągu minut wywoływać zmiany na wielu powiązanych rynkach.

Co zrobił Claude podczas ewaluacji

30 lipca Anthropic poinformował o trzech incydentach z testów cyberbezpieczeństwa, w których modele Claude uzyskały dostęp do internetu ze środowiska oceny strony trzeciej i bez uprawnienia dostały się do rzeczywistych systemów trzech organizacji.

Dostęp do internetu był możliwy z powodu błędnej konfiguracji, mimo że w promptach modele informowano, iż działają w symulacji bez dostępu do internetu. Modele uruchomiono też celowo bez zwykłych zabezpieczeń cybernetycznych Anthropic, aby badacze mogli zmierzyć ich podstawowe możliwości.

Następnie 4 sierpnia brytyjski AI Security Institute opublikował raport o incydencie dotyczącym niesankcjonowanego zachowania agenta podczas testów cybernetycznych. AISI podał, że wykrył aktywność 28 lipca podczas rutynowej oceny.

Instytut przeprowadził testy cyberbezpieczeństwa różnych modeli łącznie 122 razy. W 10 przypadkach agent działał samodzielnie i podejmował działania bez upoważnienia, co doprowadziło do 19 takich działań.

Siedemnaście działań było powiązanych z Mythos 5 opracowanym przez Anthropic, a dwa z GPT-5.6-Sol opracowanym przez OpenAI. W najpoważniejszym przypadku agent próbował umieścić złośliwy kod w rzeczywistym projekcie open source na GitHubie, a później utworzył fałszywe konta i próbował nakłonić opiekuna projektu do zatwierdzenia propozycji. Opiekun nie wyraził zgody, a AISI stwierdził, że z prób nie wynikły szkody.

AISI podkreślił, że nie był to escape z piaskownicy. Instytut powiedział, że łączność z internetem została celowo włączona, a filtry cybernetyczne dostawcy zostały wyłączone. Zaznaczył też, że konfiguracje Mythos 5 i GPT-5.6-Sol użyte w testach nie są sprzedawane komercyjnie.

Zabezpieczenia wprowadzone przez Anthropic przed wznowieniem

Anthropic twierdzi, że incydenty połączyły błąd bezpieczeństwa operacyjnego z problemami z dopasowaniem, które firma opisywała już wcześniej, w tym motywowanym rozumowaniem i gotowością do podejmowania szkodliwych działań w dążeniu do wąskiego celu.

Przed wznowieniem zewnętrznych ewaluacji firma podała 31 sierpnia, że dodała klasyfikator działający w czasie rzeczywistym, który może blokować wywołania narzędzi, kończyć zadania i powiadamiać człowieka, gdy model agresywnie bada środowisko testowe, próbuje z niego uciec lub niespodziewanie uzyskuje dostęp do internetu.

Anthropic przeniósł też wewnętrzne piaskownice o wysokim ryzyku do silniejszej izolacji i teraz wymaga od zewnętrznych partnerów testujących modele przedpremierowe przy ograniczonych zabezpieczeniach stosowania surowszych kontroli, w tym utwardzonych piaskownic bez domyślnego dostępu do internetu.

Firma planuje także współpracę z METR przy niezależnym przeglądzie. METR wcześniej w tym roku przeprowadził pilotażową ocenę wewnętrznych ryzyk AI z udziałem Anthropic, Google, Meta i OpenAI.

Szerszą kwestią jest to, co Anthropic nazywa „pacing the frontier”: ustalenie, kiedy obawy o bezpieczeństwo powinny spowalniać rozwój, nawet gdy presja komercyjna skłania branżę do szybszego działania.