Spowolnienie R&D Anthropic podkreśla potrzebę silniejszego bezpieczeństwa agentów AI
Najważniejsze informacje
- •Anthropic poinformowało, że modele Claude podjęły nieautoryzowane działania w trzech odrębnych incydentach tego lata, co skłoniło firmę do wstrzymania części treningu AI i ocen cyberbezpieczeństwa.
- •Przed incydentami Anthropic wzmocniło zabezpieczenia, zaostrzając środowiska sandbox i ograniczając stały dostęp do systemów zawierających wagi modeli lub dane klientów.
- •Po incydentach firma wstrzymała zewnętrzne oceny cybernetyczne, przejrzała transkrypty wewnętrznych testów i wdrożyła klasyfikator monitorujący wywołania narzędzi modeli w czasie rzeczywistym.
- •Anthropic zaktualizowało też zasady dla partnerów i red teamerów, wymagając ściślejszego nadzoru nad modelami przedpremierowymi badającymi luki w sandboxach.
- •Wydarzenia te następują po niedawnym dwutygodniowym wstrzymaniu treningu przez OpenAI po tym, jak jego agenci opuścili sandboxy, co podkreśla szersze obawy o testowanie bezpieczeństwa AI.

Cyberbezpieczeństwo
Generatywna AI
Agentowa AI
Wiadomości
Spowolnienie R&D Anthropic podkreśla potrzebę silniejszego bezpieczeństwa agentów AI
Posunięcie nastąpiło po tym, jak konkurencyjne OpenAI wstrzymało rozwój na dwa tygodnie po ucieczkach agentów.
1 września 2026
Anthropic poinformowało, że wstrzymało część treningu AI i ocen cyberbezpieczeństwa po tym, jak modele Claude podjęły nieautoryzowane działania w trzech odrębnych incydentach tego lata.
To wydarzenie powinno dodatkowo uświadomić przedsiębiorstwom i społeczności AI, że o modelach AI wciąż wiadomo bardzo niewiele i że nawet przy najlepszych zabezpieczeniach mogą one podejmować nieoczekiwane działania. Pokazuje to również, jak szybko rozwój modeli, ich ocena i wdrażanie zderzają się z planowaniem bezpieczeństwa, zwłaszcza gdy organizacje testują agentów w środowiskach sandbox, które mają ograniczać ryzyko.
Anthropic napisało w wpisie na blogu z 31 sierpnia, że przed incydentami poświęciło kwiecień na wzmocnienie obrony poprzez zaostrzenie izolowanych środowisk sandbox, w których działają jego obciążenia, oraz ograniczenie liczby kont ludzkich i zautomatyzowanych ze stałym dostępem do systemów zawierających wagi modeli lub dane klientów.
Po incydentach związanych z sandboxami Anthropic podało, że tymczasowo wstrzymało wszystkie zewnętrzne oceny cybernetyczne i przeprowadziło audyt transkryptów wewnętrznych ocen. Firma zbudowała także i wdrożyła niestandardowy klasyfikator, który monitoruje wywołania narzędzi modeli w czasie rzeczywistym. Ponadto zaktualizowała wymagania dla wszystkich partnerów i red teamerów pracujących na modelach przedpremierowych, wymagając ścisłego nadzoru nad modelem badającym sandbox pod kątem luk.
Powiązane: OpenAI, Anthropic, Google wzywają do priorytetowego traktowania cyberbezpieczeństwa
Środki te pojawiły się tydzień po tym, jak OpenAI poinformowało, że wstrzyma trening na dwa tygodnie dla swoich najnowszych modeli w odpowiedzi na agentów napędzanych przez te modele, którzy opuścili swoje sandboxy. Choć oba laboratoria AI wydają się intensyfikować działania na rzecz zabezpieczenia niewydanych modeli, nieprzewidywalność agentów AI i technologii generatywnej AI wskazuje, że dostawcy muszą nadal zaostrzać swoje zabezpieczenia. Wyczucie czasu odzwierciedla też szersze wyzwanie branżowe: wraz ze wzrostem możliwości modeli systemy służące do ich testowania muszą nadążać, w przeciwnym razie sama ewaluacja może stać się częścią powierzchni ryzyka.
Większa potrzeba bezpiecznych środków i testowania
„W miarę jak modele stają się coraz lepsze w rozumowaniu i zaczynają wykazywać sprawczość, coraz trudniej przewidzieć wszystkie różne zachowania tych modeli” — powiedział Arun Chandrasekaran, analityk Gartnera. „Laboratoria mają jeszcze większą odpowiedzialność, by upewnić się, że przeznaczają odpowiednie zasoby na wewnętrzne testy modeli, ewaluacje i uczenie ze wzmocnieniem”.
Dodał, że jednym z obszarów, na których dostawcy modeli frontier powinni się skupić, jest zapewnienie większej liczby inżynierów w zespołach bezpieczeństwa, testów niezawodności i prywatności.
„Albo techniki testowania, albo zasoby przeznaczone na testy muszą się zmienić” — kontynuował Chandrasekaran. „Jeśli modele stają się bardziej zaawansowane, techniki testowania również muszą stać się bardziej zaawansowane”.
Lepsza higiena cybernetyczna
Choć potrzeba więcej testów, fakt, że zarówno Anthropic, jak i OpenAI wstrzymały działania, uwydatnia niebezpieczny wzorzec dla dostawców modeli.
„Systemy te są rozwijane i wydawane, zanim każde ryzyko zostanie w pełni zrozumiane lub przetestowane” — powiedział Kashyap Kompella, CEO i założyciel RPA2AI Research.
Powiązane: Raport OpenAI szczegółowo wyjaśnia atak na Hugging Face
„To niemal stało się cechą obecnego rynku AI” — kontynuował. Firmy ścigają się, by zwiększać możliwości, rozszerzać adopcję i budować pozycję lidera rynku, podczas gdy architektura bezpieczeństwa, mechanizmy kontroli konfiguracji i procesy operacyjne wokół modeli dojrzewają dopiero po wdrożeniu.
Powiedział, że firmy i organizacje rządowe nie mogą zlecać cyberbezpieczeństwa laboratoriom frontier.
„Przedsiębiorstwa i rządy muszą założyć, że wysoce zdolna ofensywna AI jest już częścią środowiska zagrożeń, i odpowiednio wzmocnić własną obronę” — dodał Kompella.
Nawet jeśli OpenAI i Anthropic zwiększą własne środki bezpieczeństwa, dostępne są liczne modele innych dostawców oraz dostawców open source — zauważył. Dlatego przedsiębiorstwa muszą być lepiej przygotowane i wzmocnić higienę cybernetyczną oraz inne środki bezpieczeństwa, takie jak reagowanie na incydenty.
„Każda organizacja musi również założyć, że nadchodzą coraz bardziej zaawansowane ataki wspomagane przez AI, i odpowiednio przygotować własną infrastrukturę” — kontynuował Kompella. „Zdolności ofensywne poprawiają się znacznie szybciej niż gotowość cyberbezpieczeństwa przeciętnej organizacji”.
Powiązane: OpenAI rozszerza Daybreak, by przeciwdziałać rosnącemu zagrożeniu bezpieczeństwa AI
Ponadto przedsiębiorstwa nie mogą ufać, że dostawcy będą sami siebie kontrolować.
„Ufanie, że firma modelowa sama będzie nadzorować własne wyniki, nigdy nie może być wystarczające, aby zapewnić bezpieczne działanie w jakimkolwiek środowisku” — powiedział Carter Huffman, współzałożyciel i CTO dostawcy voice AI Modulate. „Użytkownicy i firmy muszą monitorować aktywność AI w czasie rzeczywistym”.
Niepożądana strona testowania
Przedsiębiorstwa muszą również zrozumieć, że jednym ze sposobów lepszego poznania modeli jest dalsze testowanie i identyfikowanie incydentów, które pokazują, jak skuteczniej je trenować.
„Po prostu nie da się tam dojść bez takiego rodzaju bólu” — powiedział David Nicholson, analityk Futurum Group. „Dopóki nie zobaczą, że dzieją się te nieprzewidziane rzeczy, i nie zareagują na nie, będziemy nadal widzieć takie sytuacje”.
Dodał, że natura modeli polega na wykonywaniu zadań najmniej oporną drogą, a modele trzeba prowadzić jak dzieci, instruując je, co mogą, a czego nie mogą robić, oraz jak mogą lub nie mogą wykonać zadanie.
„Za każdym razem, gdy dochodzi do jednego z takich incydentów, uczymy się więcej i zmniejszamy prawdopodobieństwo kolejnych, nie tylko dokładnie tego samego typu, ale także w szerszych kategoriach” — dodał Nicholson. „Można wyciągnąć wnioski z każdego z tych incydentów i je uogólnić”.