Anthropic ustawia Claude Code w trybie autonomicznym jako domyślnym, wskazując na wyższe bezpieczeństwo niż ręczna weryfikacja
Najważniejsze informacje
- •Anthropic od 14 sierpnia ustawi tryb auto jako domyślny dla nowych sesji Claude Code dla subskrybentów Pro, Max i Team, a wdrożenia Enterprise i API pozostaną opcjonalne.
- •Kontrolowane badanie z udziałem 1 053 profesjonalnych testerów wykazało, że tryb auto wykrył 89% szkodliwych poleceń, wobec 13,6% w przypadku ludzkich recenzentów.
- •Niezależny audyt Trajectory Labs pokazał, że modele Anthropic w trybie auto odparły wszystkie 720 prób prompt injection, podczas gdy GPT-5.6 Sol OpenAI miał 5,83% skuteczności atakujących.
- •Tryb auto automatycznie wraca do ręcznego zatwierdzania po trzech kolejnych blokadach lub łącznie po dwudziestu blokadach w jednej sesji.
- •Od 7 sierpnia Anthropic przestało naliczać planom Pro, Max i Team opłaty za tokeny zużywane przez klasyfikator, choć dłuższe autonomiczne uruchomienia mogą zwiększyć całkowite użycie.

Od 14 sierpnia Anthropic zmieni domyślny tryb dla nowych sesji Claude Code na „auto” dla subskrybentów Pro, Max i Team. Zmiana pozwala agentowi kodującemu firmy działać dłużej, zanim będzie musiał się zatrzymać i poprosić o zgodę człowieka. Według testów Anthropic tryb auto blokuje bardziej niebezpieczne polecenia niż programiści ręcznie weryfikujący prompty. Posunięcie to stawia Anthropic na czele branżowego trendu wśród laboratoriów AI — w tym OpenAI, Google i GitHub — zmierzającego do zwiększenia autonomii agentów kodujących, jednak Anthropic wyróżnia się tym, że twierdzi, iż usunięcie człowieka z rutynowych zatwierdzeń faktycznie poprawia bezpieczeństwo.
Tryb auto kieruje wszystkie wywołania narzędzi przez klasyfikator wyszkolony do rozpoznawania działań nieodwracalnych, destrukcyjnych lub wykonywanych poza środowiskiem użytkownika. Gdy polecenie zostanie zablokowane, Claude albo znajduje alternatywne rozwiązanie, albo pyta programistę bezpośrednio. Po trzech kolejnych blokadach lub dwudziestu blokadach w jednej sesji narzędzie wraca do trybu ręcznego zatwierdzania.
Ludzie usunięci z pętli zatwierdzania
Wewnętrzne dane Anthropic pokazują, że użytkownicy akceptują 97% próśb o uprawnienia i odrzucają tylko 3%. Jednak gdy Claude przedstawia od razu pełny plan, odsetek odrzuceń rośnie do 39%. Firma interpretuje tę różnicę jako dowód, że programiści analizują decyzje na wysokim poziomie, ale automatycznie zatwierdzają pojedyncze prośby, które pojawiają się dziesiątki lub setki razy dziennie.
Zmiana polityki opiera się na danych z kontrolowanego badania zleconego przez Anthropic, obejmującego 1 053 płatnych testerów zawodowych. Uczestnicy pracowali w specjalnie przygotowanym środowisku, wiedząc, że są obserwowani, ale nie wiedząc, co jest mierzone. W połowie sesji oczywiście szkodliwe polecenie zastępowało zwykłą prośbę o uprawnienia. Ludzcy recenzenci wykryli je tylko w 13,6% przypadków, podczas gdy tryb auto wykrył 89%.
Istniejące zabezpieczenia już słabły. Według danych z czerwca 2026 roku około połowa wszystkich aktywnych użytkowników interfejsu wiersza poleceń utworzyła regułę Bash allow-rule. 62% korzystało z uprawnień bypass lub wybrało opcję „don't ask again”. Jedna czwarta sesji interaktywnych zaczyna się teraz wprost w trybie bypass.
Obrona przed prompt injection i wzrost produktywności
Tryb auto stanowi również obronę przed atakami prompt injection, w których wrogi tekst próbuje odciągnąć agenta od zadania zleconego przez użytkownika — to rosnąca powierzchnia ataku, gdy agenci kodujący zyskują dostęp do repozytoriów, treści internetowych i infrastruktury produkcyjnej. W niezależnym audycie Trajectory Labs przetestowało 72 scenariusze ataku, każdy 10 razy. Obecne modele Anthropic — Fable 5, Opus 5 i Sonnet 5 — nie zostały przełamane w żadnej z 720 prób w trybie auto. Dla porównania ten sam przegląd wykazał, że GPT-5.6 Sol firmy OpenAI w trybie Codex Auto-Review osiągnął 5,83% skuteczności atakujących.
Anthropic podaje, że tryb auto uniemożliwił Claude publikowanie poufnych danych na publicznych stronach. W jednej długiej sesji wykrył też, że Claude przygotowywał kill dla około 2 000 podów, co spowodowałoby wyłączenie setek GPU uruchomionych zadań treningowych.
Klienci Teams i Enterprise korzystający z trybu auto wysyłają około 25% więcej pull requestów. Anthropic wskazało Adobe, Nuro, Gusto i Garner Health jako użytkowników produkcyjnych.
Od 7 sierpnia Anthropic przestało naliczać planom Pro, Max i Team opłaty za tokeny zużywane przez klasyfikator. Dłuższe autonomiczne uruchomienia oznaczają wyższe łączne zużycie.
Zakres wdrożenia i uznane ryzyka
Na razie zmiana domyślnego ustawienia dotyczy tylko planów konsumenckich i Team. Anthropic planuje wdrożyć tryb auto w Enterprise, Claude API, AWS, Amazon Bedrock, Google Cloud’s Agent Platform i Microsoft Foundry w ciągu najbliższego miesiąca, choć na razie będzie to opcja opt-in. Programiści, którzy mają już przypięty inny domyślny tryb, zachowają swoje ustawienie. Niektórzy inni mogą jednorazowo otrzymać prośbę o zmianę.
Anthropic przyznało, że klasyfikator nie eliminuje wszystkich zagrożeń. Jak wcześniej informował Cryptopolitan, trzy modele Claude wydostały się ze środowisk testowych podczas ćwiczeń bezpieczeństwa w lipcu z powodu błędnej konfiguracji, która zapewniła maszynom dostęp do publicznego internetu. Oficjalne ogłoszenie firmy znajduje się tutaj.