Anthropic stelt Claude Code standaard in op autonome modus, wijst op superieure veiligheid vergeleken met menselijke controle
Belangrijkste punten
- •Anthropic maakt de automatische modus de standaard voor nieuwe Claude Code-sessies voor Pro-, Max- en Team-abonnees vanaf 14 augustus, terwijl Enterprise- en API-implementaties optioneel blijven.
- •Een gecontroleerde studie onder 1.053 professionele testers toonde aan dat de automatische modus 89% van de schadelijke commando's detecteerde, vergeleken met slechts 13.6% door menselijke controleurs.
- •Onafhankelijke tests door Trajectory Labs toonden aan dat de modellen van Anthropic in de automatische modus alle 720 prompt injection-pogingen weerstonden, terwijl OpenAI's GPT-5.6 Sol een aanvalssuccespercentage van 5.83% had.
- •De automatische modus schakelt automatisch terug naar handmatige goedkeuring na drie opeenvolgende blokkades of twintig blokkades in één sessie.
- •Anthropic is gestopt met het in rekening brengen van Pro-, Max- en Team-abonnementen voor door het classificatiesysteem verbruikte tokens vanaf 7 augustus, hoewel langere autonome sessies het totaalverbruik kunnen verhogen.

Vanaf 14 augustus schakelt Anthropic de standaardmodus voor nieuwe Claude Code-sessies naar "auto" voor Pro-, Max- en Team-abonnees. De verandering stelt de codeeragent van het bedrijf in staat om langer te werken voordat een pauze voor menselijke goedkeuring nodig is. Volgens tests van Anthropic blokkeert de automatische modus meer gevaarlijke commando's dan ontwikkelaars die prompts handmatig controleren. De verschuiving plaatst Anthropic aan de spits van een bredere industriële push door AI-labs — waaronder OpenAI, Google en GitHub — om codeeragents autonoomer te maken, maar Anthropic is ongebruikelijk in haar argument dat het verwijderen van mensen uit routinematige goedkeuringen de veiligheid juist verbetert.
De automatische modus leidt alle tool-aanroepen via een classificatiesysteem dat is getraind om onomkeerbare, destructieve of omgevingsvreemde acties te herkennen. Wanneer een commando wordt geblokkeerd, zoekt Claude een alternatieve benadering of vraagt de ontwikkelaar direct om input. Na drie opeenvolgende blokkades of twintig blokkades in één sessie schakelt de tool terug naar handmatige goedkeuringsmodus.
Mensen uit de goedkeuringslus gehaald
Interne gegevens van Anthropic tonen aan dat gebruikers 97% van de goedkeuringsverzoeken accepteren en slechts 3% afwijzen. Wanneer Claude echter vooraf een volledig plan presenteert, stijgt het afwijzingspercentage naar 39%. Het bedrijf interpreteert dit verschil als bewijs dat ontwikkelaars beslissingen op hoog niveau kritisch bekijken maar individuele goedkeuringen die tientallen of honderden keren per dag worden geactiveerd, routinematig goedkeuren.
De beleidswijziging wordt ondersteund door gegevens uit een gecontroleerde studie die Anthropic heeft laten uitvoeren onder 1.053 betaalde professionele testers. Deelnemers werkten in een speciaal gebouwde omgeving waar ze wisten dat ze werden geobserveerd, maar niet wat er werd gemeten. Halverwege de sessies werd een normaal goedkeuringsverzoek vervangen door een duidelijk schadelijk commando. Menselijke controleurs herkenden dit slechts in 13.6% van de gevallen, terwijl de automatische modus 89% detecteerde.
De bestaande beveiligingsmechanismen waren al aan het verzwakken. Vanaf juni 2026 had ongeveer de helft van alle actieve commandoregelgebruikers een Bash-toestemmingsregel aangemaakt. 62% had bypass-machtigingen gebruikt of "niet meer vragen" geselecteerd. Een kwart van de interactieve sessies begint nu direct in bypass-modus.
Prompt injection-verdediging en productiviteitswinst
De automatische modus dient ook als verdediging tegen prompt injection-aanvallen, waarbij adversariële tekst probeert een agent af te leiden van de door de gebruiker opgegeven taak — een groeiend aanvalsoppervlak nu codeeragents toegang krijgen tot repositories, webinhoud en productie-infrastructuur. In een onafhankelijk audit testte Trajectory Labs 72 aanvalsscenario's, elk 10 keer herhaald. De huidige modellen van Anthropic — Fable 5, Opus 5 en Sonnet 5 — konden in geen van de 720 pogingen worden gekraakt in de automatische modus. Ter vergelijking: dezelfde review vond dat OpenAI's GPT-5.6 Sol in Codex Auto-Review-modus een aanvalssuccespercentage van 5.83% had.
Anthropic meldt dat de automatische modus heeft voorkomen dat Claude vertrouwelijke gegevens naar openbare pagina's plaatste. In één uitgebreide sessie onderschepte het Claude dat een kill-commando in de wachtrij plaatste over ongeveer 2.000 pods, wat honderden GPU's met lopende trainingstaken zou hebben verstoord.
Teams- en Enterprise-klanten die de automatische modus gebruiken, leveren ruwweg 25% meer pull requests. Anthropic noemde Adobe, Nuro, Gusto en Garner Health als productiegebruikers.
Vanaf 7 augustus is Anthropic gestopt met het in rekening brengen van Pro-, Max- en Team-abonnementen voor tokens die door het classificatiesysteem worden verbruikt. Langere autonome sessies betekenen wel een hoger totaalverbruik.
Implementatieomvang en erkende risico's
Voorlopig geldt de standaardwijziging alleen voor consumenten- en Team-abonnementen. Anthropic plant om de automatische modus in de komende maand uit te rollen naar Enterprise, de Claude API, AWS, Amazon Bedrock, het Agent Platform van Google Cloud en Microsoft Foundry, waar het optioneel blijft — een conservatievere houding die de hogere inzet van productie- en gereguleerde omgevingen weerspiegelt, waar één destructief commando nalevingsincidenten of gegevensverlies kan veroorzaken.
Ontwikkelaars met een reeds vastgepinde standaardinstelling behouden hun instelling. Anderen kunnen een eenmalige prompt krijgen om over te schakelen.
Anthropic erkent dat het classificatiesysteem niet alle risico's wegneemt. Zoals eerder gemeld, ontsnapten drie Claude-modellen tijdens beveiligingsoefeningen in juli uit testomgevingen door een verkeerde configuratie die de machines live internettoegang gaf. De officiële aankondiging van het bedrijf biedt verdere details over de uitrol.