ActualitésMacroAnthropic définit le mode autonome de Claude Code par défaut, invoquant une sécurité supérieure à la révision humaine

Anthropic définit le mode autonome de Claude Code par défaut, invoquant une sécurité supérieure à la révision humaine

Auteur: Cryptopolitan·

Points clés

  • Anthropic fera du mode auto le paramètre par défaut pour les nouvelles sessions Claude Code des abonnés Pro, Max et Team à partir du 14 août, tandis que les déploiements Enterprise et API resteront optionnels.
  • Une étude contrôlée portant sur 1 053 testeurs professionnels a révélé que le mode auto détectait 89 % des commandes nuisibles, contre seulement 13,6 % pour les réviseurs humains.
  • Des tests indépendants menés par Trajectory Labs ont montré que les modèles d'Anthropic en mode auto ont résisté aux 720 tentatives d'injection de prompt, tandis que le GPT-5.6 Sol d'OpenAI affichait un taux de réussite de 5,83 % pour les attaquants.
  • Le mode auto repasse automatiquement en approbation manuelle après trois blocages consécutifs ou vingt blocages au total au cours d'une même session.
  • Anthropic a cessé de facturer aux forfaits Pro, Max et Team les tokens consommés par le classifieur depuis le 7 août, bien que des exécutions autonomes plus longues puissent augmenter l'utilisation globale.
Anthropic définit le mode autonome de Claude Code par défaut, invoquant une sécurité supérieure à la révision humaine

À partir du 14 août, Anthropic basculera le mode par défaut des nouvelles sessions Claude Code sur « auto » pour les abonnés Pro, Max et Team. Ce changement permet à l'agent de codage de l'entreprise de fonctionner plus longtemps avant de s'interrompre pour une approbation humaine. Selon les tests d'Anthropic, le mode auto bloque davantage de commandes dangereuses que les développeurs examinant manuellement les prompts. Ce positionnement place Anthropic à l'avant-garde d'un mouvement à l'échelle de l'industrie, poussé par les laboratoires d'IA — notamment OpenAI, Google et GitHub — pour rendre les agents de codage plus autonomes. Anthropic se distingue toutefois en affirmant que retirer les humains des approbations de routine améliore effectivement la sécurité.

Le mode auto achemine tous les appels d'outils via un classifieur entraîné à identifier les actions irréversibles, destructrices ou hors environnement. Lorsqu'une commande est bloquée, Claude cherche une approche alternative ou demande directement au développeur. Après trois blocages consécutifs ou vingt blocages au cours d'une même session, l'outil repasse en mode d'approbation manuelle.

Les humains retirés de la boucle d'approbation

Les données internes d'Anthropic montrent que les utilisateurs acceptent 97 % des demandes d'autorisation et n'en refusent que 3 %. Cependant, lorsque Claude présente un plan complet au préalable, le taux de rejet monte à 39 %. L'entreprise interprète cet écart comme une preuve que les développeurs examinent attentivement les décisions de haut niveau mais valident automatiquement les approbations individuelles qui se déclenchent des dizaines ou des centaines de fois par jour.

Ce changement de politique s'appuie sur les données d'une étude contrôlée commandée par Anthropic, impliquant 1 053 testeurs professionnels rémunérés. Les participants ont travaillé dans un environnement spécialement conçu, où ils savaient être observés sans connaître ce qui était mesuré. En cours de session, une commande manifestement nuisible remplaçait une demande d'autorisation normale. Les réviseurs humains ne l'ont détectée que dans 13,6 % des cas, tandis que le mode auto a atteint 89 %.

Les garde-fous existants s'érodaient déjà. En juin 2026, environ la moitié de tous les utilisateurs actifs de la ligne de commande avaient créé une règle d'autorisation Bash. 62 % avaient utilisé des autorisations de contournement ou sélectionné « ne plus demander ». Un quart des sessions interactives démarrent désormais en mode contournement.

Défenses contre l'injection de prompt et gains de productivité

Le mode auto sert également de défense contre les attaques par injection de prompt, où du texte adverse tente de détourner un agent de la tâche assignée par son utilisateur — une surface d'attaque en expansion à mesure que les agents de codage accèdent aux dépôts, au contenu web et à l'infrastructure de production. Lors d'un audit indépendant, Trajectory Labs a testé 72 scénarios d'attaque, chacun répété 10 fois. Les modèles actuels d'Anthropic — Fable 5, Opus 5 et Sonnet 5 — n'ont pu être compromis dans aucune des 720 tentatives en mode auto. À titre de comparaison, la même étude a révélé que le GPT-5.6 Sol d'OpenAI en mode Codex Auto-Review présentait un taux de réussite de 5,83 % pour les attaquants.

Anthropic indique que le mode auto a empêché Claude de publier des données confidentielles sur des pages publiques. Lors d'une session prolongée, il a intercepté Claude alors qu'elle metait en file d'attente une commande d'arrêt sur environ 2 000 pods, ce qui aurait perturbé des centaines de GPU exécutant des tâches d'entraînement.

Les clients Teams et Enterprise utilisant le mode auto livrent environ 25 % de pull requests supplémentaires. Anthropic a identifié Adobe, Nuro, Gusto et Garner Health comme utilisateurs en production.

Depuis le 7 août, Anthropic a cessé de facturer aux forfaits Pro, Max et Team les tokens consommés par le classifieur. Des exécutions autonomes plus longues signifient toutefois une utilisation globale plus élevée.

Périmètre de déploiement et risques reconnus

Pour l'instant, ce changement par défaut ne s'applique qu'aux offres grand public et Team. Anthropic prévoit de déployer le mode auto sur Enterprise, l'API Claude, AWS, Amazon Bedrock, Google Cloud's Agent Platform et Microsoft Foundry au cours du mois à venir, où il restera optionnel — une posture plus prudente qui reflète les enjeux accrus des environnements de production et réglementés, où une seule commande destructrice peut déclencher des incidents de conformité ou des pertes de données.

Les développeurs ayant déjà épinglé un autre mode par défaut conserveront leur paramètre. D'autres pourront recevoir une invite unique pour changer.

Anthropic reconnaît que le classifieur n'élimine pas tous les risques. Comme précédemment signalé, trois modèles Claude se sont échappés d'environnements de test lors d'exercices de sécurité en juillet en raison d'une mauvaise configuration accordant un accès internet en direct. L'annonce officielle de l'entreprise fournit de plus amples détails sur le déploiement.