Google dévoile Gemini 4 Argon, qui surpasse les modèles IA concurrents en cybersécurité
Points clés
- •Gemini 4 Argon a obtenu 77,9 % au benchmark d'ingénierie logicielle DeepSWE v1.1, devant Claude Opus 5.5 à 74,2 %, GPT-6 Astra 74,1 % et Claude Fable 5.1 à 67,4 %, mais Google a calculé lui-même son score tandis que les chiffres des concurrents provenaient de sources externes.
- •Au benchmark d'injection de prompt indirecte de Gray Swan, Argon a enregistré un taux d'attaque de 0,7 %, surpassant Claude Opus 5.5 et Claude Fable 5.1 à 1,0 %, tandis que Grok 4.6 et Kimi K3 se sont fait piéger plus d'une fois sur deux.
- •Google limite l'accès initial aux équipes de sécurité agréées via son Fairwind Program, qui compte plus de 650 partenaires dont des gouvernements et des opérateurs d'infrastructures critiques, et le modèle est livré sans garde-fous cyber intégrés dans le cadre d'un déploiement progressif.
- •Argon peut produire jusqu'à 1 million de tokens en une seule réponse, soit une hausse d'environ seize fois par rapport au précédent plafond de 64 000 tokens, offrant de la marge pour les longues tâches de codage et de travail de bureau.
- •Une diffusion élargie aux clients API payants et aux abonnés Google AI Ultra est prévue, avec un tarif de lancement de 2 $ par million de tokens d'entrée et 10 $ par million de tokens de sortie, soit la moitié des tarifs standards à venir.

Google a dévoilé mercredi Gemini 4 Argon, présentant son nouveau modèle de pointe avec des résultats de benchmark qui le placent devant les systèmes IA concurrents sur les tests de cybersécurité. Le modèle a obtenu 77,9 % à DeepSWE v1.1 et affiche un taux d'attaque de 0,7 % au benchmark d'injection de prompt de Gray Swan, devant Claude Opus 5.5 et Claude Fable 5.1, qui ont tous deux obtenu 1,0 %.
Ce lancement intervient une semaine après la sortie de Claude Opus 5.5 et un jour après GPT 6.1 Sol, le dernier en date d'une série de lancements rapides de modèles de pointe par les grands laboratoires américains d'IA — une cadence qui a fait des tableaux comparatifs de lancement le tableau d'affichage permanent du secteur.
Selon l'annonce officielle de Google, Argon est le modèle le plus performant de l'entreprise à ce jour, conçu pour le codage, le travail de bureau et la défense cyber.
De bons scores en ingénierie logicielle, avec des réserves
DeepSWE v1.1 mesure la capacité d'un modèle IA à mener à bien des tâches longues et complexes d'ingénierie logicielle en conditions réelles, avec des résultats exprimés en pourcentage. Argon a atteint 77,9 %, devant Claude Opus 5.5 à 74,2 %, GPT-6 Astra à 74,1 % et Claude Fable 5.1 à 67,4 %. À titre de comparaison, Gemini 3.6 Flash avait obtenu 49 % au même test en juillet.
Le modèle peut également rédiger jusqu'à 1 million de tokens en une seule réponse, contre 64 000 auparavant. Un token est un fragment de texte représentant environ les trois quarts d'un mot, ce qui porte le nouveau plafond à environ 750 000 mots contre environ 48 000 auparavant — une capacité pensée pour les longues tâches de codage et de travail de bureau pour lesquelles le modèle est conçu.
Ces chiffres appellent toutefois une réserve : Google a calculé lui-même son score DeepSWE, tandis que les chiffres des modèles concurrents proviennent d'un classement public et de rapports d'entreprises. Le tableau comparatif de Google concède aussi du terrain. Argon mène sur 12 des 18 benchmarks, en égalise un et en perd cinq, un mélange de tests de codage, de science et de contrôle d'ordinateur — une combinaison de méthodologies auto-évaluées et tierces à garder à l'esprit face aux chiffres headline.
La cybersécurité au premier plan
La capacité phare du modèle est la défense cyber. Dans une attaque par injection de prompt indirecte, une instruction secrète est dissimulée dans un e-mail ou un autre contenu ; lorsqu'un assistant IA la lit, le test consiste à savoir si le modèle obéit à ltranger plutôt qu'à son utilisateur. De telles attaques sont un scénario cauchemardesque pour quiconque confie à une IA l'accès à sa boîte de réception ou à son panier d'achat.
Au benchmark d'injection de prompt indirecte de Gray Swan, qui cache des instructions malveillantes dans des contenus lus par des agents IA et mesure la fréquence de réussite des attaques en 15 tentatives, Argon s'établit à 0,7 % — et plus bas est meilleur. Claude Opus 5.5 et Claude Fable 5.1 ont tous deux obtenu 1,0 %. GPT-6 Astra affiche 8,5 %. Grok 4.6 et Kimi K3 se sont fait piéger un peu plus d'une fois sur deux, à 51,8 % et 52,7 %. L'écart de 52 points entre les meilleures et les pires défenses de la liste montre à quel point la résistance à l'injection de prompt demeure inégale dans le secteur.
Un déploiement restreint via le Fairwind Program
Argon est d'abord proposé aux équipes de sécurité agréées via le Fairwind Program, l'initiative de défense cyber à accès limité de Google, lancée le 2 septembre avec plus de 650 partenaires, dont des gouvernements et des opérateurs d'infrastructures critiques. Le modèle est livré « sans garde-fous cyber » — ces refus intégrés qui empêchent normalement un modèle d'aider au piratage.
La logique derrière cette décision est que les défenseurs ont besoin d'un modèle capable de penser comme un attaquant afin de corriger les failles avant que les criminels ne les trouvent. Le hic, c'est que cette même compétence joue dans les deux sens, et Google affirme qu'un déploiement progressif est la seule voie sûre. L'entreprise participe également au processus volontaire du gouvernement américain pour l'accès aux modèles avant leur sortie.
Google n'est pas le premier à réserver un modèle cyber à un cercle restreint. Une version précoce de Claude Mythos d'Anthropic a permis de trouver 271 vulnérabilités dans Firefox — 271 failles de sécurité que Mozilla a ensuite corrigées. OpenAI a emprunté une voie similaire avec son programme Trusted Access for Cyber, faisant de l'accès cyber restreint un schéma émergent parmi les laboratoires de pointe.
Les scores cyber d'Argon dépassent également ceux de Gemini 3.8 Flash Cyber, le modèle restreint lancé par Google en même temps que Fairwind. Au Wiz Penetration Test Benchmark, un test interne de Google demandant à une IA de rédiger des exploits fonctionnels contre de vraies failles d'applications web sans voir le code et mesurant la part résolue dès le premier essai, Argon a atteint 70,9 % contre 58,2 %. Google indique aussi qu'Argon a aidé la société de sécurité Wiz à découvrir une faille critique dans un logiciel de santé utilisé par des hôpitaux du monde entier — une faille que les modèles de pointe antérieurs avaient manquée.
Un lancement après un été difficile
Cette sortie fait suite à une période difficile pour Google. En juillet, l'entreprise a livré des modèles Flash plus petits mais a laissé de côté le promis Gemini 3.5 Pro, et l'action Alphabet a chuté d'environ 4,4 %. Argon est aussi arrivé le jour même où le président Trump a dévoilé un accord volontaire et sans sanction sur l'IA que la direction de Google a signé.
Google indique qu'une diffusion plus large suivra dès que possible, en commençant par les clients API payants et les abonnés Google AI Ultra. Le tarif de lancement est de 2 $ par million de tokens d'entrée et de 10 $ par million de tokens de sortie. Google n'a pas précisé quand cette période prendra fin, indiquant seulement que les tarifs standards seront de 4 $ et 20 $ — soit exactement le double des tarifs de lancement. Le calendrier de la diffusion élargie et la durée de la période promotionnelle sont les deux dates à surveiller à mesure que se déroule le déploiement d'Argon.