Google DeepMind dévoile Gemini 4 Argon, son nouveau modèle d'IA frontière
Points clés
- •Gemini 4 Argon affiche des résultats de pointe dans plusieurs domaines, avec 77,9 % sur DeepSWE v1.1 en ingénierie logicielle de longue durée, 51,3 % sur AutomationBench de Zapier et 91,7 % sur LVBench pour la compréhension de vidéos longues.
- •La limite de tokens de sortie du modèle a été portée à un million de tokens, un record sur le marché et environ quinze fois les 64 000 précédents, ce qui permet selon Google de résoudre des problèmes difficiles en une seule passe.
- •Argon peut découvrir, valider et corriger de manière autonome des vulnérabilités critiques, et via l'initiative Scan for Good de Wiz, il a révélé une faille critique exposant des informations personnelles sensibles dans des logiciels de santé utilisés par des hôpitaux du monde entier, que les modèles frontières précédents n'avaient pas détectée.
- •La disponibilité suit un déploiement progressif : les cyberdéfenseurs de confiance bénéficient d'un accès initial via le programme Fairwind sans garde-fous de cybersécurité, tandis que les développeurs, les entreprises et les consommateurs y accéderont plus tard, en commençant par les clients API payants et les abonnés Google AI Ultra.
- •En interne chez Google, les agents Argon ont surpassé de 40 % une référence publiée en optimisation algorithmique quantique, libéré plus de 300 TiB de mémoire dans les centres de données et migrent de vastes bases de code C/C++ vers Rust, dont plus de 800 000 lignes du noyau Zircon de Fuchsia OS.

Google DeepMind a annoncé le 30 septembre 2026 Gemini 4 Argon, un nouveau modèle d'IA frontière conçu pour soutenir un raisonnement approfondi dans des flux de travail professionnels complexes et de longue durée. L'entreprise a indiqué que le modèle offre des performances de pointe en ingénierie logicielle réelle, en travail intellectuel d'entreprise tel que le juridique et la finance, ainsi qu'en cybersécurité défensive, et qu'il est initialement déployé auprès d'un ensemble de cyberdéfenseurs de confiance via le programme Fairwind de Google.
Koray Kavukcuoglu, vice-président senior de Google DeepMind et architecte en chef de l'IA chez Google, a annoncé le modèle dans un article de blog, écrivant qu'Argon « transforme fondamentalement notre façon de travailler et de construire chez Google ». L'entreprise a souligné la limite inédite sur le marché d'un million de tokens du modèle pour la résolution de problèmes profonds en plusieurs étapes, ainsi que ses forces en programmation, en recherche financière, en rédaction juridique et en correction autonome de vulnérabilités de cybersécurité.
Déploiement progressif et tarification
Google a déclaré que la libération sûre de capacités frontières de ce niveau exige une approche progressive. L'entreprise participe activement au processus volontaire du gouvernement américain d'accès aux modèles avant leur sortie, tout en élargissant progressivement la disponibilité, et continuera de recueillir les retours des premiers testeurs tout en affinant ses garde-fous avant de rendre Argon accessible aux développeurs, aux entreprises et aux consommateurs. Ce plan d'accès initial signifie que les capacités et les garde-fous décrits par Google sont d'abord évalués dans des environnements contrôlés plutôt que proposés immédiatement au marché élargi.
Argon sera lancé à un prix de lancement de 2 $ par million de tokens d'entrée et 10 $ par million de tokens de sortie, les tokens d'entrée en cache étant facturés 95 % moins cher que le prix des tokens d'entrée. Après l'expiration de la période de lancement, une tarification de 4 $ par million de tokens d'entrée et 20 $ par million de tokens de sortie s'appliquera. Le déploiement élargi commencera avec les clients API payants et abonnés Google AI Ultra.
Transformer la façon dont Google travaille et construit
Gemini 4 Argon alimente déjà les flux de travail internes de Google, des milliers de Googlers soulignant les forces du modèle dans les tâches de programmation spécialisées, la recherche approfondie et la qualité rédactionnelle. Google a indiqué que le modèle aide les équipes à construire plus rapidement, repoussant les limites de la productivité d'ingénierie et accélérant les percées. Les exemples cités dans l'article comprennent :
- Optimisation algorithmique quantique : Argon aide les chercheurs en informatique quantique de Google à optimiser les ressources spatio-temporelles (qubits × portes) des sous-routines qui constituent des goulots d'étranglement pour des applications importantes. Dans un exemple, il a surpassé la référence publiée de 40 % en quelques minutes.
- Efficacité mémoire : Une équipe d'agents Argon a analysé la télémétrie de profilage à l'échelle de la flotte pour identifier et appliquer de manière autonome des optimisations mémoire dans les centres de données de Google, libérant plus de 300 TiB de mémoire une fois déployé, avec une économie totale estimée entre 500 TiB et 1 PiB.
- Migrations et optimisations de bases de code à grande échelle : Des agents Argon travaillent à la migration de bases de code C/C++ vers Rust au sein de Google — passant de dizaines de milliers de lignes dans des bibliothèques fondamentales comme re2 et libgav1 à plus de 800 000 lignes pour le noyau Zircon de Fuchsia OS. Compte tenu du caractère critique de nombre de ces systèmes, ces réécritures massives font l'objet d'audits automatisés et manuels rigoureux, de tests d'émulation et de revues avant le déploiement en production. Pour libgav1, le logiciel open source de Google de décodage vidéo, des agents Argon ont pris un portage Rust existant et remplacé 32 000 lignes de code SIMD en menant de nombreuses séries d'expériences guidées par le profilage, en étudiant la sortie du compilateur et en produisant du Rust sûr afin que le compilateur le vectorise automatiquement. Le résultat est un décodeur vidéo à mémoire sûre, 2,7 fois plus rapide que le portage Rust, avec une sortie vidéo identique, le rapprochant de l'implémentation C++ optimisée.
Une limite de sortie d'un million de tokens
Pour soutenir les capacités de Gemini 4 Argon sur des cas d'usage plus longs et plus complexes, Google a déclaré élargir la limite de tokens de sortie du modèle à un million de tokens, un record sur le marché, contre 64 000 tokens auparavant. Selon l'entreprise, lorsque le modèle dispose de la marge nécessaire pour réfléchir en profondeur et générer des centaines de milliers de tokens en une seule trajectoire, cela ajoute un nouveau niveau de profondeur de raisonnement permettant de résoudre des problèmes difficiles en une seule passe.
Programmation et flux de travail d'entreprise dans tous les domaines
Google a indiqué que les capacités de Gemini 4 Argon en programmation, en raisonnement et en multimodalité, combinées à sa capacité à soutenir des tâches longues en plusieurs étapes, lui permettent d'exceller dans une gamme de flux de travail d'entreprise. Les ingénieurs de Google utilisent le modèle pour leurs tâches quotidiennes, du débogage courant aux migrations de bases de code à grande échelle et à la conception d'algorithmes. Argon établit un nouvel état de l'art sur DeepSWE v1.1, qui mesure la performance d'un modèle dans des tâches réelles d'ingénierie logicielle de longue durée, avec un score de 77,9 %.
Au-delà de la programmation, Google a déclaré qu'Argon est le modèle de tête sur l'indice Vals, qui mesure l'impact économique dans les domaines de la finance, de la programmation, du juridique et de la fiscalité chaque secteur étant pondéré par sa contribution au PIB américain. L'entreprise a fait état de performances de tête similaires sur des évaluations spécifiques à des domaines, notamment Vals Finance Agent v2, qui teste la recherche financière en plusieurs étapes, et le Legal Agent Benchmark de Harvey, qui couvre la recherche et la rédaction juridiques. Sur AutomationBench, le benchmark de Zapier mesurant l'exécution de bout en bout des principales fonctions commerciales, Argon se classe premier avec un score de 51,3 %.
Argon est également performant lorsque le travail intellectuel exige une compréhension visuelle, selon Google. Le modèle peut réaliser des analyses de graphiques professionnelles, identifier des détails dans de longues vidéos et agir à partir d'une série de documents. Sur LVBench, qui mesure la compréhension de vidéos longues, l'entreprise a indiqué qu'Argon est à l'état de l'art avec un score de 91,7 %.
Leader de la cybersécurité défensive
Google a déclaré avoir entraîné Gemini 4 Argon à être très performant en cybersécurité défensive afin de mieux équiper les cyberdéfenseurs face à une nouvelle ère de cyberattaques. Le modèle peut découvrir, valider et corriger de manière autonome des vulnérabilités logicielles critiques. Pour les défenseurs de confiance et les équipes internes de Google, l'entreprise publiera Argon sans garde-fous de cybersécurité afin qu'ils puissent exploiter l'ensemble de ses capacités de défense de niveau frontière.
La société de sécurité Wiz utilise déjà Argon pour la cybersécurité défensive via son initiative Scan for Good, un programme dédié à la protection gratuite des infrastructures publiques critiques par la découverte et la correction d'expositions à haut risque. Dans une première démonstration de l'impact du modèle, a indiqué Google, Argon a révélé une vulnérabilité critique exposant des informations personnelles sensibles dans des logiciels de santé utilisés par des hôpitaux du monde entier, identifiant un risque grave que les modèles frontières précédents n'avaient pas détecté.
Sur CWE-bench v1, qui évalue la capacité d'un modèle à remédier aux vulnérabilités de sécurité, Argon arrive à égalité à la première place avec un meilleur score de 68 %, s'appuyant sur la performance frontière de 3.8 Flash Cyber sur CWE-bench v0.
Google a déclaré que Gemini 4 Argon démontre des progrès impressionnants dans la découverte de vulnérabilités par rapport à 3.8 Flash Cyber :
- Sur le benchmark interne complet de vulnérabilités de Google, Argon a découvert un large éventail d'expositions dans des bases de code complexes couvrant 20 langages de programmation.
- Sur le benchmark interne de tests d'intrusion en boîte noire de Wiz, qui évalue la capacité d'un modèle à analyser des systèmes web en production sans code source, Argon surpasse 3.8 Flash Cyber dans la découverte de la surface d'attaque, l'identification des vulnérabilités et la production de preuves de concept pour les valider.
Renforcer les garde-fous frontières avant une large disponibilité
Avant le déploiement généralisé de Gemini 4 Argon, Google a déclaré continuer à renforcer les garde-fous frontières essentiels dans quatre domaines principaux :
- Défense contre les usages malveillants : Pour empêcher des acteurs malveillants d'utiliser Argon pour des cyberattaques ou des attaques chimiques, biologiques, radiologiques et nucléaires (CBRN), le modèle est conçu pour refuser les requêtes nuisibles tout en préservant la recherche scientifique légitime à double usage, conformément au Frontier Safety Framework de Google DeepMind. L'entreprise renforce la robustesse de ses garde-fous pour ce lancement, notamment en améliorant ses de surveillance des activations internes du modèle pour détecter les usages malveillants. Ces garde-fous ont fait l'objet de tests de robustesse par des équipes rouges internes et externes utilisant une combinaison de méthodes d'attaque manuelles et automatisées.
- Défense contre les attaques par injection de prompts : Google a décrit Argon comme son modèle le plus résilient à ce jour face aux injections de prompts indirectes, dans lesquelles des instructions ou un contexte malveillants sont utilisés pour détourner le comportement d'un modèle. L'entreprise a indiqué qu'il s'agit d'attaques complexes exigeant une vigilance constante et plusieurs couches de défense. Grâce au red teaming automatisé et à l'entraînement adversarial, Gemini 4 Argon est en tête en robustesse aux injections de prompts sur le benchmark Indirect Prompt Injection (IPI) de Gray Swan, selon Google.
- Surveillance des désalignements : Pour empêcher Argon de dépasser les limites en accomplissant une tâche d'une manière allant au-delà des intentions de l'utilisateur, Google déploie des mesures d'atténuation des désalignements qui surveillent la chaîne de pensée et les actions du modèle et interrompent l'exécution si nécessaire. L'entreprise a utilisé un système similaire pour surveiller ses entraînements et alerter une équipe dédiée de réponse aux incidents, en prenant soin de ne pas réinjecter les conclusions dans l'entraînement afin de ne pas risquer de façonner le raisonnement d'Argon pour échapper à sa surveillance. Google a déclaré encourager vivement le reste du secteur à préserver la transparence du raisonnement « dans ces moments décisifs de capacités accrues tout en gérant les risques d'alignement », afin que les pensées du modèle demeurent utiles pour identifier et diagnostiquer les désalignements.
- Durcissement des systèmes : À mesure que les modèles frontières gagnent en capacités, leur test sûr exige des environnements sécurisés capables de suivre le rythme des systèmes eux-mêmes. Conformément à sa feuille de route de contrôle des agents, l'entreprise durcit ses environnements bac à sable en les isolant et en les scellant avant le début des entraînements ou évaluations à haut risque. Google s'est également engagé à partager ces bonnes pratiques de sécurité des agents avec ses partenaires afin d'améliorer la sécurité de tout l'écosystème.
Déploiement imminent
Google a déclaré avoir construit Gemini 4 Argon avec des capacités de niveau frontière en programmation, en travail intellectuel, en cybersécurité défensive et en écriture créative, afin de servir de partenaire aux développeurs, aux professionnels et aux entreprises confrontés à leurs problèmes les plus difficiles. L'entreprise s'est dite reconnaissante envers la première cohorte de cyberdéfenseurs et de testeurs de confiance, dont les évaluations et retours du monde réel contribueront à renforcer ses systèmes avant la mise à disposition aux développeurs, aux entreprises et aux consommateurs, en commençant par les clients API payants et les abonnés Google AI Ultra.
Après l'expiration de la période de lancement, une tarification de 4 $ par million de tokens d'entrée et 20 $ par million de tokens de sortie s'appliquera.
À propos de l'auteur : Koray Kavukcuoglu est l'un des experts les plus éminents au monde en intelligence artificielle. Vice-président senior de Google DeepMind, il dirige le développement des modèles d'IA générative de pointe de Google DeepMind et leur intégration à grande échelle dans les produits de Google. Avant son poste actuel il était vice-président de la recherche chez Google DeepMind, où il a fondé l'équipe d'apprentissage profond, laquelle a inauguré des percées majeures de recherche telles que DQN (Deep Q-Network) et WaveNet.