Google livre Gemini 3.7 Flash alors qu'OpenAI présente en avant-première GPT-5.6 Sol Ultrafast, 14 fois plus rapide
Points clés
- •Gemini 3.7 Flash est disponible en disponibilité générale et peut être utilisé dans plus de 160 pays.
- •Le modèle accepte jusqu'à un million de tokens en entrée et peut traiter du texte, des images, de la vidéo, de l'audio, des PDF et des appels d'outils.
- •Selon Google, Gemini 3.7 Flash a accompli sa tâche de codage test en 2 minutes et 13 secondes, plus vite que le modèle Flash précédent.
- •OpenAI a présenté en avant-première GPT-5.6 Sol Ultrafast, un niveau d'API accessible sur invitation qui utilise les puces de Cerebras et atteint jusqu'à 750 tokens de sortie par seconde.
- •Google a fixé le prix de Gemini 3.7 Flash à 75 cents par million de tokens en entrée et 3,75 dollars par million de tokens en sortie jusqu'à la fin de l'année, avant une hausse des tarifs le 31 décembre.

Google a lancé jeudi Gemini 3.7 Flash, un modèle économique dédié au codage et aux agents, désormais disponible en disponibilité générale. Le même jour, OpenAI a présenté en avant-première GPT-5.6 Sol Ultrafast, un niveau de service propulsé par Cerebras qui exécute son modèle le plus performant jusqu'à 14 fois plus vite. La course à la vitesse a déplacé son centre de gravité, passant de l'intelligence brute aux agents en temps réel — mais seul le modèle de Google est aujourd'hui accessible à tous les développeurs.
Google et OpenAI ont défendu le même message : l'IA est désormais suffisamment rapide pour impressionner ceux qui utilisent des agents d'IA, chaque entreprise ayant annoncé des modèles ultra-rapides. Les deux lancements sont conçus différemment, et un seul est réellement entre les mains des développeurs aujourd'hui. Cet intérêt pour la vitesse est structurel : les agents peuvent enchaîner de nombreux appels de modèle — planification, appel d'outils, vérification des résultats — de sorte que la latence de chaque appel s'accumule au sein d'une même tâche.
Google a livré Gemini 3.7 Flash, son dernier modèle optimisé pour le codage logiciel et les flux de travail métier autonomes. OpenAI a ouvert une préversion limitée de GPT-5.6 Sol Ultrafast, un nouveau niveau de service qui exécute son modèle le plus performant jusqu'à 750 tokens de sortie par seconde.
Today we're introducing Gemini 3.7 Flash, our most intelligent workhorse model yet for coding and agents. This model brings substantial gains across software engineering, web development, and complex knowledge work. Now through the end of the year, Gemini 3.7 Flash is available… pic.twitter.com/RSCBDipjKn
— Google (@Google) August 13, 2026 (X post)
Gemini 3.7 Flash est un modèle en disponibilité générale. Il accepte jusqu'à un million de tokens en entrée — soit environ 750 000 mots — et en restitue 64 000, en traitant le texte, les images, la vidéo, l'audio et les PDF ; il peut également appeler des outils et contrôler un ordinateur. Google le présente comme le cerveau économique des systèmes autonomes capables de planifier des tâches et de mener à bien des missions multi-étapes avec moins d'aide humaine.
Le modèle ne sacrifie pas la qualité au profit de la vitesse. Il est à la fois plus performant et plus efficace, bouclant la tâche de codage test de Google en 2 minutes et 13 secondes, là où le dernier modèle Flash mettait plus de 5 minutes. L'écart de qualité entre les deux est également perceptible.
L'Ultrafast d'OpenAI n'est pas un nouveau modèle. Il s'agit de GPT-5.6 Sol — le même modèle qu'OpenAI a renforcé avant son lancement à l'aide d'une équipe d'IA de type red team pour contrer les attaques par injection de prompt — placé sur une voie plus rapide, propulsé par le fabricant de puces Cerebras. Il est environ 14 fois plus rapide que la vitesse standard de GPT-5.6 Sol.
Previewing Ultrafast mode: GPT-5.6 Sol at up to 14x the speed. Launching first in the OpenAI API to a select group of customers with expanded access to more businesses as capacity grows. pic.twitter.com/a5dleofiDJ
— OpenAI (@OpenAI) August 13, 2026 (X post)
Les puces à l'échelle du wafer de Cerebras (des processeurs fabriqués à une taille proche de celle d'un wafer de silicium complet, et non les nombreuses petites puces habituellement découpées dans celui-ci) génèrent jusqu'à 750 tokens par seconde — soit environ 560 mots — suffisamment rapide pour qu'un agent vocal puisse réfléchir en pleine conversation.
Les chiffres qui comptent
Selon le propre tableau de benchmarks de Google, Gemini 3.7 Flash devance Claude Sonnet 5, GPT-5.6 Terra et d'autres modèles sur 11 des 18 catégories testées, avec notamment un meilleur score Code Arena en développement web de 1 588 Elo et 30,4 % sur AutomationBench pour les flux de travail en entreprise. Tout repose sur la méthodologie de Google : cette avance doit donc être considérée comme une affirmation de l'entreprise.
Comme pour tout modèle Gemini Flash, il est également économique. À 75 cents par million de tokens en entrée et 3,75 dollars par million de tokens en sortie jusqu'à la fin de l'année, il coûte la moitié du tarif initial de Gemini 3.6 Flash. Ce tarif d'introduction expire le 31 décembre, puis double pour atteindre 1,50 dollar et 7,50 dollars — ce qui reste peu coûteux pour un modèle de Google.
OpenAI n'a pas publié de scores comparatifs directs pour l'Ultrafast au-delà des témoignages de clients. John Crepezzi, ingénieur IA chez Jane Street, a déclaré dans l'annonce d'OpenAI que la vitesse de Cerebras "enables different ways of using the models." Courtland Lykins, responsable produit chez Podium, l'a jugée "invaluable in our voice stack," estimant que cette vitesse "completely changes the call experience." Le niveau de service reste pour l'instant accessible uniquement sur invitation.
Cette poussée vers la vitesse intervient alors que les laboratoires passent de la question "qui est le plus intelligent" à celle de "qui est assez rapide pour les agents." Le calendrier de Google est significatif. Son modèle phare Gemini 3.5 Pro reste absent, sans date de sortie annoncée, trois semaines après le 3.6 Flash et quelques jours après un remaniement de la direction de DeepMind ayant écarté Demis Hassabis au profit de son adjoint Koray Kavukcuoglu. OpenAI, de son côté, loue la vitesse de Cerebras plutôt que d'attendre sa propre infrastructure.
Gemini 3.7 Flash est dès maintenant disponible dans plus de 160 pays ; GPT-5.6 Sol Ultrafast reste accessible uniquement sur invitation.