NieuwsMacroGoogle brengt Gemini 3.7 Flash uit, OpenAI geeft preview van 14x sneller GPT-5.6 Sol Ultrafast

Google brengt Gemini 3.7 Flash uit, OpenAI geeft preview van 14x sneller GPT-5.6 Sol Ultrafast

Auteur: Decrypt·

Belangrijkste punten

  • Gemini 3.7 Flash is algemeen beschikbaar en kan worden gebruikt in meer dan 160 landen.
  • Het model accepteert tot één miljoen invoertokens en kan tekst, afbeeldingen, video, audio, pdf's en tool-aanroepen verwerken.
  • Google zegt dat Gemini 3.7 Flash de testprogrammeeropdracht voltooide in 2 minuten en 13 seconden, sneller dan het vorige Flash-model.
  • OpenAI presenteerde GPT-5.6 Sol Ultrafast als een API-laag op uitnodiging die Cerebras-chips gebruikt en tot 750 uitvoertokens per seconde haalt.
  • Google prijste Gemini 3.7 Flash op 75 dollarcent per miljoen invoertokens en 3,75 dollar per miljoen uitvoertokens tot het einde van het jaar, waarna de tarieven op 31 december stijgen.
Google brengt Gemini 3.7 Flash uit, OpenAI geeft preview van 14x sneller GPT-5.6 Sol Ultrafast

Google lanceerde donderdag Gemini 3.7 Flash, een goedkoop model voor programmeren en agents dat nu algemeen beschikbaar is. Op dezelfde dag gaf OpenAI een preview van GPT-5.6 Sol Ultrafast, een door Cerebras aangedreven dienstenlaag die zijn meest capabele model tot 14x sneller laat draaien. De snelheidsrace is verschoven van ruwe intelligentie naar realtime agents — maar alleen het model van Google is vandaag voor elke ontwikkelaar beschikbaar.

Google en OpenAI verspreidden dezelfde boodschap: AI is inmiddels snel genoeg om indruk te maken op wie AI-agents gebruikt, waarbij beide bedrijven ultrasnelle modellen aankondigden. De twee lanceringen zijn verschillend opgebouwd, en er is er vandaag maar één die ontwikkelaars daadwerkelijk in handen hebben. De focus op snelheid is structureel: agents kunnen veel modelaanroepen achter elkaar schakelen — plannen, tools aanroepen, resultaten controleren — zodat de latentie per aanroep zich opstapelt binnen één taak.

Google bracht Gemini 3.7 Flash uit, zijn nieuwste model, afgestemd op softwareprogrammering en autonome bedrijfsworkflows. OpenAI opende een beperkte preview van GPT-5.6 Sol Ultrafast, een nieuwe dienstenlaag die zijn meest capabele model draait op tot 750 uitvoertokens per seconde.

Today we're introducing Gemini 3.7 Flash, our most intelligent workhorse model yet for coding and agents. This model brings substantial gains across software engineering, web development, and complex knowledge work. Now through the end of the year, Gemini 3.7 Flash is available… pic.twitter.com/RSCBDipjKn

— Google (@Google) August 13, 2026 (X-bericht)

Gemini 3.7 Flash is een model in algemene beschikbaarheid. Het accepteert tot één miljoen invoertokens — grofweg 750.000 woorden — en levert 64.000 tokens terug; het verwerkt tekst, afbeeldingen, video, audio en pdf's en kan tools aanroepen en een computer besturen. Google positioneert het als het goedkope brein voor autonome systemen die taken plannen en meerstapsklussen met minder menselijke hulp afronden.

Het model offert geen kwaliteit op voor snelheid. Het is zowel capabeler als efficiënter: het voltooide de testprogrammeeropdracht van Google in 2 minuten en 13 seconden, terwijl het nieuwste Flash-model er meer dan 5 minuten over deed. Ook het kwaliteitsverschil tussen de twee is merkbaar.

De Ultrafast-variant van OpenAI is geen nieuw model. Het is GPT-5.6 Sol — hetzelfde model dat OpenAI vóór de lancering met een AI-red team liet verharden tegen prompt-injectie-aanvallen — op een sneller spoor, aangedreven door chipmaker Cerebras. Het is ongeveer 14 keer sneller dan de standaardsnelheid van GPT-5.6 Sol zelf.

Previewing Ultrafast mode: GPT-5.6 Sol at up to 14x the speed. Launching first in the OpenAI API to a select group of customers with expanded access to more businesses as capacity grows. pic.twitter.com/a5dleofiDJ

— OpenAI (@OpenAI) August 13, 2026 (X-bericht)

De waferschaal-chips van Cerebras (processoren die vrijwel net zo groot zijn gemaakt als een volledige siliciumwafer, in plaats van de vele kleine chips die daar doorgaans uit worden gesneden) leveren tot 750 tokens per seconde — ongeveer 560 woorden — snel genoeg om een voice-agent midden in een gesprek te laten nadenken.

De cijfers die ertoe doen

Volgens Googles eigen benchmarkoverzicht presteert Gemini 3.7 Flash beter dan Claude Sonnet 5, GPT-5.6 Terra en andere modellen in 11 van de 18 geteste categorieën, waaronder een topscore van 1.588 Elo op de Code Arena voor webontwikkeling en 30,4% op AutomationBench voor bedrijfsworkflows. Dat is allemaal gebaseerd op de methodologie van Google, dus de voorsprong moet worden beschouwd als een claim van het bedrijf.

Zoals elk Gemini Flash-model is het ook goedkoop. Tegen 75 dollarcent per miljoen invoertokens en 3,75 dollar per miljoen uitvoertokens tot het einde van het jaar kost het de helft van het oorspronkelijke tarief van Gemini 3.6 Flash. Die introductieprijs vervalt op 31 december en verdubbelt daarna naar 1,50 en 7,50 dollar — nog steeds goedkoop voor een Google-model.

OpenAI heeft voor Ultrafast geen onderlinge vergelijkingsscores gepubliceerd, behalve uitspraken van klanten. John Crepezzi, AI-ingenieur bij Jane Street, zei in de aankondiging van OpenAI dat de snelheid van Cerebras "enables different ways of using the models". Courtland Lykins, productlead bij Podium, noemde het "invaluable in our voice stack" en zei dat de snelheid "completely changes the call experience". De dienstenlaag is voorlopig alleen op uitnodiging beschikbaar.

De snelheidspush komt op een moment dat de laboratoria omschakelen van "wie is het slimst" naar "wie snel genoeg is voor agents". De timing van Google is veelzeggend. Het vlaggenschip Gemini 3.5 Pro ontbreekt nog steeds, zonder releasedatum, drie weken na 3.6 Flash en enkele dagen na een leiderschapswisseling bij DeepMind waarbij Demis Hassabis opzij werd gezet voor plaatsvervanger Koray Kavukcuoglu. OpenAI huurt ondertussen de snelheid van Cerebras in, in plaats van op de eigen stack te wachten.

Gemini 3.7 Flash is nu live in meer dan 160 landen; GPT-5.6 Sol Ultrafast is nog steeds alleen op uitnodiging beschikbaar.