Gemini 3.7 Flash Review: Google's budgetmodel levert op code, schiet tekort in creativiteit en redeneren
Belangrijkste punten
- •Gemini 3.7 Flash slaagde voor een zero-shot codetest door in 2 minuten en 13 seconden een speelbaar browsergame te genereren, terwijl zijn voorganger Gemini 3.6 Flash een niet-werkend bestand opleverde dat door DeepSeek moest worden hersteld.
- •Het model verloor een vergelijkende creatieve-schrijftest van Qwopus3.5-27B-v3, een gratis community-finetune op één consumenten-GPU, nadat het de structurele regel brak waarop de prompt was gebaseerd.
- •Gemini 3.7 Flash antwoordde 17 minuten op een brugpuzzel waarvan het juiste antwoord 10 minuten was, net als Claude Fable 5 eerder deed door een tweepersoonsbeperking aan te nemen die de prompt nooit noemde.
- •Op een probleem met een polynoom van graad 19 identificeerde het model de Dickson-polynoom correct en leidde het de gesloten vorm af, maar het berekende p(19) niet; Qwen 3.7 Max Preview maakte de berekening wel af.
- •Met $0,75 per miljoen invoertokens tot en met 31 december kost het model de helft van wat 3.6 Flash bij de lancering kostte en 85% minder dan GPT-5.6 Sol's tarief van $5, waarna de prijs op 1 januari verdubbelt naar $1,50.

Gemini 3.7 Flash bouwde in 2 minuten en 13 seconden een speelbaar browsergame uit één enkele prompt — een taak waarin zijn voorganger, Gemini 3.6 Flash, drie weken eerder volledig faalde.
Het faalde onze bruglogicapuzzel met hetzelfde verkeerde antwoord als Claude Fable 5, en het bleef steken voordat het daadwerkelijk het wiskundeprobleem uitrekende dat het correct had opgezet.
Het model kost 75 cent per miljoen invoertokens tot en met 31 december — de helft van het tarief van 3.6 Flash — waarna de prijs op 1 januari verdubbelt naar $1,50.
Google bracht Gemini 3.7 Flash uit op 13 augustus, en het was op dag één algemeen beschikbaar in meer dan 160 landen. Het ondersteunt tot een miljoen invoertokens, geeft 64.000 tokens terug, leest afbeeldingen, video, audio en PDF's en kan tools aanroepen en een computer bedienen.
Flash is nooit het model geweest dat je kiest wanneer een probleem moeilijk is. Het is het model dat je gebruikt om tekst te ordenen, agentsessies compacter te maken voordat ze onder hun eigen context bezwijken, en documenten samen te vatten waarvoor je niet wilt betalen om een vlaggenschipmodel ze te laten lezen. Afgezet tegen dat soort taken is 3.7 Flash een duidelijke verbetering. Afgezet tegen alles anders is het een bekwaam model dat wordt overtroffen door software die je gratis kunt downloaden.
Volgens Googles eigen benchmarkoverzicht staat 3.7 Flash boven Claude Sonnet 5 en GPT-5.6 Terra in 11 van de 18 geteste categorieën. De hoofdgetallen zijn 1.588 Elo op het webontwikkelbord van Code Arena en 30,4% op AutomationBench. Beide cijfers komen uit Googles eigen methode, dus zie dit als een claim van het bedrijf en niet als vaststaand feit.
We testten het model om te zien of het de claims van Google waarmaakt. Dit zijn onze resultaten.
Coderen: kan het iets bouwen dat bij de eerste poging werkt?
Deze test meet zero-shot codegeneratie — of een model één instructie kan omzetten in werkende software zonder voorbeelden om te kopiëren en zonder kans om zichzelf te herstellen. We geven één prompt voor een browsergame en leveren terug wat er ook maar uitkomt, bugs inbegrepen. Geen vervolgvragen, geen foutmeldingen, geen tweede poging.
Gemini 3.7 Flash slaagde in 2 minuten en 13 seconden. Het spel was direct speelbaar, de syntax was schoon, de botsings- en scoresystemen werkten en de visuele kwaliteit lag boven wat je op basis van deze prijsklasse zou verwachten.
De vergelijking die hier telt is geen vlaggenschipmodel. Het is Gemini 3.6 Flash, uitgebracht op 21 juli, dat helemaal geen werkend bestand kon produceren. De HTML was fout opgebouwd, elementen werden niet weergegeven en vervolgprompts om de eigen output te repareren leverden niets op.
Uiteindelijk gaven we dat puin aan DeepSeek, dat 11 bugs vond en 8 fixes leverde om het speelbaar te maken. Drie weken later heeft dezelfde productlijn geen redding meer nodig en ligt het resultaat dicht bij wat GPT-5.6 Sol in onze juli-review produceerde.
Gemini 3.7 Flash wint dit overtuigend, en het is de sterkste reden om over te stappen. De kanttekening is dat het specificaties uitvoert in plaats van ze te bedenken, dus een vage prompt levert een vaag spel op.
Je kunt het spel van Gemini 3.7 Flash hier proberen.
Creatief schrijven: kan het een paradox vasthouden en een zin schrijven?
Dit onderdeel test twee dingen tegelijk: literaire kwaliteit en of een model zich aan een structurele regel over duizenden woorden kan houden. De prompt stuurt Jose Lanz vanuit 2150 terug naar het jaar 1000 en eist een gesloten oorzakelijke lus — zijn ingreep moet precies datgene zijn wat de toekomst creëert die hij wilde voorkomen.
De regel die de test beslist is de laatste clausule: He cannot understand what he did until he is home.
Gemini 3.7 Flash leverde een behoorlijk resultaat. Jose vuurt een entropisch kanon af in een Pyreneeën-spleet, smeedt per ongeluk een obelisk die het Iberië van de 22e eeuw tot slaaf maakt, en begrijpt de hele lus terwijl hij nog steeds duizend jaar te vroeg in de modder staat: "It was the base of the Cinder Spire."
De plotmechaniek is eigenlijk behoorlijk solide. Het verhaal vermeldt een vallende ster die door oude monniken werd waargenomen en verduidelijkt dat het de flits was van Jose's eigen aankomst, en het wapen dat hij meebracht om de anomalie uit te wissen is juist wat het smeedt. De slotregel — "It had simply been waiting for him to complete it" — raakt precies de deterministische uitkomst die de prompt vroeg.
Maar voor wie eraan gewend is, schreeuwt het verhaal "AI." Bijna elk zelfstandig naamwoord krijgt twee bijvoeglijke naamwoorden mee: "hyper-luminescent towers," "damp, moss-choked earth," "thick, obsidian hair." Dat is de tekstuur van een model dat het meest waarschijnlijke volgende woord kiest in plaats van bewust te kiezen, en dat levert botsingen op zoals een monoliet die "humming with a low-frequency hum".
We vergeleken het met Qwopus3.5-27B-v3, een community-finetune van Qwen3.5-27B die Claude-Opus-achtige redenering destilleert en op één consumenten-GPU draait voor niets per query. Het hield zich aan de regel die Gemini brak.
Jose doodt een monnik in San Millán de la Cogolla, een echt klooster in La Rioja dat rond het jaar 1000 daadwerkelijk van belang was, en begrijpt pas wat hij deed nadat hij terugkeert naar 2150 en zijn eigen DNA vindt in een codex met waszegel.
Qwopus is ook niet volledig schoon. Het dumpte zijn hele plannings-scratchpad boven het verhaal, inclusief typfouten, en het slotdeel breekt juist de gesloten lus die het in acht secties opbouwde door Jose terug te laten gaan en dingen te repareren.
Maar alles afwegend wint Qwopus. Gemini leverde het nettere pakket en het gedisciplineerdere einde, maar het faalde in de ene instructie waarop de prompt was gebaseerd, en een gratis model op een gaming-GPU schreef het betere verhaal.
Associatief denken: kan een metafoor een betoog dragen?
Deze test meet associatief redeneren — of een model verbanden kan leggen tussen losstaande concepten zonder zichzelf uit te hoeven leggen. De prompt vraagt om een beschrijving van een twijg, gebruikt die beschrijving om uitbuiting van arbeiders en de verering van de rijken te verklaren, en eist daarna dat het betoog oplost in een beschrijving van sla.
Signposting is de faalmodus. De metafoor benoemen doodt hem.
Gemini noemt het in de openingszin van zijn tweede alinea: "This is the precise mechanics of the modern proletariat." Alles daarvoor werkte.
Sommige beelden verdienen hun plek. De arbeider krijgt "just enough bark to stay rigid for another week of output," en de gevallen twijgen worden geconditioneerd om te geloven dat genoeg stijfheid elk van hen tot stam kan maken. De alinea met dat eerste beeld bevat ook een arbeider die "bound to an vast, top-heavy corporate hierarchy." Niet slecht qua logica en structuur.
De overgang is de echte instorting. Gemini beschrijft de overgang in plaats van hem uit te voeren — de hiërarchieën "crumble, dissolving into the quiet, humble reality of the organic world underneath" — en dan verschijnt er ineens sla, zonder verband met wat ervoor kwam.
GPT-5.6 Sol laat de twijg wegrotten tot aarde en laat daaruit de sla groeien: "Rain enters the grain. Fibers loosen, darken." Ook het betoog zit verstopt in het object, met rijkdom hervertaald als een taal van deugd waarin "The mansion signifies intelligence."
GPT-5.6 Sol wint ruim. Gemini leverde een mooie losse zin, maar verklaarde zijn eigen metafoor en sloeg vervolgens de overgang over die de prompt juist testte.
Logica: leest het de prompt of herkent het de puzzel?
Deze test meet niet-wiskundig redeneren, en specifiek of een model de vraag voor zich leest of patroonherkenning toepast op een versie die het gememoriseerd heeft. Onze brugprompt geeft vier mensen één fakkel en oversteektijden van 1, 2, 5 en 10 minuten, en vraagt vervolgens hoe snel ze allemaal kunnen oversteken.
De truc zit in wat de prompt weglaat. Er staat nergens dat er maar twee mensen tegelijk op de brug mogen, dus het antwoord is 10 minuten — iedereen loopt samen over in het tempo van de langzaamste persoon.
Gemini antwoordde 17 minuten, en gebruikte de gememoriseerde vijfstappen-oplossing uit de standaardversie van de puzzel. Het stelde de beperking als feit zonder ooit te controleren of wij die wel hadden geschreven.
De zichtbare redenering is nog slechter dan het antwoord. De redeneringsketen beweert dat de twee langzaamsten samen laten oversteken inefficiënt zou zijn, omdat iemand dan de fakkel terug zou moeten brengen — en vervolgens laat het eindantwoord ze toch samen oversteken. Het spreekt zichzelf binnen één antwoord tegen en rapporteert de uitkomst met volledige zekerheid.
Claude Fable 5 kwam in juli op hetzelfde verkeerde getal uit. Het begon door aan te geven wat het aannam: "assuming the classic constraint that the bridge holds only two people at a time," wat het verschil is tussen een fout antwoord dat je kunt opmerken en een fout antwoord dat je niet kunt zien aankomen.
Niemand wint. Fable pakt dit puur op transparantie, en het gebrek aan zelftwijfel in Gemini-agentruns komt hier naar voren in een puzzel die je met de hand kunt controleren.
Wiskunde: maakt het de klus af?
Deze test meet symbolische wiskunde ver voorbij consumentenverbruik, plus iets eenvoudigers — of het model doet wat het wordt gevraagd. De prompt vereist een oneven monische polynoom van graad 19 met reële coëfficiënten en lineaire coëfficiënt -19, waarvan de kromme uiteenvalt in minstens drie irreduceerbare componenten, en vraagt daarna om p(19).
Beide modellen vonden dezelfde deur. Gemini en Qwen 3.7 Max Preview identificeerden allebei de Dickson-polynoom, losten de beperking op om de parameter op 1 vast te zetten, en leidden de gesloten vorm correct af.
Daarna stopte Gemini. Het gaf p(19) als een niet-uitgerekende uitdrukking met de 19e macht van een vierkantswortel, leverde nooit het getal zelf en toonde ook nooit het gevraagde aantal componenten. Dit alles verscheen in een gestileerde HTML-pagina met CSS en een drop shadow waar niemand om had gevraagd.
Qwen maakte het af. Het gaf de volledige factorisatie in 10 componenten — één lineair, negen kwadratisch — rekende de recursie uit tot 1.876.572.071.974.094.803.391.179 en controleerde het resultaat modulair. We verifieerden dat getal onafhankelijk in SymPy en het klopt.
Qwen wint op de enige maatstaf die hier telde. Gemini begon goed en besloot toen de rekenkunde over te slaan, wat een merkwaardige plek is om te stoppen.
Conclusie
Gemini 3.7 Flash is de overstap waard als je al binnen Googles ecosysteem zit. Het is aanzienlijk beter in code dan het model dat het vervangt, snel genoeg om relevant te zijn voor agentwerk en goedkoop genoeg dat draaien op volume nauwelijks iets kost.
De sterke punten zijn uitvoering en structuur. Geef het een gedetailleerde specificatie en het bouwt het ding, houdt een plot overeind en bewaart de causale logica over duizenden woorden.
De zwakke punten zijn creativiteit en redeneren. Het schrijven is voorspelbaar genoeg om meteen als machinaal te herkennen, en het model geeft verkeerde antwoorden zonder de aanname te markeren die ze verkeerd maakte.
De prijs is het sterkste argument vóór het model. Met $0,75 per miljoen inputtokens en $3,75 output onderbiedt het GPT-5.6 Sol's invoertarief van $5 met 85% en kost het de helft van wat 3.6 Flash bij de lancering kostte.
Het argument tegen het model is een gratis 27B-model op een gaming-GPU dat een beter verhaal schreef en daar niets voor rekende. Googles introductietarief vervalt op 31 december, wanneer de invoerprijs verdubbelt naar $1,50 en de uitvoerprijs naar $7,50.