DeepSeek V4.1 Flash komt bij designprestaties bijna op GPT-6 Astra uit voor 1,4% van de kosten
Belangrijkste punten
- •DeepSeek V4.1 Flash behaalde 81,2 punten, slechts 1,5 punt minder dan de leidende score van 82,7 voor GPT-6 Astra.
- •De gemiddelde kosten van DeepSeek bedroegen $0.023 per voltooid ontwerp, tegenover $1.61 voor Astra en $3.66 voor Claude Fable 5.1.
- •DeepSeek voltooide elk ontwerp gemiddeld in 5,3 minuten, sneller dan Astra met 11,1 minuten en Fable met 12,8 minuten.
- •De benchmark testte 13 modellen op praktische designoutputs. Elf modellen scoorden lager dan DeepSeek en waren bovendien duurder in gebruik.
- •De opleveringspercentages bedroegen 57,7% voor DeepSeek, 60% voor Astra en 56,7% voor Fable; deze percentages weerspiegelen outputs die zonder revisie gereed werden geacht.

OpenDesign Arena gaf DeepSeek V4.1 Flash een score van 81,2 op 100 voor realistische designtaken, waarmee het model OpenAI’s GPT-6 Astra, dat 82,7 punten behaalde, bijna evenaarde. Het model van DeepSeek kostte $0.023 per voltooid ontwerp, tegenover $1.61 voor Astra — ongeveer 1,4% van die prijs.
OpenDesign, het bedrijf achter de benchmarksite OpenDesign Arena, liet deze week 13 AI-modellen dezelfde reeks designtaken uitvoeren. Elf modellen scoorden lager dan DeepSeek V4.1 Flash en waren duurder in gebruik. Alleen GPT-6 Astra behaalde een hogere score.
OpenDesign Arena beoordeelt alledaags ontwerpwerk, waaronder webapps, dashboards, mobiele schermen en landingspagina’s, op een schaal van 100 punten. Dertig punten meten of een output aan de opdracht voldoet; de overige 70 punten beoordelen de ontwerpkwaliteit, waaronder lay-out, hiërarchie, kleur en de aansluiting bij de gevraagde stijl. De benchmark is bedoeld om een beperktere vraag te beantwoorden dan algemene AI-leaderboards: welk model een werkende webdesigner voor praktisch werk zou kunnen gebruiken.
GPT-6 Astra behaalde gemiddeld 82,7 punten, voltooide elk ontwerp in 11,1 minuten en kostte $1.61 per voltooid resultaat. DeepSeek V4.1 Flash scoorde 81,2 punten, had 5,3 minuten nodig en kostte $0.023. Claude Fable 5.1 eindigde als derde met een score van 80,3, een gemiddelde voltooiingstijd van 12,8 minuten en kosten van $3.66 per ontwerp.
Tot de andere geteste modellen behoorden Grok 4.6, Qwen 3.8-Max, Kimi K3, GLM-5.3 Flash en Gemini 3.8 Flash. Elk daarvan scoorde lager dan DeepSeek V4.1 Flash en kostte meer om te gebruiken. In totaal ging het om 11 van de 13 geteste modellen. GPT-6 Astra scoorde 1,5 punt hoger dan DeepSeek.
Het technische rapport van DeepSeek over V4.1 Flash schrijft de lagere gebruikskosten en snellere voltooiingstijden van het model toe aan de architectuur. Het model beschikt over 552 miljard parameters — de interne instellingen die tijdens de training worden aangepast — maar activeert slechts 8 miljard parameters om een binnenkomende prompt te verwerken en 16 miljard om een antwoord te genereren. DeepSeek noemt dit ontwerp een Causal Encoder-Decoder-architectuur.
Het resultaat volgt op andere pogingen van DeepSeek om capaciteitsverschillen met concurrerende modellen te verkleinen tegen lagere kosten. Enkele weken eerder kwam het V4 Pro-model van het bedrijf bij een afzonderlijke benchmarkvergelijking binnen 5% van Claude Fable 5, terwijl het een fractie van Fables tarief in rekening bracht. DeepSeek wierf ook ingenieurs in Beijing voor de ontwikkeling van een eigen Code Harness, met als doel de volledige agentische stack te beheersen in plaats van alleen het onderliggende model te leveren.
De testmethode van OpenDesign beperkt wat de resultaten aantonen. Een output krijgt alleen een score als deze aanvankelijk als een werkende webpagina wordt weergegeven. Lege, defecte of afgekapt weergegeven outputs krijgen nul punten en worden niet opnieuw getest. Daardoor meet de benchmark betrouwbare prestaties bij alledaagse designtaken, en niet algemene redeneercapaciteit of programmeervaardigheid.
OpenAI bracht GPT-6 Astra op 3 september uit. Het model staat bekend als een generalist die onder meer een printplaat kan ontwerpen, een belastingaangifte kan opstellen en een 3D-scène kan bouwen, hoewel vroege testers het als een zwakkere schrijver beoordeelden dan het model dat het verving. Op de benchmark van OpenDesign was Astra langzamer en duurder dan DeepSeek V4.1 Flash, maar bleef het model met de hoogste score in het geteste veld.
Het opleveringspercentage van OpenDesign, gedefinieerd als het aandeel outputs dat volgens de beoordelaars zonder revisie kon worden overgedragen, bedroeg 57,7% voor DeepSeek V4.1 Flash, 60% voor GPT-6 Astra en 56,7% voor Claude Fable 5.1. Deze percentages voegen een praktische maatstaf toe aan de kwaliteitsscores van de benchmark: ze laten zien hoe vaak elk model een output produceerde die beoordelaars zonder verdere aanpassingen bruikbaar vonden.
Gerelateerde berichtgeving: OpenAI brengt GPT-6 Astra uit, DeepSeek verbetert V4 Pro en DeepSeeks Code Harness-plannen.
Bron: Decrypt