NieuwsAandelenDeepSeek V4.1-Flash daagt grotere AI-systemen uit bij codering en agenttaken

DeepSeek V4.1-Flash daagt grotere AI-systemen uit bij codering en agenttaken

Auteur: Metaverse Post·

Belangrijkste punten

  • DeepSeek heeft V4.1-Flash uitgebracht, dat wordt omschreven als het kleinste model in een nieuwe architectuurfamilie, terwijl het bedrijf zich volgens berichten voorbereidt op een beursgang op de STAR Market in Shanghai.
  • Het model gebruikt een mixture-of-experts-backbone met 552 miljard parameters en een causale encoder-decoderarchitectuur die 8 miljard parameters per invoertoken en 16 miljard per gegenereerd token activeert.
  • Efficiëntietechnieken zoals SWA Bounded Replay en Compressed Sparse Attention 2 met FP4-caching verlagen de KV-cachevereiste tot 890 bytes per token, ongeveer een kwart van de vereiste van het vorige Flash-model.
  • V4.1-Flash werd vanaf nul getraind op 45 biljoen multimodale tokens en presteerde beter dan DeepSeek-V4-Pro-Base op MMLU-Pro, HumanEval en GSM8K. Op Terminal-Bench 2.1 en DeepSWE v1.1 lag het model iets voor op toonaangevende Opus- en GPT-modellen.
  • Het model bleef achter bij de grootste vergelijkingsmodellen op GPQA Diamond, Humanity’s Last Exam en SimpleQA, en presteerde minder goed dan Opus-5.0 op de nieuwere evaluaties Terminal-Bench 3.0 en 4.0.
DeepSeek V4.1-Flash daagt grotere AI-systemen uit bij codering en agenttaken

De Chinese AI-start-up DeepSeek heeft DeepSeek-V4.1-Flash uitgebracht, dat het bedrijf omschrijft als het kleinste model in een nieuwe architectuurfamilie. De lancering komt op het moment dat het bedrijf zich volgens berichten voorbereidt op een beursgang op de technologiegerichte STAR Market in Shanghai.

Het multimodale model beschikt over een mixture-of-experts-backbone met 552 miljard parameters en ondersteunt contextvensters tot één miljoen tokens. De belangrijkste vooruitgang ligt in efficiëntie, niet in pure schaal. De causale encoder-decoderarchitectuur van DeepSeek verdeelt 40 transformerlagen over afzonderlijke coderings- en decoderingsfasen van elk 20 lagen. Daardoor worden 8 miljard parameters geactiveerd voor elk invoertoken en 16 miljard voor elk gegenereerd token.

De architectuur is gericht op agenttaken met veel invoer, waarbij het verwerken van grote documenten, codebases of gespreksgeschiedenissen een aanzienlijk deel van de rekenkosten kan uitmaken. DeepSeek zegt dat de SWA Bounded Replay-methode het overbodig maakt om geselecteerde attention states op solid-stateopslag te bewaren. Hierdoor wordt de persistente KV-cache ongeveer acht keer kleiner dan die van DeepSeek-V4-Flash.

Een verwant Compressed Sparse Attention 2-systeem wijst statische attentionmodi toe aan de lagen en hergebruikt geselecteerde attentionindexen. In combinatie met FP4-geformatteerde key-value caching verlaagt het systeem de wereldwijde KV-cachevereiste tot 890 bytes per token, ongeveer een kwart van de vereiste van het vorige Flash-model. Deze cijfers hebben betrekking op het geheugen dat tijdens inferentie wordt gebruikt om context vast te houden en staan los van het totale aantal parameters van het model. V4.1-Flash bevat ook conditioneel geheugen en speculative decoding, en gebruikt één gedeelde expert en 384 gerouteerde experts per MoE-laag.

De officiële website van DeepSeek is en het model is beschikbaar via

Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. Introducing the smallest model in our new architecture family, with native visual understanding. Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6 pic.twitter.com/wxJGiyX56o — DeepSeek (@deepseek_ai) September 10, 2026

De aankondiging is ook beschikbaar op X: en https://x.com/deepseek_ai/status/2097930608790167907?ref_src=twsrc%5Etfw.

Concurrentieresultaten voor redeneren, codering en agents

DeepSeek trainde V4.1-Flash vanaf nul op 45 biljoen multimodale tokens, waarbij afbeeldingen vanaf het begin van de pretraining naast tekst native werden verwerkt. De training met sparse attention begon met 64.000 tokens, waarna de contextlengte tijdens de fase met 34 biljoen tokens werd uitgebreid tot één miljoen tokens. De post-training combineerde supervised fine-tuning, reinforcement learning en on-policy distillation. De inspanning die aan redeneren wordt besteed, kan worden ingesteld op een schaal van één tot 100.

De gerapporteerde benchmarks laten sterke prestaties zien ten opzichte van veel grotere modellen. De basisversie behaalde 74.1 op MMLU-Pro, 79.4 op HumanEval en 93.0 op GSM8K, tegenover scores van 73.5, 76.8 en 92.6 voor DeepSeek-V4-Pro-Base. Bij maximale redeneercapaciteit behaalde V4.1-Flash 90.6 op Terminal-Bench 2.1 en 74.2 op DeepSWE v1.1, waarmee het model op die agentbenchmarks iets voorliep op toonaangevende Opus- en GPT-modellen. Het behaalde ook een Codeforces-rating van 3,471 en evenaarde het beste vermelde resultaat op MathArena Apex.

De resultaten waren niet overal dominant. V4.1-Flash bleef achter bij de grootste vergelijkingsmodellen op GPQA Diamond, Humanity’s Last Exam en SimpleQA. De scores op de nieuwere evaluaties Terminal-Bench 3.0 en 4.0 lagen ook onder die van Opus-5.0, hoewel ze aanzienlijke verbeteringen vertegenwoordigden ten opzichte van eerdere DeepSeek-modellen.

De multimodale resultaten omvatten scores van 56.5 op MMMU-Pro, 77.9 op CVBench en 95.6 op DocVQA. Met ingeschakelde agenttools behaalde het model 78.9 op Chartography en 89.6 op BabyVision.

Het oorspronkelijke bericht werd gepubliceerd door Metaverse Post: https://mpost.io/new-deepseek-v4-1-flash-challenges-larger-ai-systems-on-coding-and-agent-tasks/