Alibaba’s Qwen-team lanceert Qwen3.8-Flash-Next voor $0,16 per miljoen inputtokens
Belangrijkste punten
- •Qwen3.8-Flash-Next is een open-weight multimodaal MoE-model en een vroege voorvertoning van Qwen4-architectuur.
- •Het model heeft 125 miljard totale parameters, 51 miljard N-gram embedding-parameters en activeert 6 miljard parameters per token.
- •De QwenCloud API-prijs is vastgesteld op $0,16 per miljoen inputtokens en $0,47 per miljoen outputtokens.
- •Benchmarkresultaten omvatten 58,7% op DeepSWE 1.1, 62,5% op SWE-bench Pro en 73,9% op CoWorkBench.
- •De native contextlengte is 262.144 tokens en kan via YaRN worden uitgebreid tot één miljoen tokens.

Het Qwen Team heeft Qwen3.8-Flash-Next uitgebracht, een open-weight multimodaal mixture-of-experts-model dat dient als een vroege architecturale voorvertoning van de aankomende Qwen4-serie. Het model combineert een aanzienlijke capaciteit met sterke kostenefficiëntie, met 125 miljard totale parameters en nog eens 51 miljard N-gram embedding-parameters, terwijl het slechts 6 miljard parameters per token activeert.
De release volgt op Qwen3-Next, dat hybride architectuurontwerpen introduceerde die later werden overgenomen binnen de Qwen3.5- tot en met Qwen3.8-families. Qwen3.8-Flash-Next zal via de QwenCloud API beschikbaar zijn voor $0,16 per miljoen inputtokens en $0,47 per miljoen outputtokens, waarmee het wordt gepositioneerd voor workloads waarbij zowel doorvoer als tokencosts van belang zijn, waaronder coding assistants en enterprise agentic workflows.
Benchmarkresultaten wijzen op sterke prestaties bij software engineering en autonome agenttaken. Het model behaalde 58,7% op DeepSWE 1.1, 62,5% op SWE-bench Pro en 81,0% op de meertalige variant. Bij langlopende kantoorautomatisering, gemeten met CoWorkBench, scoorde het 73,9%, beter dan zowel Qwen3.7-Plus als Claude-Opus-4.6.
De algemene redeneercapaciteiten bleven eveneens sterk, met scores van 91,7% op GPQA Diamond en 91,9% op LiveCodeBench v6. De multimodale prestaties waren ook solide, met 84,5% op AndroidWorld en 76,6% op LVBench voor begrip van lange video’s. De native contextlengte bedraagt 262.144 tokens en kan via YaRN worden uitgebreid tot één miljoen tokens, wat het model relevant maakt voor langere documenten en meerstapsworkflows die grotere contextvensters nodig hebben.
Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $0.16/1M input tokens and $0.47/1M output tokens. 125B parameters + 51B N-gram… pic.twitter.com/SScnmzWS7O — Qwen (@Alibaba_Qwen) August 26, 2026
Architecturale innovaties en ontwikkelaarsintegratie
De architectuur introduceert vier systeemniveau-upgrades. Voor attention combineert het model Gated DeltaNet met Qwen Sparse Attention, waardoor historische context efficiënt wordt gecomprimeerd en relevante informatie wordt opgehaald via micro-block-indexering in plaats van token-niveauverwerking. Volgens de release levert dit ontwerp tot 7,6x prefill-versnelling op bij één miljoen tokens.
Het Gated Residual-mechanisme breidt de residual stream uit naar vier parallelle takken met dynamische gating. Het Qwen Team zegt dat dit de informatieflow tussen lagen en de trainingsstabiliteit verbetert, terwijl FP8-opslag wordt ondersteund om geheugenverkeer te verminderen. N-gram Embedding voegt capaciteit toe via lookups op lokale context die minimale rekenkracht vereisen en asynchroon kunnen worden vooraf opgehaald uit host memory.
Training gebruikt de Muon optimizer met verfijnde orthogonalisatie- en parameter-splittingstrategieën, wat volgens het team stabiele convergentie mogelijk maakt bij grotere batchgroottes zonder traditionele warm-upprocedures.
De modelgewichten zijn beschikbaar op HuggingFace en ModelScope. API-toegang wordt geleverd via QwenCloud, met ondersteuning voor OpenAI-compatibele Chat Completions en Anthropic-compatibele protocollen. Ontwikkelaars kunnen het model integreren in bestaande workflows via Claude Code, OpenAI Codex, Qoder CLI, Qwen Code en OpenClaw, waarbij reasoning effort configureerbaar is op low, medium en xhigh-niveau. Het team zei dat een officiële productierelease met ingebouwde tools en een standaardcontext van één miljoen tokens naar verwachting binnenkort zal volgen.
The post Alibaba Prices Qwen3.8-Flash API At $0.16 Per Million Tokens, Cutting Inference Costs For 125B-Parameter Model appeared first on Metaverse Post .