Alibaba: il team Qwen lancia Qwen3.8-Flash-Next a $0.16 per milione di token di input
Punti chiave
- •Qwen3.8-Flash-Next è un modello multimodale open-weight di tipo MoE e un’anteprima iniziale dell’architettura Qwen4.
- •Il modello ha 125 miliardi di parametri totali, 51 miliardi di parametri di embedding N-gram e attiva 6 miliardi di parametri per token.
- •Il prezzo della QwenCloud API è fissato a $0.16 per milione di token di input e $0.47 per milione di token di output.
- •I benchmark includono 58.7% su DeepSWE 1.1, 62.5% su SWE-bench Pro e 73.9% su CoWorkBench.
- •La lunghezza nativa del contesto è di 262.144 token e può essere estesa fino a un milione di token tramite YaRN.

Il team Qwen ha rilasciato Qwen3.8-Flash-Next, un modello multimodale open-weight di tipo mixture-of-experts che funge da prima anteprima architetturale della prossima serie Qwen4. Il modello combina una capacità elevata con un’efficienza dei costi notevole, con 125 miliardi di parametri totali e ulteriori 51 miliardi di parametri di embedding N-gram, attivando però solo 6 miliardi di parametri per token.
Il rilascio segue Qwen3-Next, che ha introdotto design architetturali ibridi poi adottati nelle famiglie Qwen3.5 fino a Qwen3.8. Qwen3.8-Flash-Next sarà disponibile tramite la QwenCloud API a $0.16 per milione di token di input e $0.47 per milione di token di output, posizionandosi per carichi di lavoro in cui contano sia il throughput sia i costi dei token, inclusi assistenti di coding e workflow agentici per aziende.
I risultati dei benchmark indicano prestazioni solide in software engineering e nei task degli agenti autonomi. Il modello ha ottenuto 58.7% su DeepSWE 1.1, 62.5% su SWE-bench Pro e 81.0% sulla variante multilingue. Nell’automazione d’ufficio a lungo orizzonte misurata da CoWorkBench, ha registrato 73.9%, superando sia Qwen3.7-Plus sia Claude-Opus-4.6.
Anche le capacità di ragionamento generale restano robuste, con punteggi di 91.7% su GPQA Diamond e 91.9% su LiveCodeBench v6. Le competenze multimodali sono altrettanto solide, con 84.5% su AndroidWorld e 76.6% su LVBench per la comprensione di video lunghi. La lunghezza nativa del contesto raggiunge 262.144 token, estendibile fino a un milione di token tramite YaRN.
Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $0.16/1M input tokens and $0.47/1M output tokens. 125B parameters + 51B N-gram… pic.twitter.com/SScnmzWS7O — Qwen (@Alibaba_Qwen) August 26, 2026
Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $0.16/1M input tokens and $0.47/1M output tokens. 125B parameters + 51B N-gram… pic.twitter.com/SScnmzWS7O
Innovazioni architetturali e integrazione per gli sviluppatori
L’architettura introduce quattro aggiornamenti sistematici. Per l’attenzione, il modello combina Gated DeltaNet con Qwen Sparse Attention, comprimendo in modo efficiente il contesto storico e recuperando le informazioni rilevanti tramite micro-block indexing invece che con l’elaborazione a livello di token. Questo design consente fino a 7.6× di accelerazione del prefill a un milione di token.
Il meccanismo Gated Residual espande il flusso residuo in quattro rami paralleli con gating dinamico, migliorando il flusso di informazioni tra i layer e la stabilità dell’addestramento, con supporto per l’archiviazione FP8 per ridurre il traffico di memoria. N-gram Embedding aggiunge capacità tramite ricerche sul contesto locale che richiedono un calcolo minimo e possono essere precaricate in modo asincrono dalla memoria host. L’addestramento utilizza l’ottimizzatore Muon con strategie di orthogonalization e parameter-splitting affinate, consentendo una convergenza stabile con batch size più grandi senza le tradizionali procedure di warmup.
I pesi del modello sono disponibili su HuggingFace e ModelScope, con accesso API tramite QwenCloud che supporta OpenAI-compatible Chat Completions e protocolli compatibili con Anthropic. Gli sviluppatori possono integrare il modello nei flussi di lavoro esistenti tramite Claude Code, OpenAI Codex, Qoder CLI, Qwen Code e OpenClaw, con livello di reasoning configurabile su low, medium e xhigh. È atteso a breve un rilascio ufficiale di produzione con strumenti integrati e contesto predefinito da un milione di token.
Il post Alibaba Prices Qwen3.8-Flash API At $0.16 Per Million Tokens, Cutting Inference Costs For 125B-Parameter Model è apparso per la prima volta su Metaverse Post.