ActualitésActionsL’équipe Qwen d’Alibaba lance Qwen3.8-Flash-Next à 0,16 $ par million de jetons d’entrée

L’équipe Qwen d’Alibaba lance Qwen3.8-Flash-Next à 0,16 $ par million de jetons d’entrée

Auteur: Metaverse Post·

Points clés

  • Qwen3.8-Flash-Next est un modèle multimodal open-weight de type MoE et un aperçu précoce de l’architecture Qwen4.
  • Le modèle compte 125 milliards de paramètres totaux, 51 milliards de paramètres d’intégration N-gram et n’active que 6 milliards de paramètres par jeton.
  • La tarification de l’API QwenCloud est fixée à 0,16 $ par million de jetons d’entrée et 0,47 $ par million de jetons de sortie.
  • Les résultats de benchmark incluent 58,7 % sur DeepSWE 1.1, 62,5 % sur SWE-bench Pro et 73,9 % sur CoWorkBench.
  • La longueur de contexte native est de 262 144 jetons et peut être étendue à un million de jetons via YaRN.
L’équipe Qwen d’Alibaba lance Qwen3.8-Flash-Next à 0,16 $ par million de jetons d’entrée

L’équipe Qwen a publié Qwen3.8-Flash-Next, un modèle multimodal open-weight de type mixture-of-experts qui sert d’aperçu architectural précoce de la prochaine série Qwen4. Le modèle combine une capacité importante avec une forte efficacité en matière de coûts, avec 125 milliards de paramètres totaux et 51 milliards de paramètres d’intégration N-gram supplémentaires, tout en n’activant que 6 milliards de paramètres par jeton.

Cette publication s’inscrit dans la continuité de Qwen3-Next, qui avait introduit des conceptions d’architecture hybride ensuite adoptées dans les familles Qwen3.5 à Qwen3.8. Qwen3.8-Flash-Next sera disponible via l’API QwenCloud au tarif de 0,16 $ par million de jetons d’entrée et de 0,47 $ par million de jetons de sortie, ce qui le positionne pour des charges de travail où le débit et le coût des jetons sont tous deux importants, notamment les assistants de codage et les workflows agentiques d’entreprise.

Les résultats de benchmark indiquent de bonnes performances sur les tâches d’ingénierie logicielle et d’agents autonomes. Le modèle a obtenu 58,7 % sur DeepSWE 1.1, 62,5 % sur SWE-bench Pro et 81,0 % sur la variante multilingue. Dans l’automatisation de bureau à long horizon mesurée par CoWorkBench, il a obtenu 73,9 %, devant Qwen3.7-Plus et Claude-Opus-4.6.

Ses capacités générales de raisonnement sont également solides, avec des scores de 91,7 % sur GPQA Diamond et 91,9 % sur LiveCodeBench v6. Les performances multimodales restent elles aussi élevées, avec 84,5 % sur AndroidWorld et 76,6 % sur LVBench pour la compréhension de longues vidéos. La longueur de contexte native atteint 262 144 jetons et peut être étendue à un million de jetons via YaRN, ce qui rend le modèle pertinent pour des documents plus longs et des workflows en عدة étapes nécessitant des fenêtres de contexte plus larges.

Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $0.16/1M input tokens and $0.47/1M output tokens. 125B parameters + 51B N-gram… pic.twitter.com/SScnmzWS7O — Qwen (@Alibaba_Qwen) August 26, 2026

Innovations architecturales et intégration pour les développeurs

L’architecture introduit quatre améliorations systématiques. Pour l’attention, le modèle combine Gated DeltaNet avec Qwen Sparse Attention, compressant efficacement le contexte historique tout en récupérant les informations pertinentes via un indexage par micro-blocs plutôt qu’un traitement au niveau du jeton. Selon la publication, cette conception permet un accélération du préremplissage allant jusqu’à 7,6x à un million de jetons.

Le mécanisme Gated Residual étend le flux résiduel en quatre branches parallèles avec un contrôle dynamique, améliorant la circulation de l’information entre les couches et la stabilité de l’entraînement, tout en prenant en charge le stockage FP8 afin de réduire le trafic mémoire. N-gram Embedding ajoute de la capacité grâce à des recherches dans le contexte local qui nécessitent un calcul minimal et peuvent être préchargées de manière asynchrone depuis la mémoire hôte. L’entraînement utilise l’optimiseur Muon avec des stratégies affinées d’orthogonalisation et de séparation des paramètres, ce qui permet une convergence stable avec des tailles de lot plus élevées sans procédures de warmup traditionnelles.

Les poids du modèle sont disponibles sur HuggingFace et ModelScope, avec un accès API via QwenCloud prenant en charge les protocoles OpenAI-compatible Chat Completions et Anthropic-compatible. Les développeurs peuvent intégrer le modèle dans leurs flux de travail existants via Claude Code, OpenAI Codex, Qoder CLI, Qwen Code et OpenClaw, avec un effort de raisonnement configurable sur les niveaux low, medium et xhigh. Une version officielle de production avec des outils intégrés et un contexte par défaut d’un million de jetons est attendue prochainement.

The post Alibaba Prices Qwen3.8-Flash API At $0.16 Per Million Tokens, Cutting Inference Costs For 125B-Parameter Model appeared first on Metaverse Post .