NachrichtenAktienAlibabas Qwen-Team veröffentlicht Qwen3.8-Flash-Next zu $0.16 pro Million Input-Tokens

Alibabas Qwen-Team veröffentlicht Qwen3.8-Flash-Next zu $0.16 pro Million Input-Tokens

Autor: Metaverse Post·

Wichtige Erkenntnisse

  • Qwen3.8-Flash-Next ist ein multimodales MoE-Modell mit offenen Gewichten und ein früher Ausblick auf die Qwen4-Architektur.
  • Das Modell hat 125 Milliarden Gesamtparameter, 51 Milliarden N-gram-Embedding-Parameter und aktiviert 6 Milliarden Parameter pro Token.
  • Die QwenCloud-API wird mit $0.16 pro Million Input-Tokens und $0.47 pro Million Output-Tokens bepreist.
  • Zu den Benchmark-Ergebnissen zählen 58.7% auf DeepSWE 1.1, 62.5% auf SWE-bench Pro und 73.9% auf CoWorkBench.
  • Die native Kontextlänge beträgt 262.144 Tokens und kann über YaRN auf eine Million Tokens erweitert werden.
Alibabas Qwen-Team veröffentlicht Qwen3.8-Flash-Next zu $0.16 pro Million Input-Tokens

Das Qwen-Team hat Qwen3.8-Flash-Next veröffentlicht, ein multimodales Mixture-of-Experts-Modell mit offenen Gewichten, das als früher architektonischer Ausblick auf die kommende Qwen4-Serie dient. Das Modell verbindet erhebliche Kapazität mit hoher Kosteneffizienz: Es verfügt über 125 Milliarden Gesamtparameter und zusätzliche 51 Milliarden N-gram-Embedding-Parameter, aktiviert jedoch nur 6 Milliarden Parameter pro Token.

Die Veröffentlichung folgt dem Vorbild von Qwen3-Next, das hybride Architekturdesigns einführte, die später in den Familien Qwen3.5 bis Qwen3.8 übernommen wurden. Qwen3.8-Flash-Next wird über die QwenCloud API zu $0.16 pro Million Input-Tokens und $0.47 pro Million Output-Tokens verfügbar sein und damit für Workloads positioniert, bei denen sowohl Durchsatz als auch Token-Kosten wichtig sind, darunter Coding-Assistenten und unternehmensweite agentische Workflows.

Benchmark-Ergebnisse deuten auf eine starke Leistung bei Software-Engineering- und autonomen Agentenaufgaben hin. Das Modell erreichte 58.7% auf DeepSWE 1.1, 62.5% auf SWE-bench Pro und 81.0% auf der mehrsprachigen Variante. Bei der langfristigen Office-Automatisierung, gemessen mit CoWorkBench, erzielte es 73.9% und lag damit vor sowohl Qwen3.7-Plus als auch Claude-Opus-4.6.

Auch die allgemeine Reasoning-Leistung war stark, mit 91.7% auf GPQA Diamond und 91.9% auf LiveCodeBench v6. Die multimodale Leistung blieb ebenfalls solide, darunter 84.5% auf AndroidWorld und 76.6% auf LVBench für das Verständnis langer Videos. Die native Kontextlänge beträgt 262.144 Tokens und kann über YaRN auf eine Million Tokens erweitert werden, was das Modell für längere Dokumente und mehrstufige Workflows mit größerem Kontextfenster relevant macht.

Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $0.16/1M input tokens and $0.47/1M output tokens. 125B parameters + 51B N-gram… pic.twitter.com/SScnmzWS7O — Qwen (@Alibaba_Qwen) August 26, 2026

Architektonische Innovationen und Entwicklerintegration

Die Architektur führt vier systematische Verbesserungen ein. Beim Attention-Mechanismus kombiniert das Modell Gated DeltaNet mit Qwen Sparse Attention und komprimiert historischen Kontext effizient, während relevante Informationen über Micro-Block-Indexierung statt über Token-Level-Verarbeitung abgerufen werden. Laut der Veröffentlichung ermöglicht dieses Design eine bis zu 7.6x schnellere Prefill-Phase bei einer Million Tokens.

Der Gated-Residual-Mechanismus erweitert den Residual-Stream in vier parallele Zweige mit dynamischem Gating. Das Qwen-Team sagt, dass dies den cross-layer Informationsfluss und die Trainingsstabilität verbessert und gleichzeitig FP8-Speicherung zur Reduzierung des Speicherverkehrs unterstützt. N-gram Embedding erhöht die Kapazität durch lokale Kontextabfragen, die nur minimale Rechenleistung benötigen und asynchron aus dem Host-Speicher vorab geladen werden können.

Das Training verwendet den Muon-Optimizer mit verfeinerter Orthogonalisierung und Parameter-Splitting-Strategien, was laut dem Team eine stabile Konvergenz bei größeren Batch-Größen ohne traditionelle Warmup-Verfahren ermöglicht.

Die Modellgewichte sind auf HuggingFace und ModelScope verfügbar. Der API-Zugang erfolgt über QwenCloud mit Unterstützung für OpenAI-kompatible Chat Completions und Anthropic-kompatible Protokolle. Entwickler können das Modell über Claude Code, OpenAI Codex, Qoder CLI, Qwen Code und OpenClaw in bestehende Workflows integrieren, wobei der Reasoning-Aufwand in den Stufen low, medium und xhigh konfigurierbar ist. Eine offizielle Produktionsveröffentlichung mit integrierten Tools und einem standardmäßigen Kontext von einer Million Tokens soll in Kürze folgen.

The post Alibaba Prices Qwen3.8-Flash API At $0.16 Per Million Tokens, Cutting Inference Costs For 125B-Parameter Model appeared first on Metaverse Post .