阿里巴巴 Qwen 團隊推出 Qwen3.8-Flash-Next,輸入每百萬 tokens 僅 $0.16
重點速覽
- •Qwen3.8-Flash-Next 是一款開放權重的多模態 MoE 模型,也是 Qwen4 架構的早期預覽。
- •該模型共有 1250 億個總參數、510 億個 N-gram embedding 參數,且每個 token 僅啟用 60 億個參數。
- •QwenCloud API 定價為每百萬輸入 tokens $0.16、每百萬輸出 tokens $0.47。
- •基準測試結果包括 DeepSWE 1.1 的 58.7%、SWE-bench Pro 的 62.5%,以及 CoWorkBench 的 73.9%。
- •原生上下文長度為 262,144 個 tokens,並可透過 YaRN 擴展至 100 萬個 tokens。

Qwen 團隊已發布 Qwen3.8-Flash-Next,這是一款開放權重的多模態 mixture-of-experts 模型,作為即將推出的 Qwen4 系列的早期架構預覽。該模型兼顧龐大容量與極高成本效率,具備 1250 億個總參數與額外 510 億個 N-gram embedding 參數,同時每個 token 僅啟用 60 億個參數。
此次發布延續了 Qwen3-Next 的先例;後者引入的混合架構設計,之後被 Qwen3.5 到 Qwen3.8 系列採用。Qwen3.8-Flash-Next 將透過 QwenCloud API 提供,價格為每百萬輸入 tokens $0.16、每百萬輸出 tokens $0.47,使其在高吞吐量需求情境、程式碼助理與企業代理式工作流程中具有相當競爭力。
基準測試結果顯示,該模型在軟體工程與自主代理任務方面表現強勁。它在 DeepSWE 1.1 上取得 58.7%,在 SWE-bench Pro 上取得 62.5%,在多語言版本上取得 81.0%。在 CoWorkBench 衡量的長週期辦公自動化任務中,其得分為 73.9%,超越 Qwen3.7-Plus 與 Claude-Opus-4.6。
其通用推理能力同樣穩健,在 GPQA Diamond 上得分 91.7%,在 LiveCodeBench v6 上得分 91.9%。多模態能力也同樣扎實,其中在 AndroidWorld 上得分 84.5%,在長影片理解的 LVBench 上得分 76.6%。原生上下文長度可達 262,144 個 tokens,並可透過 YaRN 擴展至 100 萬個 tokens。
Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $0.16/1M input tokens and $0.47/1M output tokens. 125B parameters + 51B N-gram… pic.twitter.com/SScnmzWS7O — Qwen (@Alibaba_Qwen) August 26, 2026
Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $0.16/1M input tokens and $0.47/1M output tokens. 125B parameters + 51B N-gram… pic.twitter.com/SScnmzWS7O
架構創新與開發者整合
這項架構引入了四項系統性升級。在注意力機制方面,模型結合 Gated DeltaNet 與 Qwen Sparse Attention,透過微區塊索引而非 token 級處理,高效壓縮歷史上下文,同時擷取相關資訊。根據發布內容,這項設計在一百萬個 tokens 的情境下可帶來最高 7.6 倍的 prefill 加速。
Gated Residual 機制將 residual stream 擴展為四個平行分支,並採用動態 gating,在支援 FP8 儲存以降低記憶體傳輸的同時,提升跨層資訊流與訓練穩定性。N-gram Embedding 則透過局部上下文查找增加容量,所需計算量極低,且可從主機記憶體非同步預取。訓練方面採用 Muon optimizer,並搭配改良的正交化與參數分割策略,使模型能在更大的 batch size 下穩定收斂,而無需傳統 warmup 程序。
模型權重可在 HuggingFace 與 ModelScope 取得,API 則透過 QwenCloud 提供,支援與 OpenAI 相容的 Chat Completions 與 Anthropic 相容協議。開發者可透過 Claude Code、OpenAI Codex、Qoder CLI、Qwen Code 與 OpenClaw 將模型整合進既有工作流程,且 reasoning effort 可設定為 low、medium 與 xhigh。官方正式版本預計不久後推出,並將內建工具與預設一百萬個 tokens 的上下文長度。