阿里巴巴 Qwen 团队推出 Qwen3.8-Flash-Next,输入每百万 Token 价格为 0.16 美元
要点速览
- •Qwen3.8-Flash-Next 是一款开放权重的多模态 MoE 模型,也是 Qwen4 架构的早期预览。
- •该模型共有 1250 亿个总参数、510 亿个 N-gram embedding 参数,并且每个 token 仅激活 60 亿个参数。
- •QwenCloud API 定价为每百万输入 token 0.16 美元、每百万输出 token 0.47 美元。
- •基准结果包括 DeepSWE 1.1 的 58.7%、SWE-bench Pro 的 62.5% 和 CoWorkBench 的 73.9%。
- •原生上下文长度为 262,144 个 token,并可通过 YaRN 扩展至 100 万个 token。

Qwen 团队发布了 Qwen3.8-Flash-Next,这是一款开放权重的多模态混合专家模型,作为即将推出的 Qwen4 系列的早期架构预览。该模型在保持较强容量的同时具备出色的成本效率,拥有 1250 亿个总参数和额外 510 亿个 N-gram embedding 参数,而每个 token 仅激活 60 亿个参数。
此次发布延续了 Qwen3-Next 的先例;后者引入了混合架构设计,并随后被 Qwen3.5 到 Qwen3.8 系列采用。Qwen3.8-Flash-Next 将通过 QwenCloud API 提供,定价为每百万输入 token 0.16 美元、每百万输出 token 0.47 美元,使其在高吞吐任务与 token 成本都需要关注的场景中具有竞争力,包括编程助手和企业智能体工作流。
基准结果显示,该模型在软件工程和自主智能体任务上表现强劲。它在 DeepSWE 1.1 上取得 58.7%,在 SWE-bench Pro 上取得 62.5%,在多语言版本上取得 81.0%。在 CoWorkBench 衡量的长周期办公自动化任务中,其得分为 73.9%,超过了 Qwen3.7-Plus 和 Claude-Opus-4.6。
其通用推理能力同样较强,在 GPQA Diamond 上得分 91.7%,在 LiveCodeBench v6 上得分 91.9%。多模态能力也同样稳健,其中 AndroidWorld 得分 84.5%,用于长视频理解的 LVBench 得分为 76.6%。原生上下文长度达到 262,144 个 token,并可通过 YaRN 扩展至 100 万个 token,这使其与需要更大上下文窗口的长文档和多步骤工作流相关。
Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $0.16/1M input tokens and $0.47/1M output tokens. 125B parameters + 51B N-gram… pic.twitter.com/SScnmzWS7O — Qwen (@Alibaba_Qwen) August 26, 2026
架构创新与开发者集成
该架构引入了四项系统级升级。在注意力机制方面,模型将 Gated DeltaNet 与 Qwen Sparse Attention 结合,通过微块索引而非逐 token 处理,高效压缩历史上下文并检索相关信息。根据发布信息,这一设计在 100 万 token 场景下可实现最高 7.6 倍的 prefill 加速。
Gated Residual 机制将残差流扩展为四条并行分支,并通过动态门控提升跨层信息流动和训练稳定性,同时支持 FP8 存储以减少内存流量。N-gram Embedding 通过本地上下文检索增加容量,所需计算量很低,并可从主机内存异步预取。训练采用 Muon 优化器,并结合改进的正交化和参数拆分策略,使其能够在更大 batch size 下稳定收敛,而无需传统的 warmup 过程。
模型权重已在 HuggingFace 和 ModelScope 上提供,API 访问可通过 QwenCloud 完成,并支持与 OpenAI 兼容的 Chat Completions 和与 Anthropic 兼容的协议。开发者可通过 Claude Code、OpenAI Codex、Qoder CLI、Qwen Code 和 OpenClaw 将模型集成到现有工作流中,推理强度可配置为 low、medium 和 xhigh 级别。官方生产版本预计将很快推出,内置工具和默认 100 万 token 上下文。