阿里巴巴Qwen推出Audio 3.1与移动智能体,Qwen 4与自研芯片昭示更大野心
要点速览
- •Qwen Audio 3.1由五个模型组成升级后的ASR、TTS和Realtime系统,以及面向音频创作和更深层次理解的新模型TTS-Next和ASR-Next。
- •旗舰TTS模型在独立的Artificial Analysis Text-to-Speech排行榜上排名第一,支持16种语言、20个中文方言地区,并可生成最长三分钟的连续语音。
- •阿里巴巴在发布时下调了语音服务价格,TTS成本下降约70%,Realtime下降约85%,ASR最高下降95%。
- •Qwen Intelligence发布时包含三个智能体,其中Mobile Use智能体在MobileWorld上得分为82.1,在MobileWorld Real上为92.2,在AndroidDaily上为97.2,据报道端到端任务成功率为90%。
- •在云栖大会上,阿里巴巴公布了四个层级但未公开规格的Qwen 4,宣布了训练5万亿至10万亿参数模型的计划,并发布了量产定于2027年第一季度的Zhenwu V900加速器。

阿里巴巴的Qwen团队推出了两款产品线新增内容:Qwen Audio 3.1,一套重构的语音系统,以及Qwen Intelligence,一组移动智能体。两者共同展示了该公司如何将模型势头转化为跨模态的可部署产品。
Qwen Audio 3.1:覆盖完整语音系统的五个模型
Qwen Audio 3.1由五个模型组成,分为两组:一组是升级后的核心产品线,涵盖理解、生成与交互;另一组是两个新模型,面向创作与更深层的理解。
在合成方面,旗舰文本转语音(TTS)模型在独立的Artificial Analysis Text-to-Speech排行榜上排名第一。它支持16种语言和20个中文方言地区,可一次性生成最长三分钟的连续语音,并接受自由格式的自然语言指令来控制情感、语速、音色和口音。它还提供86个细粒度内联标签,用于实现停顿、呼吸、笑声和叹息等短语级效果。
根据技术报告,12.5 Hz低帧率语音分词器降低了解码成本,同时五阶段训练流水线协调语言模型与流模型,以实现内容一致性、音色相似性和鲁棒性。即使参考音频嘈杂、混响或质量受损,系统也能生成可用的语音。配套模型TTS-Next将语言模型与扩散框架相结合,一次性生成语音、音效和背景音频,面向有声书、播客、游戏和广告领域。
在理解方面,升级后的自动语音识别(ASR)模型增强了多语言和方言识别能力,并带有原生转录润色功能,可自动删除填充词和重复内容。ASR-Next将其扩展到多说话人识别,支持说话人标签、时间戳和对齐转录。它还能解读情感、环境噪声和机器声音,实现声音字幕、事件定位和音频问答。
Realtime模型支持边说边听并可随时打断,当检测到来电者情绪低落时会调整语速和语气。阿里巴巴在发布的同时大幅降价:TTS成本下降约70%,Realtime下降约85%,ASR最高下降95%。降价覆盖整个核心产品线——合成、实时交互和识别——与以创作和理解为重点的新模型同步推出。
Meet Qwen-Audio-3.1! ASR, TTS & Realtime are fully upgraded, joined by two new models: TTS-Next for audio creation and ASR-Next for audio understanding. Five models, one complete audio stack: understanding, generation, interaction & creation. Plus big price cuts across the… pic.twitter.com/Qcbvcw0q9C
— Qwen (@Alibaba_Qwen) September 23, 2026 (on X)
Qwen Intelligence:面向移动任务执行的智能体
Qwen Intelligence瞄准了一个完全不同的层面:移动设备上的自主任务执行。其Planner智能体负责分解和编排复杂,在该公司自己的MobilePA Bench及其业务和记忆变体上排名第一。
Mobile Use智能体主要通过API执行操作,必要时回退到图形界面控制。它在MobileWorld上得分为82.1,在真机基准MobileWorld Real上得分为92.2,在AndroidDaily上得分为97.2,据报道在完整端到端任务上的成功率为90%。Creative智能体可在约三秒内根据一句话生成可用图像——据阿里巴巴称,速度约为领先替代方案的两倍。
该公司还向研究界开放了其基准测试套件,包括MobilePA Bench、MobileWorld、MobileWorld Real和MobileWorld Safety——这些是多项智能体成绩背后的衡量标准——为独立于阿里巴巴自身报告评估移动智能体提供了外部参照。
Introducing Qwen Intelligence, bringing personal intelligence within everyone's reach. It launches with three SOTA agents: – Mobile Planner Agent: plans, decomposes & orchestrates complex tasks. #1 on MobilePA-Bench, MobilePA-Bench Business & Memory. – Mobile-Use Agent:… pic.twitter.com/OgCLpxDJgj
— Qwen (@Alibaba_Qwen) September 23, 2026 (on X)
大会之后的舞台:Qwen 4与基础设施公告
这些发布紧随阿里巴巴9月22日在杭州举行的云栖大会之后,会上公布了四个层级的Qwen 4系列:Max是对标顶级竞品模型的旗舰版本,Flash面向低延迟和高吞吐工作负载,Plus是均衡的多模态层级,还有一个用于本地部署的27B开放权重变体。四者均未公布规格、定价或发布日期,使这一公告更像是一个方向性声明,而非可交付产品。
大会的其他公告进一步明确了这一方向。首席执行官吴泳铭表示,Qwen团队计划训练5万亿至10万亿参数的模型——阿里巴巴自己的声明将这一目标归于Qwen 4.5和Qwen 5——以应对更复杂、更长周期的任务。为支持这一规模的模型,阿里巴巴旗下平头哥(T-Head)发布了Zhenwu V900加速器,承诺性能是前代M890的三倍,配备216 GB内存,可扩展至最多50万颗芯片的集群,量产计划于2027年第一季度进行。
吴泳铭设定了到2032年全球云计算容量超过20吉瓦的目标,并描述了一种面向智能体工作负载的三层云架构。他还指出,对AI的需求正在超过供给,AI超节点将于本季度以商业规模上线。阿里巴巴港股当日上涨5.1%。
国产芯片的推进正值美国出口管制收紧之际。分析师指出,8月开源的Qwen3.8 Flash Next凭借其稀疏注意力和n-gram嵌入技术,是下一代架构最接近的现有预览,不过阿里巴巴尚未确认二者之间的关联。
更宏大的轨迹:从开放模型到一体化技术栈
最近的发布为一条不断加速的轨迹画上阶段性句点。据阿里巴巴称,自2023年首次亮相以来,Qwen已成为使用最广泛的开放权重模型系列,累计下载量超过3亿次,在Hugging Face上衍生模型超过10万个。
当前旗舰模型Qwen3.8 Max于8月以开放权重发布,包含2.4万亿参数,可处理100万token的上下文;9月的Qwen3.8 Omni Flash则将原生处理能力扩展到文本、图像、音频和视频。许可结构也在同步演进:旗舰模型包含一项条款,要求年收入超过5000万美元的公司与阿里巴巴分享该部分收入,而较小的蒸馏模型则以宽松的Apache 2.0许可证发布。
若干悬而未决的问题将决定这一战略的走向:独立验证的基准测试能否证实厂商报告的智能体和语音模型结果、芯片生产时间表能否与模型路线图保持一致,以及收入分享许可在实践中如何被采用。随着Qwen 4规格仍未公开而下一代模型已在训练之中,阿里巴巴已铺开了一份横跨芯片、云基础设施、模型和消费级智能体的异常宏大议程。未来几个季度将展示这些板块如何在实践中汇聚。