阿里巴巴拓展Qwen至語音與行動代理,Qwen 4與自研晶片凸顯更大野心
重點速覽
- •Qwen Audio 3.1由五個模型組成:升級版ASR、TTS與Realtime系統,以及用於音訊創作與更深層理解的新模型TTS-Next與ASR-Next。
- •旗艦TTS模型在獨立的Artificial Analysis文字轉語音排行榜上排名第一,支援16種語、20個中文方言地區,並可生成最長三分鐘的連續語音。
- •阿里巴巴在發布時調降語音服務價格,TTS成本降幅約70%,Realtime約85%,ASR最高達95%。
- •Qwen Intelligence發布三個代理,其中Mobile Use代理在MobileWorld取得82.1分、MobileWorld Real取得92.2分、AndroidDaily取得97.2分,據報導端到端任務成功率為90%。
- •在雲棲大會上,阿里巴巴公布了四個級別的Qwen 4但未公布規格,宣布計劃訓練5兆至10兆參數的模型,並發布了Zhenwu V900加速器,量產計劃於2027年第一季進行。

阿里巴巴的Qwen團隊發布了兩項產品線更新:Qwen Audio 3.1,一套重建的語音技術堆疊,以及Qwen Intelligence,一套行動代理套件。兩者共同展示了該公司如何將其模型動能轉化為可部署的多模態產品。
Qwen Audio 3.1:完整語音堆疊中的五個模型
Qwen Audio 3.1由五個模型組成,分為兩大類:涵蓋理解、生成與互動的升級核心陣容,以及兩個針對創作與更深層理解的新模型。
在合成方面,旗艦文字轉語音(TTS)模型在獨立的Artificial Analysis文字轉語音排行榜上排名第一。它支援16種語言與20個中文方言地區,可一次性生成最長三分鐘的連續語音,並接受自由形式的自然語言指令,控制情感、語速、音色與口音。它還提供86個細粒度內嵌標籤,實現短語級效果,例如停頓、呼吸、笑聲與嘆息。
根據技術報告,12.5 Hz低幀率語音分詞器降低了解碼成本,而五階段訓練流程協調語言模型與流模型,以確保內容一致性、音色相似度與穩健性。該系統即使從嘈雜、有迴聲或品質劣化的參考音訊中,也能生成可用的語音。配套模型TTS-Next將語言模型與擴散框架結合,一次性生成語音、音效與背景音訊,目標應用包括有聲書、播客、遊戲與廣告。
在理解方面,升級版自動語音辨識(ASR)模型增強了多語言與方言辨識能力,並具備原生轉錄潤飾功能,可自動移除填充詞與重複內容。ASR-Next將此擴展至多說話人辨識,提供說話人標籤、時間戳與對齊的轉錄。它還能解讀情感、噪音與機器聲響,實現聲音字幕、事件定位與音訊問答。
Realtime模型支援邊說邊聽並可隨時插話打斷,並在偵測到來電者情緒低落時調整語速與語調。阿里巴巴在發布同時大幅降價:TTS成本下降約70%,Realtime約85%,ASR最高達95%。降價涵蓋整個核心陣容——合成、即時互動與辨識——與新的創作及理解導向模型同步於發布時推出。
Meet Qwen-Audio-3.1! ASR, TTS & Realtime are fully upgraded, joined by two new models: TTS-Next for audio creation and ASR-Next for audio understanding. Five models, one complete audio stack: understanding, generation, interaction & creation. Plus big price cuts across the… pic.twitter.com/Qcbvcw0q9C
— Qwen (@Alibaba_Qwen) September 23, 2026 (on X)
Qwen Intelligence:行動任務執行代理
Qwen Intelligence瞄準完全不同的層面:在行動裝置上自主執行任務。其Planner代理可分解並編排複雜任務,在該公司的MobilePA Bench(包括其商業與記憶變體)上排名第一。
Mobile Use代理主要透過API執行操作,必要時回退至圖形介面控制。它在MobileWorld上取得82.1分,在真機基準MobileWorld Real上取得92.2分,在AndroidDaily上取得97.2分,據報導在完整端到端任務上的成功率為90%。Creative代理可在約三秒內從單句生成可用圖像——據阿里巴巴稱,速度約為領先競品的兩倍。
該公司還將其基準測試套件(包括MobilePA Bench、MobileWorld、MobileWorld Real與MobileWorld Safety)向研究社群開放——這些正是多項代理成績背後的評測標準——為獨立於阿里巴巴自身報告評估行動代理提供了外部參考。
Introducing Qwen Intelligence, bringing personal intelligence within everyone's reach. It launches with three SOTA agents: – Mobile Planner Agent: plans, decomposes & orchestrates complex tasks. #1 on MobilePA-Bench, MobilePA-Bench Business & Memory. – Mobile-Use Agent:… pic.twitter.com/OgCLpxDJgj
— Qwen (@Alibaba_Qwen) September 23, 2026 (on X)
大會之後:Qwen 4與基礎設施公告
這些發布緊隨阿里巴巴9月22日在杭州舉行的雲棲大會之後,會上公布了四個級別的Qwen 4家族:Max為對標頂級競爭模型的旗艦,Flash適用於低延遲與高吞吐工作負載,Plus為均衡的多模態級別,另有一個27B開放權重版本供本地使用。四者均無公開規格、定價或發布日期,使這一公告更像是方向宣示,而非可出貨的產品。
大會上的其他公告進一步闡明了這一方向。執行長吳詠銘表示,Qwen團隊計劃訓練5兆至10兆參數的模型——阿里巴巴自身的明將此目標歸於Qwen 4.5與Qwen 5——以應對更複雜、更長期的任務。為支援此規模的模型,阿里巴巴的平頭哥(T-Head)部門發布了Zhenwu V900加速器,號稱效能為前代M890的三倍,搭載216 GB記憶體,可擴展至多達50萬顆晶片的叢集,量產計劃於2027年第一季進行。
吳詠銘設定目標,到2032年全球雲端運算容量超過20吉瓦,並描述了一個為代理型工作負載設計的三層雲端架構。他還指出,AI需求正在超越供給,本季AI超級節點將以商業規模上線。阿里巴巴港股當日上漲5.1%。
國產晶片的推進正值美國出口管制收緊之際。分析人士指出,8月開源的Qwen3.8 Flash Next憑藉其稀疏注意力與n-gram嵌入技術,是目前最接近下一代架構的預覽,儘管阿里巴巴並未證實兩者的關聯。
更大的軌跡:從開放模型到整合堆疊
近期發布為一條加速前進的軌跡畫上階段性句點。據阿里巴巴稱,自2023年問世以來,Qwen已成為使用最廣泛的開放權重模型家族,在Hugging Face上累計下載量超過3億次,衍生模型超過10萬個。
現行旗艦Qwen3.8 Max於8月以開放權重形式發布,包含2.4兆參數,支援一百萬token的上下文;9月的Qwen3.8 Omni Flash則將原生處理擴展至文字、圖像、音訊與視訊。授權結構也同步演進:旗艦模型附有條款,要求年收入超過5,000萬美元的公司與阿里巴巴分享該收入,而較小的蒸餾模型則採用寬鬆的Apache 2.0授權。
幾個懸而未決的問題將影響這一策略的走向:獨立驗證的基準測試能否證實廠商報告的代理與語音模型結果、晶片量產時程能否與模型路線圖對齊,以及收入分享授權在實務中的採用情況。隨著Qwen 4規格仍未公布而下一代模型已在訓練中,阿里巴巴已提出一項橫跨晶片、雲端基礎設施、模型與消費級代理的異常廣泛的議程。未來幾季將顯示這些組合如何在實踐中匯聚。