ニュース株式アリババ、Qwenを音声とモバイルエージェントへ拡張 — Qwen 4と独自シリコンが示す更大的野心

アリババ、Qwenを音声とモバイルエージェントへ拡張 — Qwen 4と独自シリコンが示す更大的野心

著者: Metaverse Post·

重要ポイント

  • Qwen Audio 3.1は5つのモデルで構成されます。アップグレードされたASR、TTS、Realtimeシステムに加え、音声創作とより深い理解のための新モデルTTS-NextとASR-Next。
  • 旗艦TTSモデルは独立系のArtificial Analysis Text-to-Speech Leaderboardで首位を獲得し、16言語、中国語の20方言地域、最大3分の連続音声生成をサポートします。
  • アリババは発売時に音声サービスの価格を引き下げ、TTSのコストを約70%、Realtimeを約85%、ASRを最大95%削減しました。
  • Qwen Intelligenceは3つのエージェントとともに登場し、Mobile UseエージェントはMobileWorldで82.1、MobileWorld Realで92.2、AndroidDailyで97.2を記録し、エンドツーエンドタスクの成功率は90%と報告されています。
  • 雲栖大会でアリババは、公開仕様のない4ティアのQwen 4を概説し、5兆〜10兆パラメータのモデルのトレーニング計画を発表し、量産が2027年第1四半期に予定される振武V900アクセラレータを発表しました。
アリババ、Qwenを音声とモバイルエージェントへ拡張 — Qwen 4と独自シリコンが示す更大的野心

アリババのQwenチームは、製品ラインナップに2つの追加を公開しました。再構築された音声スタック「Qwen Audio 3.1」と、モバイルエージェント群「Qwen Intelligence」です。この2つは、同社がモデルの勢いを多モーダルな展開可能な製品へと転換しつつあることを示しています。

Qwen Audio 3.1: 完全な音声スタックを網羅する5つのモデル

Qwen Audio 3.1は、理解・生成・インタラクションをカバーするアップグレードされたコアラインナップと、創作およびより深い理解を目的とした2つの新モデルの2グループで構成される5つのモデルから成ります。

合成側では、旗艦のテキスト読み上げ(TTS)モデルが独立系のArtificial Analysis Text-to-Speech Leaderboardで首位を獲得しています。16言語と中国語の20方言地域をサポートし、1回のパスで最大3分の連続音声を生成でき、感情、速度、音色、アクセントを制御する自由形式の自然言語指示を受け付けます。さらに、休止、呼吸、笑い、ため息といったフレーズレベルの効果のための86個のきめ細かなインラインタグも提供します。

技術レポートによると、12.5 Hzの低フレームレート音声トークナイザがデコードコストを削減し、5段階のトレーニングパイプラインが、内容の一貫性、声の類似性、堅牢性のために言語モデルとフローモデルを協調させます。このシステムは、ノイズが多い、残響のある、または劣化した参照音声からでも実用可能な音声を生成できます。姉妹モデルのTTS-Nextは、言語モデルと拡散フレームワークを組み合わせ、音声、効果音、背景音を1回のパスで生成し、オーディオブック、ポッドキャスト、ゲーム、広告を対象としています。

理解側では、アップグレードされた音声認識(ASR)モデルが、多言語・方言認識を強化し、フィラーや繰り返しを自動的に除去するネイティブの文字起こし polishing を追加しました。ASR-Nextはこれを話者ラベル、タイムスタンプ、整列された文字起こしを伴う多話者認識に拡張します。感情、環境音、機械音も解釈でき、サウンドキャプショニング、イベントの局在化、音声質問応答を可能にします。

Realtimeモデルは、いつでも中断可能な同時発話・聴取をサポートし、発話者の低い感情状態を検出すると速度とトーンを調整します。アリババはこの発売に合わせて大幅な値下げを行いました。TTSのコストは約70%、Realtimeは約85%、ASRは最大95%低下しています。この値下げは、合成、リアルタイムインタラクション、認識というコアラインナップ全体をカバーし、創作・理解に特化した新モデルと同時に提供されます。

Meet Qwen-Audio-3.1! ASR, TTS & Realtime are fully upgraded, joined by two new models: TTS-Next for audio creation and ASR-Next for audio understanding. Five models, one complete audio stack: understanding, generation, interaction & creation. Plus big price cuts across the… pic.twitter.com/Qcbvcw0q9C
— Qwen (@Alibaba_Qwen) September 23, 2026 (on X)

Qwen Intelligence: モバイルタスク実行のためのエージェント

Qwen Intelligenceはまったく異なるレイヤー、すなわちモバイルデバイス上での自律的なタスク実行を対象としています。Plannerエージェントは複雑なタスクを分解・オーケストレーションし、同社のMobilePA Bench(ビジネス版・メモリ版を含む)で首位を獲得しています。

Mobile Useエージェントは主にAPIを通じてアクションを実行し、必要に応じてグラフィカルインターフェースの操作にフォールバックします。MobileWorldで82.1、実機ベンチマークのMobileWorld Realで92.2、AndroidDailyで97.2を記録し、完全なエンドツーエンドタスクの成功率は90%と報告されています。Creativeエージェントは1文から約3秒で実用可能な画像を生成します。これはアリババによると主要な競合の約2倍の速さです。

同社はまた、MobilePA Bench、MobileWorld、MobileWorld Real、MobileWorld Safetyを含むベンチマークスイートを研究コミュニティに公開しました。これらは報告されたエージェントスコアの基準であり、アリババ自身の報告に依存せずモバイルエージェントを評価するための外部リファレンスを提供します。

Introducing Qwen Intelligence, bringing personal intelligence within everyone's reach. It launches with three SOTA agents: – Mobile Planner Agent: plans, decomposes & orchestrates complex tasks. #1 on MobilePA-Bench, MobilePA-Bench Business & Memory. – Mobile-Use Agent:… pic.twitter.com/OgCLpxDJgj
— Qwen (@Alibaba_Qwen) September 23, 2026 (on X)

カンファレンスのその後: Qwen 4とインフラの発表

これらのリリースは、9月22日に杭州でされたアリババの雲栖大会(Apsara Conference)に続くものです。同大会でQwen 4ファミリーが4つのティアで発表されました。最上位の競合モデルに対抗する旗艦「Max」、低レイテンシ・高スループット向けの「Flash」、バランスの取れたマルチモーダルティアの「Plus」、ローカル用途向けの27Bオープンウェイト版です。4ティアのいずれも公開仕様、価格、発売日は明らかにされておらず、この発表は出荷製品というよりも方向性の表明となっています。

カンファレンスでの他の発表がその方向性を明確にしています。最高経営責任者の呉泳銘(Eddie Wu)氏は、Qwenチームが5兆〜10兆パラメータのモデルのトレーニングを計画していると述べました。これはアリババ自身の声明によればQwen 4.5とQwen 5に割り当てられた目標で、より複雑で長期的なタスクに取り組むためです。その規模のモデルを支えるため、アリババのT-Head部門は振武V900アクセラレータを発表しました。前身のM890の3倍の性能を謳い、216 GBのメモリを搭載し、最大50万チップのクラスタにスケール可能で、量産は2027年第1四半期に予定されています。

呉氏は2032年までに世界のクラウド容量20ギガワット超えの目標を設定し、エージェント的ワークロード向けに設計された3層クラウドアーキテクチャについて説明しました。また、AI需要が供給を上回っており、今四半期にAIスーパーノードが商用スケールで稼働すると述べました。アリババの香港株はこの日5.1%上昇しました。

国内チップの推進は、厳しくなる米国の輸出規制を背景に展開しています。アナリストは、8月にオープンソース化されたQwen3.8 Flash Nextを、そのスパースアテンションとn-gramエンベディング技術により、次世代アーキテクチャの最も近い予見であると指摘していますが、アリババはこの関連を確認していません。

より大きな軌跡: オープンモデルから統合スタックへ

最近のリリースは、加速する軌跡の頂点です。2023年のデビュー以来、Qwenは最も広く利用されているオープンウェイトモデルファミリーとなり、アリババによると累計3億回以上のダウンロードと、Hugging Face上で10万を超える派生モデルを擁しています。

現在の旗艦であるQwen3.8 Maxは、8月にオープンウェイトでリリースされ、2.4兆パラメータを含み、100万トークンのコンテキストを処理します。9月のQwen3.8 Omni Flashは、テキスト、画像、音声、ビデオにわたるネイティブ処理を拡張しました。ライセンス構造も並行して進化しています。旗艦モデルには、年間収益が5,000万ドルを超える企業にアリババと収益を共有することを義務付ける条項があり、一方、小規模な蒸留は寛容なApache 2.0ライセンスで提供されています。

この戦略の展開を左右するいくつかの未解決の問いがあります。独立して検証されたベンチマークがエージェントや音声モデルのベンダー報告結果を裏付けるか、チップ生産のタイムラインがモデルロードマップと整合するか、そして収益共有ライセンスが実際にどのように採用されるかです。Qwen 4の仕様が未公開でありながら次世代がすでにトレーニングされている中で、アリババはシリコン、クラウドインフラ、モデル、コンシューマーエージェントにまたがる異例に広範なアジェンダを提示しました。今後数四半期で、これらの要素が実際にどのように収束するかが明らかになります。

ソース: Metaverse Post