Alibaba étend Qwen aux agents vocaux et mobiles tandis que Qwen 4 et ses puces personnalisées signalent des ambitions plus larges
Points clés
- •Qwen Audio 3.1 se compose de cinq modèles : des systèmes ASR, TTS et Realtime mis à niveau, plus les nouveaux modèles TTS-Next et ASR-Next pour la création audio et une compréhension plus approfondie.
- •Le modèle TTS phare arrive en tête du classement indépendant Artificial Analysis Text-to-Speech Leaderboard et prend en charge 16 langues, 20 régions de dialectes chinois et jusqu'à trois minutes de génération de parole continue.
- •Alibaba a réduit les prix de ses services vocaux au lancement, abaissant les coûts du TTS d'environ 70 %, le Realtime d'environ 85 % et l'ASR jusqu'à 95 %.
- •Qwen Intelligence est lancé avec trois agents, et l'agent Mobile Use a obtenu 82,1 sur MobileWorld, 92,2 sur MobileWorld Real et 97,2 sur AndroidDaily, avec un taux de réussite de 90 % signalé sur les tâches de bout en bout.
- •Lors de la Conférence Apsara, Alibaba a présenté Qwen 4 en quatre déclinaisons sans spécifications publiques, annoncé des projets d'entraînement de modèles de cinq mille milliards de paramètres et dévoilé l'accélérateur Zhenwu V900, dont la production de masse est prévue pour le premier trimestre 2027.

L'équipe Qwen d'Alibaba a déployé deux ajouts à sa gamme de produits : Qwen Audio 3.1, une pile vocale reconstruite, et Qwen Intelligence, une suite d'agents mobiles. Ensemble, ils montrent comment l'entreprise transforme sa dynamique de modèles en produits déployables sur plusieurs modalités.
Qwen Audio 3.1 : Cinq modèles pour une pile vocale complète
Qwen Audio 3.1 se compose de cinq modèles organisés en deux groupes : une gamme principale mise à niveau couvrant la compréhension, la génération et l'interaction, plus deux nouveaux modèles dédiés à la création et à une compréhension plus approfondie.
Côté synthèse, le modèle phare de synthèse vocale (TTS) arrive en tête du classement indépendant Artificial Analysis Text-to-Speech Leaderboard. Il prend en charge 16 langues et 20 régions de dialectes chinois, génère jusqu'à trois minutes de parole continue en une seule passe et accepte des instructions en langage naturel de forme libre contrôlant l'émotion, le rythme, le timbre et l'accent. Il propose également 86 balises en ligne à granularité fine pour des effets au niveau de la phrase, tels que les pauses, la respiration, les rires et les soupirs.
Selon le rapport technique, un tokenizer vocal à faible cadence d'images de 12,5 Hz réduit le coût de décodage, tandis qu'un pipeline d'entraînement en cinq étapes coordonne les modèles de langage et de flux pour la cohérence du contenu, la similarité vocale et la robustesse. Le système peut produire une parole exploitable même à partir d'un audio de référence bruité, réverbérant ou dégradé. Un modèle compagnon, TTS-Next, associe un modèle de langage à un cadre de diffusion pour générer voix, effets sonores et audio d'ambiance en une seule passe, ciblant les livres audio, les podcasts, les jeux et la publicité.
Côté compréhension, le modèle de reconnaissance automatique de la parole (ASR) mis à niveau ajoute une reconnaissance multilingue et dialectale renforcée, ainsi qu'un polissage natif des transcriptions supprimant automatiquement les tics de langage et les répétitions. ASR-Next étend cela à la reconnaissance multi-locuteurs avec étiquettes de locuteurs, horodatages et transcriptions alignées. Il peut égalementpréter les émotions, le bruit ambiant et les sons de machines, permettant le sous-titrage sonore, la localisation d'événements et la réponse à des questions audio.
Le modèle Realtime prend en charge la parole et l'écoute simultanées avec interruption à tout moment, et ajuste son rythme et son ton lorsqu'il détecte une humeur basse chez l'appelant. Alibaba a accompagné le lancement de réductions de prix substantielles : les coûts du TTS ont chuté d'environ 70 %, le Realtime d'environ 85 % et l'ASR jusqu'à 95 %. Ces réductions couvrent l'ensemble de la gamme principale — synthèse, interaction en temps réel et reconnaissance — et arrivent au lancement en même temps que les nouveaux modèles axés sur la création et la compréhension.
Meet Qwen-Audio-3.1! ASR, TTS & Realtime are fully upgraded, joined by two new models: TTS-Next for audio creation and ASR-Next for audio understanding. Five models, one complete audio stack: understanding, generation, interaction & creation. Plus big price cuts across the… pic.twitter.com/Qcbvcw0q9C
— Qwen (@Alibaba_Qwen) September 23, 2026 (on X)
Qwen Intelligence : des agents pour l'exécution de tâches mobiles
Qwen Intelligence cible une couche entièrement différente : l'exécution autonome de tâches sur les appareils mobiles. Son agent Planner décompose et orchestre des tâches complexes, se classant premier sur le MobilePA Bench de l'entreprise, y compris ses variantes business et memory.
L'agent Mobile Use exécute les actions principalement via des API, avec repli sur le contrôle de l'interface graphique si nécessaire. Il a obtenu 82,1 sur MobileWorld, 92,2 sur le benchmark MobileWorld Real sur appareil réel et 97,2 sur AndroidDaily, avec un taux de réussite de 90 % signalé sur les tâches complètes de bout en bout. L'agent Creative génère une image exploitable à partir d'une seule phrase en environ trois secondes — soit environ deux fois plus vite que les principales alternatives, selon Alibaba.
L'entreprise a également ouvert sa suite de benchmarks, incluant MobilePA Bench, MobileWorld, MobileWorld Real et MobileWorld Safety, à la communauté de recherche — les instruments derrière plusieurs des scores d'agents signalés — fournissant des points de référence externes pour évaluer les agents mobiles indépendamment des propres rapports d'Alibaba.
Introducing Qwen Intelligence, bringing personal intelligence within everyone's reach. It launches with three SOTA agents: – Mobile Planner Agent: plans, decomposes & orchestrates complex tasks. #1 on MobilePA-Bench, MobilePA-Bench Business & Memory. – Mobile-Use Agent:… pic.twitter.com/OgCLpxDJgj
— Qwen (@Alibaba_Qwen) September 23, 2026 (on X)
Dans la foulée de la conférence : Qwen 4 et les annonces d'infrastructure
Ces annonces font suite à la Conférence Apsara d'Alibaba à Hangzhou le 22 septembre, où la famille Qwen 4 a été annoncée en quatre déclinaisons : Max comme modèle phare positionné face aux principaux modèles concurrents, Flash pour les charges de travail à faible latence et à fort volume, Plus comme déclinaison multimodale équilibrée, et une variante à poids ouverts de 27B pour un usage local. Aucune des quatre ne dispose de spécifications publiques, de tarification ou de date de lancement, ce qui fait de l'annonce une déclaration d'orientation plutôt qu'un produit commercialisable.
Les autres annonces de la conférence ont précisé cette orientation. Le directeur général Eddie Wu a déclaré que l'équipe Qwen prévoit d'entraîner des modèles de cinq à mille milliards de paramètres — un objectif que les propres déclarations d'Alibaba attribuent à Qwen 4.5 et Qwen 5 — pour traiter des tâches plus complexes et à plus long terme. Pour prendre en charge des modèles de cette échelle, l'unité T-Head d'Alibaba a dévoilé l'accélérateur Zhenwu V900, qui promet trois fois les performances de sonédécesseur M890, embarque 216 Go de mémoire et s'étend à des clusters de jusqu'à 500 000 puces, avec une production de masse prévue pour le premier trimestre 2027.
Wu a fixé un objectif de dépassement de 20 gigawatts de capacité cloud mondiale d'ici 2032 et a décrit une architecture cloud à trois couches conçue pour les charges de travail agentiques. Il a également noté que la demande d'IA dépasse l'offre, avec des supernœuds d'IA mis en service à l'échelle commerciale ce trimestre. L'action d'Alibaba à Hong Kong a progressé de 5,1 % dans la journée.
La poussée nationale sur les puces se déroule alors que les restrictions d'exportation américaines se durcissent. Les analystes citent le Qwen3.8 Flash Next open source d'août, avec ses techniques d'attention clairsemée et d'embedding n-gram, comme l'aperçu disponible le plus proche de l'architecture de nouvelle génération, bien qu'Alibaba n'ait pas confirmé ce lien.
Une trajectoire plus large : des modèles ouverts à une pile intégrée
Ces dernières annonces culminent une trajectoire en accélération. Depuis ses débuts en 2023, Qwen est devenu la famille de modèles à poids ouverts la plus utilisée, avec plus de 300 millions de téléchargements cumulés et plus de 100 000 modèles dérivés sur Hugging Face, selon Alibaba.
Le modèle phare actuel, Qwen3.8 Max, publié en août avec des poids ouverts, contient 2 400 milliards de paramètres et gère un million de tokens de contexte, tandis que le Qwen3.8 Omni Flash de septembre étend le traitement natif au texte, à l'image, à l'audio et à la vidéo. La structure de licence a évolué en parallèle : le modèle phare comporte une clause exigeant que les entreprises réalisant plus de 50 millions de dollars de chiffre d'affaires annuel partagent ces revenus avec Alibaba, tandis que les petits modèles distillés sont proposés sous des licences permissives Apache 2.0.
Plusieurs questions ouvertes façonneront le déploiement de cette stratégie : si des benchmarks vérifiés indépendamment confirment les résultats signalés par le fournisseur pour les agents et les modèles vocaux, si les calendriers de production de puces s'alignent avec la feuille de route des modèles, et comment la licence de partage de revenus est adoptée en pratique. Avec des spécifications de Qwen 4 toujours non divulguées et la génération suivante déjà en entraînement, Alibaba a tracé un agenda exceptionnellement large couvrant les puces, l'infrastructure cloud, les modèles et les agents grand public. Les prochains trimestres montreront comment ces éléments convergent en pratique.
Source : Metaverse Post