La Qwen di Alibaba si espande in voce e agenti mobile mentre Qwen 4 e il silicon proprietario segnalano ambizioni più ampie
Punti chiave
- •Qwen Audio 3.1 è composto da cinque modelli: i sistemi ASR, TTS e Realtime aggiornati più i nuovi modelli TTS-Next e ASR-Next per la creazione audio e una comprensione più profonda.
- •Il modello TTS di punta si colloca al primo posto nella classifica indipendente Artificial Analysis Text-to-Speech Leaderboard e supporta 16 lingue, 20 regioni dialettali cinesi e fino a tre minuti di generazione vocale continua.
- •Alibaba ha ridotto i prezzi dei servizi vocali al lancio, tagliando i costi TTS di circa il 70 percento, Realtime di circa l'85 percento e ASR fino al 95 percento.
- •Qwen Intelligence si lancia con tre agenti, e l'agente Mobile Use ha ottenuto 82,1 su MobileWorld, 92,2 su MobileWorld Real e 97,2 su AndroidDaily, con un tasso di successo dichiarato del 90 percento sulle attività end-to-end.
- •All'Apsara Conference, Alibaba ha delineato Qwen 4 in quattro varianti senza specifiche pubbliche, annunciato piani per addestrare modelli da cinque a dieci trilioni di parametri e presentato l'acceleratore Zhenwu V900 con produzione di massa prevista per il primo trimestre del 2027.

Il team Qwen di Alibaba ha lanciato due novità nella sua linea di prodotti: Qwen Audio 3.1, uno stack vocale completamente ricostruito, e Qwen Intelligence, una suite di agenti mobile. Insieme, mostrano come l'azienda stia convertendo lo slancio dei suoi modelli in prodotti distribuibili su più modalità.
Qwen Audio 3.1: Cinque Modelli per uno Stack Vocale Completo
Qwen Audio 3.1 è composto da cinque modelli organizzati in due gruppi: una lineup principale aggiornata che copre comprensione, generazione e interazione, più due nuovi modelli orientati alla creazione e a una comprensione più profonda
Sul fronte della sintesi, il modello text-to-speech (TTS) di punta si colloca al primo posto nella classifica indipendente Artificial Analysis Text-to-Speech Leaderboard. Supporta 16 lingue e 20 regioni dialettali cinesi, genera fino a tre minuti di voce continua in un'unica passata e accetta istruzioni in linguaggio naturale a forma libera che controllano emozione, ritmo, timbro e accento. Offre inoltre 86 tag inline a grana fine per effetti a livello di frase come pause, respiro, risate e sospiri.
Secondo il report tecnico, un tokenizer vocale a basso frame rate di 12,5 Hz riduce i costi di decodifica, una pipeline di addestramento in cinque fasi coordina i modelli linguistici e di flusso per coerenza dei contenuti, somiglianza vocale e robustezza. Il sistema può produrre voce utilizzabile anche a partire da audio di riferimento rumoroso, riverberante o degradato. Un modello companion, TTS-Next, abbina un modello linguistico a un framework di diffusione per generare voce, effetti sonori e audio di sottofondo in un'unica passata, rivolgendosi ad audiolibri, podcast, giochi e pubblicità.
Sul fronte della comprensione, il modello ASR (automatic speech recognition) aggiornato aggiunge un riconoscimento multilingue e dialettale più forte, insieme alla rifinitura nativa delle trascrizioni che rimuove automaticamente riempitivi e ripetizioni. ASR-Next estende questo al riconoscimento multi-parlante con etichette dei parlanti, timestamp e trascrizioni allineate. Può inoltre interpretare emozioni, rumore ambientale e suoni di macchine, abilitando didascalia dei suoni, localizzazione di eventi e domande e risposte audio.
Il modello Realtime supporta parlato e ascolto simultanei con interruzione in qualsiasi momento, e regola ritmo e tono quando rileva un umore basso nell'interlocutore. Alibaba ha accompagnato il lancio con sostanziali riduzioni di prezzo: i costi TTS sono scesi di circa il 70 percento, Realtime di circa l'85 percento e ASR fino al 95 percento. Le riduzioni coprono l'intera lineup principale — sintesi, interazione realtime e riconoscimento — arrivando al lancio insieme ai nuovi modelli orientati alla creazione e alla comprensione.
Meet Qwen-Audio-3.1! ASR, TTS & Realtime are fully upgraded, joined by two new models: TTS-Next for audio creation and ASR-Next for audio understanding. Five models, one complete audio stack: understanding, generation, interaction & creation. Plus big price cuts across the… pic.twitter.com/Qcbvcw0q9C
— Qwen (@Alibaba_Qwen) September 23, 2026 (su X)
Qwen Intelligence: Agenti per l'Esecuzione di Attività su Dispositivi Mobili
Qwen Intelligence punta a un livello completamente diverso: l'esecuzione autonoma di attività su dispositivi mobili. Il suo agente Planner scompone e orchestra attività complesse, classificandosi al primo posto nel MobilePA Bench dell'azienda, incluse le varianti business e memory.
L'agente Mobile Use esegue le azioni principalmente tramite API, ricorrendo al controllo dell'interfaccia grafica quando necessario. Ha ottenuto 82,1 su MobileWorld, 92,2 sul benchmark su dispositivo reale MobileWorld Real e 97,2 su AndroidDaily, con un tasso di successo dichiarato del 90 percento sulle attività end-to-end complete. L'agente Creative genera un'immagine utilizzabile da una singola frase in circa tre secondi — circa il doppio della velocità delle alternative principali, secondo Alibaba.
L'azienda ha inoltre aperto la propria suite di benchmark, tra cui MobilePA Bench, MobileWorld, MobileWorld Real e MobileWorld Safety, alla comunità di ricerca — i parametri di riferimento alla base di diversi punteggi dichiarati degli agenti — fornendo punti di riferimento esterni per valutare gli agenti mobile in modo indipendente rispetto alle dichiarazioni di Alibaba.
Introducing Qwen Intelligence, bringing personal intelligence within everyone's reach. It launches with three SOTA agents: – Mobile Planner Agent: plans, decomposes & orchestrates complex tasks. #1 on MobilePA-Bench, MobilePA-Bench Business & Memory. – Mobile-Use Agent:… pic.twitter.com/OgCLpxDJgj
— Qwen (@Alibaba_Qwen) September 23, 2026 (su X)
Dopo la Conferenza: Qwen 4 e gli Annunci sull'Infrastruttura
I rilasci seguono l'Apsara Conference di Alibaba a Hangzhou del 22 settembre, dove la famiglia Qwen 4 è stata annunciata in quattro varianti: Max come modello di punta posizionato contro i principali modelli rivali, Flash per carichi di lavoro a bassa latenza e alto volume, Plus come variante multimodale bilanciata, e una variante open-weights da 27B per uso locale. Nessuna delle quattro ha specifiche pubbliche, prezzi o una data di lancio, rendendo l'annuncio una dichiarazione di direzione più che un prodotto già disponibile.
Gli altri annunci della conferenza hanno chiarito tale direzione. L'amministratore delegato Eddie Wu ha dichiarato che il team Qwen prevede di addestrare modelli da cinque a dieci trilioni di parametri — un obiettivo che le stesse dichiarazioni di Alibaba attribuiscono a Qwen 4.5 e Qwen 5 — per affrontare attività più complesse e di più lunga durata. Per supportare modelli di tale scala, l'unità T-Head di Alibaba ha presentato l'acceleratore Zhenwu V900, che promette tre volte le prestazioni del predecessore M890, dispone di 216 GB di memoria e scala fino a cluster di 500.000 chip, con la produzione di massa prevista per il primo trimestre del 2027.
Wu ha fissato l'obiettivo di superare 20 gigawatt di capacità cloud globale entro il 2032 e ha descritto un'architettura cloud a tre livelli progettata per carichi di lavoro agentici. Ha inoltre rilevato che la domanda di AI supera l'offerta, con supernodi AI che entrano in servizio su scala commerciale in questo trimestre. Le azioni di Alibaba a Hong Kong sono salite del 5,1 percento nella giornata.
La spinta sui chip nazionali si sviluppa in un contesto di restrizioni alle esportazioni statunitensi in tightening. Gli analisti indicano nell'open-source Qwen3.8 Flash Next di agosto, con le sue tecniche di attenzione sparsa e embedding n-gram, l'anteprima più vicina disponibile dell'architettura di prossima generazione, sebbene Alibaba non abbia confermato il collegamento.
Una Traiettoria Più Ampia: Dai Modelli Aperti a uno Stack Integrato
I rilasci recenti coronano una traiettoria in accelerazione. Dal debutto nel 2023, Qwen è diventata la famiglia di modelli open-weights più utilizzata, con oltre 300 milioni di download cumulativi e più di 100.000 modelli derivati su Hugging Face, secondo Alibaba.
Il modello di punta attuale, Qwen3.8 Max, rilasciato ad agosto con pesi aperti, contiene 2,4 trilioni di parametri e gestisce un milione di token di contesto, mentre Qwen3.8 Omni Flash di settembre estende l'elaborazione nativa su testo, immagini, audio e video. La struttura di licenze si è evoluta in parallelo: il modello di punta include una clausola che richiede alle aziende con ricavi annuali superiori a 50 milioni di dollari di condividere tali ricavi con Alibaba, mentre i modelli distillati più piccoli sono distribuiti con licenzemissive Apache 2.0.
Diverse questioni aperte determineranno come si svolgerà questa strategia: se benchmark verificati in modo indipendente confermeranno i risultati dichiarati dal fornitore per gli agenti e i modelli vocali, se le tempistiche di produzione dei chip saranno allineate alla roadmap dei modelli, e come la licenza di revenue sharing verrà adottata nella pratica. Con le specifiche di Qwen 4 ancora non divulgate e la prossima generazione già in addestramento, Alibaba ha delineato un'agenda insolitamente ampia che copre silicon, infrastruttura cloud, modelli e agenti consumer. I prossimi trimestri mostreranno come questi elementi convergeranno nella pratica.
Fonte: Metaverse Post