NachrichtenAktienAlibabas Qwen bringt Audio 3.1 und Mobile Agents heraus, während Qwen 4 und eigener Chip ehrgeizigere Ziele signalisieren

Alibabas Qwen bringt Audio 3.1 und Mobile Agents heraus, während Qwen 4 und eigener Chip ehrgeizigere Ziele signalisieren

Autor: Metaverse Post·

Wichtige Erkenntnisse

  • Qwen Audio 3.1 besteht aus fünf Modellen: den aktualisierten ASR-, TTS- und Realtime-Systemen sowie den neuen Modellen TTS-Next und ASR-Next für Audiokreation und tieferes Verständnis.
  • Das TTS-Spitzenmodell belegt den ersten Platz auf der unabhängigen Artificial Analysis Text-to-Speech Leaderboard und unterstützt 16 Sprachen, 20 chinesische Dialektregionen sowie bis zu drei Minuten zusammenhängende Spracherzeugung.
  • Alibaba senkte zum Launch die Preise für Sprachdienste: Die TTS-Kosten sanken um rund 70 Prozent, Realtime um etwa 85 Prozent und ASR um bis zu 95 Prozent.
  • Qwen Intelligence startet mit drei Agenten; der Mobile-Use-Agent erreichte 82,1 auf MobileWorld, 92,2 auf MobileWorld Real und 97,2 auf AndroidDaily, mit einer berichteten Erfolgsquote von 90 Prozent bei End-to-End-Aufgaben.
  • Auf der Apsara-Konferenz stellte Alibaba Qwen 4 in vier Tiers ohne öffentliche Spezifikationen vor, kündigte Pläne zum Training von Modellen mit fünf bis zehn Billionen Parametern an und präsentierte den Zhenwu-V900-Beschleuniger mit Massenproduktion ab dem ersten Quartal 2027.
Alibabas Qwen bringt Audio 3.1 und Mobile Agents heraus, während Qwen 4 und eigener Chip ehrgeizigere Ziele signalisieren

Alibabas Qwen-Team hat zwei Ergänzungen seiner Produktreihe vorgestellt: Qwen Audio 3.1, einen neu aufgebauten Sprachstapel, und Qwen Intelligence, eine Suite mobiler Agenten. Zusammen zeigen sie, wie das Unternehmen seine Modell-Dynamik in einsatzfähige Produkte über verschiedene Modalitäten umsetzt.

Qwen Audio 3.1: Fünf Modelle über einen kompletten Sprachstapel

Qwen Audio 3.1 besteht aus fünf Modellen in zwei Gruppen: einer aktualisierten Kernreihe für Verständnis, Generierung und Interaktion sowie zwei neuen Modellen für Kreation und tieferes Verständnis

Auf der Synthese-Seite belegt das TTS-Spitzenmodell (Text-to-Speech) den ersten Platz auf der unabhängigen Artificial Analysis Text-to-Speech Leaderboard. Es unterstützt 16 Sprachen und 20 chinesische Dialektregionen, erzeugt in einem Durchgang bis zu drei Minuten zusammenhängende Sprache und akzeptiert freiformulierte Anweisungen in natürlicher Sprache, die Emotion, Tempo, Klangfarbe und Akzent steuern. Zudem bietet es 86 feingranulare Inline-Tags für Effekte auf Satzebene wie Pausen, Atmen, Lachen und Seufzen.

Laut dem technischen Bericht reduziert ein Sprach-Tokenizer mit niedriger Framerate von 12,5 Hz die Decodierungskosten, während eine fünfstufige Trainingspipeline Sprach- und Flow-Modelle für inhaltliche Konsistenz, Stimmenähnlichkeit und Robustheit koordiniert. Das System kann auch aus verrauschter, hallender oder beeinträchtigter Referenzaudio nutzbare Sprache erzeugen. Ein Begleitmodell, TTS-Next, kombiniert ein Sprachmodell mit einem Diffusion-Framework, um Stimme, Soundeffekte und Hintergrundaudio in einem Durchgang zu generieren, und zielt auf Hörbücher, Podcasts, Spiele und Werbung ab.

Auf der Verständnis-Seite bringt das verbesserte ASR-Modell (Automatic Speech Recognition) eine stärkere mehrsprachige und dialektale Erkennung sowie eine native Transkriptoptimierung mit, die Füllwörter und Wiederholungen automatisch entfernt. ASR-Next erweitert dies auf Mehrsprecher-Erkennung mit Sprecher-Labels, Zeitstempeln und ausgerichteten Transkripten. Es kann zudem Emotionen, Umgebungsgeräusche und Maschinengeräusche interpretieren und ermöglicht dadurch Sound-Captioning, Ereignislokalisierung und Audio-Fragenbeantwortung.

Das Realtime-Modell unterstützt gleichzeitiges Sprechen und Zuhören mit Unterbrechung zu jedem Zeitpunkt und passt Tempo und Tonfall an, wenn es eine gedrückte Stimmung des Anrufers erkennt. Alibaba begleitete den Launch mit erheblichen Preissenkungen: Die TTS-Kosten sanken um rund 70 Prozent, Realtime um etwa 85 Prozent und ASR um bis zu 95 Prozent. Die Reduzierungen umfassen die gesamte Kernreihe — Synthese, Realtime-Interaktion und Erkennung — und kamen zum Launch gemeinsam mit den neuen auf Kreation und Verständnis ausgerichteten Modellen.

Meet Qwen-Audio-3.1! ASR, TTS & Realtime are fully upgraded, joined by two new models: TTS-Next for audio creation and ASR-Next for audio understanding. Five models, one complete audio stack: understanding, generation, interaction & creation. Plus big price cuts across the… pic.twitter.com/Qcbvcw0q9C
— Qwen (@Alibaba_Qwen) September 23, 2026 (on X)

Qwen Intelligence: Agenten für mobile Aufgabenbearbeitung

Qwen Intelligence zielt auf eine ganz andere Ebene ab: die autonome Aufgabenbearbeitung auf Mobilgeräten. Sein Planner-Agent zerlegt und orchestriert komplexe Aufgaben und belegt den ersten Platz auf dem unternehmenseigenen MobilePA Bench, einschließlich der Business- und Memory-Varianten.

Der Mobile-Use-Agent führt Aktionen hauptsächlich über APIs aus und greift bei Bedarf auf die Steuerung der grafischen Benutzeroberfläche zurück. Er erreichte 82,1 auf MobileWorld, 92,2 auf dem Realgeräte-Benchmark MobileWorld Real und 97,2 auf AndroidDaily, mit einer berichteten Erfolgsquote von 90 Prozent bei vollständigen End-to-End-Aufgaben. Der Creative-Agent erzeugt aus einem einzigen Satz in etwa drei Sekunden ein nutzbares Bild — laut Alibaba rund doppelt so schnell wie führende Alternativen.

Das Unternehmen öffnete zudem seine Benchmark-Suite, einschließlich MobilePA Bench, MobileWorld, MobileWorld Real und MobileWorld Safety, für die Forschungsgemeinschaft — die Messgrößen hinter mehreren der berichteten Agenten-Ergebnisse — und bietet damit externe Referenzpunkte zur unabhängigen Bewertung mobiler Agenten außerhalb von Alibabas eigenen Angaben.

Introducing Qwen Intelligence, bringing personal intelligence within everyone's reach. It launches with three SOTA agents: – Mobile Planner Agent: plans, decomposes & orchestrates complex tasks. #1 on MobilePA-Bench, MobilePA-Bench Business & Memory. – Mobile-Use Agent:… pic.twitter.com/OgCLpxDJgj
— Qwen (@Alibaba_Qwen) September 23, 2026 (on X)

Nach der Konferenzbühne: Qwen 4 und die Infrastruktur-Ankündigungen

Die Veröffentlichungen folgen auf Alibabas Apsara-Konferenz in Hangzhou am 22. September, auf der die Qwen-4-Familie in vier Tiers angekündigt wurde: Max als Flaggschiff im Vergleich zu den stärksten Konkurrenzmodellen, Flash für Workloads mit geringer Latenz und hohem Volumen, Plus als ausgewogenes multimodales Tier sowie eine 27B-Open-Weights-Variante für den lokalen Einsatz. Keines der vier verfügt über öffentliche Spezifikationen, Preise oder ein Startdatum, womit die Ankündigung eher eine Richtungsangabe als ein ausgeliefertes Produkt ist.

Weitere Ankündigungen der Konferenz präzisierten diese Richtung. Chief Executive Eddie Wu erklärte, das Qwen-Team plane, Modelle mit fünf bis zehn Billionen Parametern zu trainieren — ein Ziel, das Alibabas eigene Aussagen Qwen 4.5 und Qwen 5 zuweisen —, um komplexere Aufgaben mit längerem Horizont zu bewältigen. Zur Unterstützung von Modellen dieser Größenordnung stellte Alibabas T-Head-Sparte den Zhenwu-V900-Beschleuniger vor, der dreimal die Leistung seines Vorgängers M890 verspricht, 216 GB Speicher mitbringt, auf Cluster mit bis zu 500.000 Chips skaliert und dessen Massenproduktion für das erste Quartal 2027 geplant ist.

Wu setzte sich das Ziel, bis 2032 mehr als 20 Gigawatt globale Cloud-Kapazität zu überschreiten, und beschrieb eine dreischichtige Cloud-Architektur, die für agentische Workloads ausgelegt ist. Er wies zudem darauf hin, dass die KI-Nachfrage das Angebot übersteige, wobei KI-Supernodes in diesem Quartal in kommerziellem Maßstab online gingen. Alibabas Hongkonger Aktien stiegen am Tag um 5,1 Prozent.

Der heimische Chip-Vorstoß findet vor verschärften US-Exportbeschränkungen statt. Analysten verweisen auf das im August quelloffen gemachte Qwen3.8 Flash Next mit seinen Sparse-Attention- und N-Gram-Embedding-Techniken als die nächstliegende verfügbare Vorschau auf die Architektur der nächsten Generation, wenngleich Alibaba diesen Zusammenhang nicht bestätigt hat.

Ein größerer Kurs: Von offenen Modellen zu einem integrierten Stapel

Die aktuellen Veröffentlichungen krönen eine sich beschleunigende Entwicklung. Seit seinem Debüt 2023 ist Qwen die am weitesten verbreitete Open-Weights-Modellfamilie mit mehr als 300 Millionen kumulierten Downloads und über 100.000 abgeleiteten Modellen auf Hugging Face, so Alibaba.

Das aktuelle Flaggschiff Qwen3.8 Max, im August mit offenen Gewichten veröffentlicht, enthält 2,4 Billionen Parameter und verarbeitet eine Million Tokens Kontext, während das September-Modell Qwen3.8 Omni Flash die native Verarbeitung über Text, Bild, Audio und Video ausdehnt. Die Lizenzstruktur hat sich parallel weiterentwickelt: Das Flaggschiff enthält eine Klausel, die Unternehmen mit mehr als 50 Millionen US-Dollar Jahresumsatz zur Umsatzbeteiligung mit Alibaba verpflichtet, während kleinere destillierte Modelle unter freizügigen Apache-2.0-Lizenzen erscheinen.

Mehrere offene Fragen werden bestimmen, wie diese Strategie verläuft: ob unabhängig verifizierte Benchmarks die vom Hersteller berichteten Ergebnisse für Agenten und Sprachmodelle bestätigen, ob die Chip-Produktionszeiträume mit der Modell-Roadmap übereinstimmen und wie die Umsatzbeteiligungslizenz in der Praxis angenommen wird. Mit weiterhin nicht offengelegten Qwen-4-Spezifikationen und der bereits im Training befindlichen nächsten Generation hat Alibaba eine ungewöhnlich breite Agenda über Chips, Cloud-Infrastruktur, Modelle und Consumer-Agenten gespannt. Die kommenden Quartale werden zeigen, wie diese Bausteine in der Praxis zusammenkommen.

Quelle: Metaverse Post