NieuwsAandelenAlibaba's Qwen lanceert Audio 3.1 en mobiele agents nu Qwen 4 en eigen chipontwikkeling bredere ambities verraden

Alibaba's Qwen lanceert Audio 3.1 en mobiele agents nu Qwen 4 en eigen chipontwikkeling bredere ambities verraden

Auteur: Metaverse Post·

Belangrijkste punten

  • Qwen Audio 3.1 bestaat uit vijf modellen: verbeterde ASR-, TTS- en Realtime-systemen plus de nieuwe TTS-Next- en ASR-Next-modellen voor audiocreatie en dieper begrip.
  • Het vlaggenschip-TTS-model staat eerste op de onafhankelijke Artificial Analysis Text-to-Speech Leaderboard en ondersteunt 16 talen, 20 Chinese dialectregio's en tot drie minuten aaneengesloten spraakgeneratie.
  • Alibaba verlaagde bij de lancering de prijzen van spraakdiensten: de TTS-kosten daalden met roughly 70 procent, Realtime met ongeveer 85 procent en ASR met tot 95 procent.
  • Qwen Intelligence lanceert met drie agents, en de Mobile Use-agent behaalde 82,1 op MobileWorld, 92,2 op MobileWorld Real en 97,2 op AndroidDaily, met een gerapporteerd succespercentage van 90 procent op end-to-end taken.
  • Op de Apsara Conference schetste Alibaba Qwen 4 in vier tiers zonder openbare specificaties, kondigde plannen aan om modellen van vijf tot tien biljoen parameters te trainen en onthulde de Zhenwu V900-versneller met massaproductie gepland voor het eerste kwartaal van 2027.
Alibaba's Qwen lanceert Audio 3.1 en mobiele agents nu Qwen 4 en eigen chipontwikkeling bredere ambities verraden

Alibaba's Qwen-team heeft twee toevoegingen aan zijn productlijn uitgebracht: Qwen Audio 3.1, een herbouwde speechstack, en Qwen Intelligence, een reeks mobiele agents. Samen laten ze zien hoe het bedrijf zijn modelmomentum omzet in inzetbare producten over verschillende modaliteiten.

Qwen Audio 3.1: Vijf modellen in een complete speechstack

Qwen Audio 3.1 bestaat uit vijf modellen, verdeeld over twee groepen: een verbeterde kernlijn die begrip, generatie en interactie omvat, plus twee nieuwe modellen gericht op creatie en dieper begrip

Aan de synthesezijde staat het vlaggenschip-model voor tekst-naar-spraak (TTS) bovenaan de onafhankelijke Artificial Analysis Text-to-Speech Leaderboard. Het ondersteunt 16 talen en 20 Chinese dialectregio's, genereert tot drie minuten aaneengesloten spraak in één keer en accepteert vrije natuurlijke-taalinstructies die emotie, tempo, timbre en accent regelen. Het biedt ook 86 fijnmazige inline-tags voor effecten op zinsniveau zoals pauzes, ademhaling, lachen en zuchten.

Volgens het technische rapport verlaagt een 12,5 Hz spraaktokenizer met lage framewaarde de decoderingskosten, terwijl een vijfstaps trainingsjplijn de taal- en flowmodellen coördineert voor inhoudelijke consistentie, stemgelijkenis en robuustheid. Het systeem kan bruikbare spraak produceren, zelfs vanuit ruisachtige, galmende of gedegradeerde referentie-audio. Een begeleidend model, TTS-Next, combineert een taalmodel met een diffusiekader om spraak, geluidseffecten en achtergrondaudio in één keer te genereren, gericht op luisterboeken, podcasts, games en reclame.

Aan de begripszijde voegt het verbeterde automatische spraakherkenningsmodel (ASR) sterkere meertalige en dialectherkenning toe, samen met native transcriptoptimalisatie die vulwoorden en herhalingen automatisch verwijdert. ASR-Next breidt dit uit naar herkenning van meerdere sprekers met sprekerlabels, tijdstempels en uitgelijnde transcripties. Het kan ook emoties, omgevingsgeluid en machinegeluiden interpreteren, waardoor geluidsonderschriften, gebeurtenislokalisatie en audio-vraagantwoorden mogelijk worden.

Het Realtime-model ondersteunt gelijktijdig spreken en luisteren met onderbreking op elk moment, en past zijn tempo en toon aan wanneer het een sombere gemoedstoestand bij de beller detecteert. Alibaba koppelde de lancering aan aanzienlijke prijsverlagingen: de TTS-kosten daalden met roughly 70 procent, Realtime met ongeveer 85 procent en ASR met tot 95 procent. De verlagingen dekken de volledige kernlijn — synthese, realtime-interactie en herkenning — en kwamen bij de lancering beschikbaar naast de nieuwe modellen gericht op creatie en begrip.

Meet Qwen-Audio-3.1! ASR, TTS & Realtime are fully upgraded, joined by two new models: TTS-Next for audio creation and ASR-Next for audio understanding. Five models, one complete audio stack: understanding, generation, interaction & creation. Plus big price cuts across the… pic.twitter.com/Qcbvcw0q9C
— Qwen (@Alibaba_Qwen) September 23, 2026 (op X)

Qwen Intelligence: Agents voor mobiele taakuitvoering

Qwen Intelligence richt zich op een geheel andere laag: autonome taakuitvoering op mobiele apparaten. De Planner-agent verdeelt en orkestreert complexe taken en staat eerste op de MobilePA Bench van het bedrijf, inclusief de zakelijke en geheugenvarianten.

De Mobile Use-agent voert acties voornamelijk uit via API's, met terugval op grafische interfacebediening wanneer nodig. Het behaalde 82,1 op MobileWorld, 92,2 op de real-device benchmark MobileWorld Real en 97,2 op AndroidDaily, met een gerapporteerd succespercentage van 90 procent op volledige end-to-end taken. De Creative-agent genereert in ongeveer drie seconden een bruikbare afbeelding uit één zin — roughly twee keer zo snel als leidende alternatieven, volgens Alibaba.

Het bedrijf opende ook zijn benchmarksuite, waaronder MobilePA Bench, MobileWorld, MobileWorld Real en MobileWorld Safety, voor de onderzoeksgemeenschap — de maatstaven achter verschillende van gerapporteerde agentscores — waardoor externe referentiepunten beschikbaar komen voor het evalueren van mobiele agents onafhankelijk van Alibaba's eigen rapportage.

Introducing Qwen Intelligence, bringing personal intelligence within everyone's reach. It launches with three SOTA agents: – Mobile Planner Agent: plans, decomposes & orchestrates complex tasks. #1 on MobilePA-Bench, MobilePA-Bench Business & Memory. – Mobile-Use Agent:… pic.twitter.com/OgCLpxDJgj
— Qwen (@Alibaba_Qwen) September 23, 2026 (op X)

Na de conferentie: Qwen 4 en de infrastructuuraankondigingen

De uitbreidingen volgen op Alibaba's Apsara Conference in Hangzhou op 22 september, waar de Qwen 4-familie in vier tiers werd aangekondigd: Max als vlaggenschip gepositioneerd tegen de sterkste concurrentmodellen, Flash voor werkbelastingen met lage latentie en hoog volume, Plus als gebalanceerde multimodale tier, en een 27B open-weights-variant voor lokaal gebruik. Geen van de vier heeft openbare specificaties, prijzen of een lanseringsdatum, waardoor de aankondiging een richtingsaanduiding is in plaats van een verzendklaar product.

Andere aankondigingen op de conferentie verduidelijkten die richting. Chief Executive Eddie Wu zei dat het Qwen-team van plan is modellen van vijf tot tien biljoen parameters te trainen — een doelstelling die Alibaba's eigen verklaringen toekennen aan Qwen 4.5 en Qwen 5 — om complexere taken met een langere horizon aan te pakken. Om modellen van die schaal te ondersteunen, onthulde Alibaba's T-Head-unit de Zhenwu V900-versneller, die drie keer de prestaties van zijn voorganger M890 belooft, 216 GB geheugen heeft en schaalt naar clusters van tot 500.000 chips, met massaproductie gepland voor het eerste kwartaal van 2027.

Wu stelde als doel meer dan 20 gigawatt aan mondiale cloudcapaciteit te overschrijden tegen 2032 en beschreef een drielags cloudarchitectuur ontworpen voor agentische werkbelastingen. Hij merkte ook op dat de vraag naar AI het aanbod voorbijstreeft, met AI-supernodes die dit kwartaal op commerciële schaal online komen. Alibaba's aandelen in Hong Kong stegen die dag met 5,1 procent.

De binnenlandse chipaanval vindt plaats te midden van aanscherpende Amerikaanse exportbeperkingen. Analysten wijzen naar augustus' open-source Qwen3.8 Flash Next, met zijn sparse attention- en n-gram embedding-technieken, als de dichtstbijzijnde beschikbare voorproever van de next-generation architectuur, hoewel Alibaba het verband niet heeft bevestigd.

Een bredere ontwikkeling: Van open modellen naar een geïntegreerde stack

De recente uitbreidingen bekronen een versnellende ontwikkeling. Sinds zijn debuut in 2023 is Qwen de meest gebruikte open-weights-modelfamilie geworden, met meer dan 300 miljoen cumulatieve downloads en meer dan 100000 afgeleide modellen op Hugging Face, volgens Alibaba.

Het huidige vlaggenschip, Qwen3.8 Max, in augustus uitgebracht met open weights, bevat 2,4 biljoen parameters en verwerkt één miljoen tokens aan context, terwijl september's Qwen3.8 Omni Flash de verwerking uitbreidt over tekst, afbeelding, audio en video. De licentiestructuur is parallel geëvolueerd: het vlaggenschip bevat een clausule die vereist dat bedrijven met meer dan $50 miljoen jaaromzet die omzet delen met Alibaba, terwijl kleinere gedestilleerde modellen worden geleverd onder permissieve Apache 2.0-licenties.

Verschillende open vragen zullen bepalen hoe deze strategie zich ontvouwt: of onafhankelijk geverifieerde benchmarks de door de leverancier gerapporteerde resultaten voor de agents en spraakmodellen bevestigen, of de chipproductietijdlijnen aansluiten bij de modelroadmap, en hoe de omzetdelende licentie in de praktijk wordt toegepast. Met nog steeds onbekende specificaties van Qwen 4 en de volgende generatie al in training, heeft Alibaba een ongebruikelijk brede agenda uiteengezet die silicium, cloudinfrastructuur, modellen en consumentenagents omvat. De komende kwartalen zullen laten zien hoe deze onderdelen in de praktijk samenkomen.

Bron: Metaverse Post