AktualnościAkcjeAlibaba rozwija Qwen w kierunku mowy i agentów mobilnych — Qwen 4 i własne układy krzemowe sygnalizują szersze ambicje

Alibaba rozwija Qwen w kierunku mowy i agentów mobilnych — Qwen 4 i własne układy krzemowe sygnalizują szersze ambicje

Autor: Metaverse Post·

Najważniejsze informacje

  • Qwen Audio 3.1 składa się z pięciu modeli: zaktualizowanych systemów ASR, TTS i Realtime oraz nowych modeli TTS-Next i ASR-Next do tworzenia dźwięku i głębszego rozumienia.
  • Flagowy model TTS zajmuje pierwsze miejsce w niezależnym rankingu Artificial Analysis Text-to-Speech Leaderboard i obsługuje 16 języków, 20 chińskich regionów dialektowych oraz generowanie do trzech minut ciągłej mowy.
  • Alibaba obniżyła ceny usług mowy przy premierze: koszty TTS spadły o około 70 procent, Realtime o około 85 procent, a ASR do 95 procent.
  • Qwen Intelligence startuje z trzema agentami; agent Mobile Use uzyskał wynik 82,1 w MobileWorld, 92,2 w MobileWorld Real i 97,2 w AndroidDaily, przy zgłaszanej skuteczności 90 procent w zadaniach end-to-end.
  • Na konferencji Apsara Alibaba przedstawiła Qwen 4 w czterech wersjach bez publicznych specyfikacji, zapowiedziała plany trenowania modeli o pięciu do dziesięciu bilionów parametrów i zaprezentowała akcelerator Zhenwu V900 z produkcją seryjną zaplanowaną na pierwszy kwartał 2027 roku.
Alibaba rozwija Qwen w kierunku mowy i agentów mobilnych — Qwen 4 i własne układy krzemowe sygnalizują szersze ambicje

Zespół Qwen firmy Alibaba wprowadził dwa nowe elementy oferty: Qwen Audio 3.1, przebudowany stos technologii mowy, oraz Qwen Intelligence, zestaw agentów mobilnych. Razem pokazują, jak firma przekuwa rozpęd swoich modeli w gotowe do wdrożenia produkty w różnych modalnościach.

Qwen Audio 3.1: Pięć modeli w kompletnym stosie mowy

Qwen Audio 3.1 składa się z pięciu modeli podzielonych na dwie grupy: zaktualizowanej linii podstawowej obejmującej rozumienie, generowanie i interakcję oraz dwóch nowych modeli ukierunkowanych na tworzenie i głębsze rozumienie.

Po stronie syntezy flagowy model syntezy mowy (TTS) zajmuje pierwsze miejsce w niezależnym rankingu Artificial Analysis Text-to-Speech Leaderboard. Obsługuje 16 języków i 20 chińskich regionów dialektowych, generuje do trzech minut ciągłej mowy w jednym przebiegu oraz przyjmuje swobodne instrukcje w języku naturalnym sterujące emocjami, tempem, barwą i akcentem. Oferuje także 86 drobnoziarnistych tagów wbudowanych dla efektów na poziomie fraz, takich jak pauzy, oddechy, śmiech czy wzdychanie.

Według raportu technicznego tokenizer mowy o niskiej częstotliwości klatek 12,5 Hz redukuje koszt dekodowania, a pięcioetapowy potok treningowy koordynuje modele językowe i przepływowe pod kątem spójności treści, podństwa głosu i odporności. System potrafi wygenerować użyteczną mowę nawet z zaszumionego, pogłosowego lub zdegradowanego audio referencyjnego. Model towarzyszący, TTS-Next, łączy model językowy z frameworkiem dyfuzyjnym, aby w jednym przebiegu generować głos, efekty dźwiękowe i tło audio — z myślą o audiobookach, podcastach, grach i reklamie.

Po stronie rozumienia zaktualizowany model automatycznego rozpoznawania mowy (ASR) dodaje silniejsze rozpoznawanie wielojęzyczne i dialektów oraz natywne wygładzanie transkrypcji, które automatycznie usuwa wypełniacze i powtórzenia. ASR-Next rozszerza to na rozpoznawanie wielu mówców z etykietami mówców, znacznikami czasu i wyrównanymi transkrypcjami. Potrafi też interpretować emocje, szum otoczenia i dźwięki maszyn, umożliwiając opisywanie dźwięków, lokalizację zdarzeń i odpowiadanie na pytania audio.

Model Realtime obsługuje jednoczesne mówienie i słuchanie z możliwością przerwania w dowolnym momencie oraz dostosowuje tempo i ton, gdy wykryje obniżony nastrój rozmówcy. Alibaba towarzyszyła premierze znacznymi obniżkami cen: koszty TTS spadły o około 70 procent, Realtime o około 85 procent, a ASR do 95 procent. Obniżki obejmują całą podstawową linię — syntezę, interakcję w czasie rzeczywistym i rozpoznawanie — i nastąpiły wraz z premierą nowych modeli skoncentrowanych na tworzeniu i rozumieniu.

Meet Qwen-Audio-3.1! ASR, TTS & Realtime are fully upgraded, joined by two new models: TTS-Next for audio creation and ASR-Next for audio understanding. Five models, one complete audio stack: understanding, generation, interaction & creation. Plus big price cuts across the… pic.twitter.com/Qcbvcw0q9C
— Qwen (@Alibaba_Qwen) September 23, 2026 (on X)

Qwen Intelligence: Agenci do wykonywania zadań na urządzeniach mobilnych

Qwen Intelligence celuje w zupełnie inną warstwę: autonomiczne wykonywanie zadań na urządzeniach mobilnych. Agent Planner dekomponuje i koordynuje złożone zadania, zajmując pierwsze miejsce w benchmarku MobilePA Bench firmy, w tym w jego wariantach business i memory.

Agent Mobile Use wykonuje działania przede wszystkim poprzez API, w razie potrzeby przechodząc na sterowanie interfejsem graficznym. Osiągnął wynik 82,1 w MobileWorld, 92,2 w benchmarku MobileWorld Real na rzeczywistych urządzeniach oraz 97,2 w AndroidDaily, przy zgłaszanym wskaźniku skuteczności 90 procent w pełnych zadaniach end-to-end. Agent Creative generuje użyteczny obraz z jednego zdania w około trzy sekundy — mniej więcej dwukrotnie szybciej niż wiodące alternatywy, według Alibaba.

Firma udostępniła również społeczności badawczej swój zestaw benchmarków, obejmujący MobilePA Bench, MobileWorld, MobileWorld Real i MobileWorld Safety — miarki, na których oparto część zgłaszanych wyników agentów — dostarczając zewnętrznych punktów odniesienia do niezależnej od rapów Alibaba oceny agentów mobilnych.

Introducing Qwen Intelligence, bringing personal intelligence within everyone's reach. It launches with three SOTA agents: – Mobile Planner Agent: plans, decomposes & orchestrates complex tasks. #1 on MobilePA-Bench, MobilePA-Bench Business & Memory. – Mobile-Use Agent:… pic.twitter.com/OgCLpxDJgj
— Qwen (@Alibaba_Qwen) September 23, 2026 (on X)

Po konferencji: Qwen 4 i zapowiedzi infrastrukturalne

Premiery nastąpiły po konferencji Apsara firmy Alibaba w Hangzhou 22 września, na której zaprezentowano rodzinę Qwen 4 w czterech wersjach: Max jako flagową, pozycjonowaną wobec czołowych modeli konkurencji, Flash do zadań o niskich opóźnieniach i dużej objętości, Plus jako zbalansowaną wersję multimodalną oraz wariant 27B o otwartych wagach do użytku lokalnego. Żadna z czterech nie ma publicznych specyfikacji, cen ani daty premiery, co czyni z tej zapowiedzi deklarację kierunku, a nie gotowy produkt.

Inne ogłoszenia z konferencji doprecyzowały ten kierunek. Dyrektor generalny Eddie Wu oświadczył, że zespół Qwen planuje trenować modele o pięciu do dziesięciu bilionów parametrów — cel, który według samych wypowiedzi Alibaba dotyczy Qwen 4.5 i Qwen 5 — do realizacji bardziej złożonych, dłuższych horyzontalnie zadań. Aby wspierać modele tej skali, jednostka T-Head firmy Alibaba zaprezentowała akcelerator Zhenwu V900, który obiecuje trzykrotność wydajności poprzednika M890, posiada 216 GB pamięci i skaluje się do klastrów do 500 000 układów, z produkcją seryjną zaplanowaną na pierwszy kwartał 2027 roku.

Wu wyznaczył cel przekroczenia 20 gigawatów globalnej mocy chmurowej do 2032 roku i opisał trójwarstwową architekturę chmury zaprojektowaną pod obciążenia agentowe. Zaznaczył też, że popyt na AI wyprzedza podaż, a supernody AI wchodzą do użytku komercyjnego w tym kwartale. Akcje Alibaba w Hongkangu wzrosły tego dnia o 5,1 procenta.

Krajowy wysiłek krzemowy rozgrywa się na tle zaostrzających się amerykańskich restrykcji eksportowych. Analitycy wskazują na udostępniony jako open source w sierpniu Qwen3.8 Flash Next, z technikami sparse attention i osadzeniami n-gram, jako najsze dostępne zapowiedzi architektury nowej generacji, choć Alibaba nie potwierdziła tego powiązania.

Szersza trajektoria: od otwartych modeli do zintegrowanego stosu

Najnowsze premiery wieńczą przyspieszającą trajektorię. Od debiutu w 2023 roku Qwen stał się naj szerzej używaną rodziną modeli o otwartych wagach, z ponad 300 milionami skumulowanych pobrań i ponad 100 000 modeli pochodnych na Hugging Face, według Alibaba.

Obecny model flagowy, Qwen3.8 Max, wydany w sierpniu z otwartymi wagami, zawiera 2,4 biliona parametrów i obsługuje milion tokenów kontekstu, a wrześniowy Qwen3.8 Omni Flash rozszerza natywne przetwarzanie na tekst, obraz, audio i wideo. Równolegle ewoluowała struktura licencjonowania: model flagowy zawiera klauzulę wymagającą od firm generujących ponad 50 milionów dolarów rocznych przychodów dzielenia się częścią tych przychodów z Alibaba, podczas gdy mniejsze modele destylowane są dystrybuowane na liberalnych licencjach Apache 2.0.

Kilka otwartych pytań ukształtuje dalszy rozwój tej strategii: czy niezależnie zweryfikowane benchmarki potwierdzą zgłaszane przez dostawcę wyniki agentów i modeli mowy, czy harmonogramy produkcji układów zbiegną się z mapą drogową modeli oraz jak w praktyce zostanie przyjęta licencja z podziałem przychodów. Przy wciąż nieujawnionych specyfikacjach Qwen 4 i już trwającym treningu nowej generacji Alibaba wyznaczyła niezwykle szeroki program obejmujący krzem, infrastrukturę chmurową, modele i agenty konsumenckie. Nadchodzące kwartały pokażą, jak te elementy zbiegną się w praktyce.

Źródło: Metaverse Post