НовостиАкцииAlibaba расширяет Qwen в области речи и мобильных агентов: Qwen 4 и собственные чипы свидетельствуют о более широких амбициях

Alibaba расширяет Qwen в области речи и мобильных агентов: Qwen 4 и собственные чипы свидетельствуют о более широких амбициях

Автор: Metaverse Post·

Ключевые выводы

  • Qwen Audio 3.1 состоит из пяти моделей: обновлённых систем ASR, TTS и Realtime плюс новых моделей TTS-Next и ASR-Next для создания аудио и более глубокого понимания.
  • Флагманская модель TTS занимает первое место в независимом рейтинге Artificial Analysis Text-to-Speech Leaderboard, поддерживает 16 языков, 20 диалектных регионов Китая и генерирует до трёх минут непрерывной речи.
  • Alibaba снизила цены на речевые услуги при запуске: стоимость TTS упала примерно на 70 процентов, Realtime — примерно на 85 процентов, ASR — до 95 процентов.
  • Qwen Intelligence запускается с тремя агентами; агент Mobile Use набрал 82,1 на MobileWorld, 92,2 на MobileWorld Real и 97,2 на AndroidDaily, с заявленным уровнем успеха в 90 процентов для сквозных задач.
  • На конференции Apsara Alibaba представила Qwen 4 в четырёх уровнях без публичных спецификаций, объявила планы обучать модели с пятью-десятью триллионами параметров и показала ускоритель Zhenwu V900 с серийным производством, запланированным на первый квартал 2027 года.
Alibaba расширяет Qwen в области речи и мобильных агентов: Qwen 4 и собственные чипы свидетельствуют о более широких амбициях

Команда Qwen компании Alibaba выпустила два дополнения к своей продуктовой линейке: Qwen Audio 3.1 — переработанный речевой стек — и Qwen Intelligence, набор мобильных агентов. Вместе они показывают, как компания превращает импульс своих моделей в готовые к развёртыванию продукты в различных модальностях.

Qwen Audio 3.1: пять моделей в рамках полного речевого стека

Qwen Audio 3.1 состоит из пяти моделей, организованных в две группы: обновлённая базовая линейка, охватывающая понимание, генерацию и взаимодействие, плюс две новые модели, ориентированные на создание и более глубокое понимание аудио.

В области синтеза флагманская модель синтеза речи (TTS) занимает первое место в независимом рейтинге Artificial Analysis Text-to-Speech Leaderboard. Она поддерживает 16 языков и 20 диалектных регионов Китая, генерирует до трёх минут непрерывной речи за один проход и принимает свободные инструкции на естественном языке, управляющие эмоцией, темпом, тембром и акцентом. Также доступны 86 тонких встроенных тегов для эффектов на уровне фраз, таких как паузы, дыхание, смех и вздохи.

Согласно техническому отчёту, низкочастотный речевой токенизатор с частотой 12,5 Гц снижает затраты на декодирование, а пятиэтапный процесс обучения координирует языковые и поточные модели для согласованности содержания, сходства голоса и устойчивости. Система может создавать пригодную для использования речь даже на основе зашумлённого, с реверберацией или ухудшенного эталонного аудио. Дополняющая модель TTS-Next объединяет языковую модель с диффузионным фреймворком, чтобы за один проход генерировать голос, звуковые эффекты и фоновое аудио — для аудиокниг, подкастов, игр и рекламы.

В области понимания обновлённая модель автоматического распознавания речи (ASR) добавляет более сильное многоязычное и диалектное распознавание, а также встроенную полировку транскриптов, автоматически удаляющую слова-паразиты и повторы. ASR-Next расширяет это до распознавания нескольких говорящих с метками спикеров, временными метками и выровненными транскриптами. Она также может интерретировать эмоции, окружающий шум и звуки машин, обеспечивая субтитрирование звуков, локализацию событий и ответы на вопросы по аудио.

Модель Realtime поддерживает одновременные говорение и слушание с возможностью прерывания в любой момент и корректирует темп и тон, обнаруживая подавленное настроение у собеседника. Alibaba сопроводила запуск существенным снижением цен: стоимость TTS упала примерно на 70 процентов, Realtime — примерно на 85 процентов, а ASR — до 95 процентов. Снижение охватило всю базовую линейку — синтез, взаимодействие в реальном времени и распознавание — и состоялось одновременно с запуском новых моделей, ориентированных на создание и понимание.

Meet Qwen-Audio-3.1! ASR, TTS & Realtime are fully upgraded, joined by two new models: TTS-Next for audio creation and ASR-Next for audio understanding. Five models, one complete audio stack: understanding, generation, interaction & creation. Plus big price cuts across the… pic.twitter.com/Qcbvcw0q9C
— Qwen (@Alibaba_Qwen) September 23, 2026 (в X)

Qwen Intelligence: агенты для выполнения задач на мобильных устройствах

Qwen Intelligence нацелена на совершенно иной уровень: автономное выполнение задач на мобильных устройствах. Её агент Planner декомпозирует и оркестрирует сложные задачи, занимая первое место в MobilePA Bench компании, включая его варианты Business и Memory.

Агент Mobile Use выполняет действия в первую очередь через API, при необходимости переходя к управлению графическим интерфейсом. Он набрал 82,1 балла на MobileWorld, 92,2 на бенчмарке для реальных устройств MobileWorld Real и 97,2 на AndroidDaily, с заявленным уровнем успеха в 90 процентов для полных сквозных задач. Агент Creative генерирует пригодное изображение из одного предложения примерно за три секунды — примерно вдвое быстрее ведущих аналогов, по данным Alibaba.

Компания также открыла свой набор бенчмарков, включая MobilePA Bench, MobileWorld, MobileWorld Real и MobileWorld Safety, для исследовательского сообщества — это те критерии, на которых основаны многие из заявленных результатов агентов, — предоставляя внешние ориентиры для оценки мобильных агентов независимо от отчётов самой Alibaba.

Introducing Qwen Intelligence, bringing personal intelligence within everyone's reach. It launches with three SOTA agents: – Mobile Planner Agent: plans, decomposes & orchestrates complex tasks. #1 on MobilePA-Bench, MobilePA-Bench Business & Memory. – Mobile-Use Agent:… pic.twitter.com/OgCLpxDJgj
— Qwen (@Alibaba_Qwen) September 23, 2026 (в X)

После сцены конференции: Qwen 4 и объявления об инфраструктуре

Релизы последовали за конференцией Apsara компании Alibaba в Ханчжоу 22 сентября, где семейство Qwen 4 было представлено в четырёх уровнях: Max как флагман, позиционируемый против ведущих конкурирующих моделей, Flash для рабочих нагрузок с низкой задержкой и большим объёмом, Plus как сбалансированный мультимодальный уровень и вариант с открытыми весами на 27B для локального использования. Ни у одной из четырёх моделей нет публичных спецификаций, цен или даты запуска, что превращает анонс в заявление о направлении, а не в готовый продукт.

Другие объявления на конференции прояснили это направление. Главный исполнительный директор Эдди Ву (Eddie Wu) заявил, что команда Qwen планирует обучать модели с пятью-десятью триллионами параметров — цель, которую собственные заявления Alibaba относят к Qwen 4.5 и Qwen 5, — для решения более сложных задач с более длительным горизонтом. Для поддержки моделей такого масштаба подразделение Alibaba T-Head представило ускоритель Zhenwu V900, который обещает трёхкратное превышение производительности предшественника M890, несёт 216 ГБ памяти и масштабируется до кластеров из 500 000 чипов; серийное производство запланировано на первыйал 2027 года.

Ву поставил цель превысить 20 гигаватт глобальной облачной мощности к 2032 году и описал трёхуровневую облачную архитектуру, рассчитанную на агентные рабочие нагрузки. Он также отметил, что спрос на ИИ опережает предложение, а ИИ-суперузлы выходят на коммерческий масштаб в этом квартале. Акции Alibaba в Гонконге в тот день выросли на 5,1 процента.

Продвижение отечественных чипов происходит на фоне ужесточения экспортных ограничений США. Аналитики указывают на открытую в августе модель Qwen3.8 Flash Next с её техниками разреженного внимания и n-граммовых вложений как на ближайший доступный прообраз архитектуры нового поколения, хотя Alibaba не подтвердила эту связь.

Более широкая траектория: от открытых моделей к интегрированному стеку

Недавние релизы завершают ускоряющуюся траекторию. С момента дебюта в 2023 году Qwen стало наиболее широко используемым семейством моделей с открытыми весами: по данным Alibaba, более 300 миллионов суммарных загрузок и свыше 100 000 производных моделей на Hugging Face.

Текущий флагман Qwen3.8 Max, выпущенный в августе с открытыми весами, содержит 2,4 триллиона параметров и обрабатывает контекст в один миллион токенов, а сентябрьская Qwen3.8 Omni Flash расширяет обработку на текст, изображения, аудио и видео. Лицензионная структура развивалась параллельно: флагман содержит пункт, требующий от компаний с годовой выручкой более 50 миллионов долларов делиться этой выручкой с Alibaba, в то время как меньшие дистиллированные модели распространяются под разрешительными лицензиями Apache 2.0.

Несколько открытых вопросов определят, как развернётся эта стратегия: подтвердят ли независимо проверенные бенчмарки заявленные вендором результаты агентов и речевых моделей, совпадут ли сроки производства чипов с дорожной картой моделей и как лицензия с разделением выручки будет применяться на практике. Поскольку спецификации Qwen 4 всё ещё не раскрыты, а поколение нового поколения уже обучается, Alibaba очертила необычно широкую повестку, охватывающую кремний, облачную инфраструктуру, модели и потребительских агентов. Ближайшие кварталы покажут, как эти элементы сходятся на практике.

Источник: Metaverse Post