NoticiasAccionesAlibaba expande Qwen hacia voz y agentes móviles mientras Qwen 4 y silicio propio revelan ambiciones más amplias

Alibaba expande Qwen hacia voz y agentes móviles mientras Qwen 4 y silicio propio revelan ambiciones más amplias

Autor: Metaverse Post·

Puntos clave

  • Qwen Audio 3.1 consta de cinco modelos: los sistemas mejorados ASR, TTS y Realtime más los nuevos modelos TTS-Next y ASR-Next para la creación de audio y una comprensión más profunda.
  • El modelo insignia de TTS ocupa el primer lugar en la tabla independiente Artificial Analysis Text-to-Speech Leaderboard y admite 16 idiomas, 20 regiones dialectales chinas y hasta tres minutos de generación continua de habla.
  • Alibaba redujo los precios de sus servicios de voz en el lanzamiento, recortando los costos de TTS en aproximadamente un 70 por ciento, Realtime en alrededor del 85 por ciento y ASR hasta un 95 por ciento.
  • Qwen Intelligence se lanza con tres agentes, y el agente Mobile Use obtuvo 82,1 en MobileWorld, 92,2 en MobileWorld Real y 97,2 en AndroidDaily, con una tasa de éxito reportada del 90 por ciento en tareas de extremo a extremo.
  • En la Conferencia Apsara, Alibaba presentó Qwen 4 en cuatro niveles sin especificaciones públicas, anunció planes para entrenar modelos de cinco a diez billones de parámetros y reveló el acelerador Zhenwu V900 con producción en masa programada para el primer trimestre de 2027.
Alibaba expande Qwen hacia voz y agentes móviles mientras Qwen 4 y silicio propio revelan ambiciones más amplias

El equipo de Qwen de Alibaba ha lanzado dos novedades en su línea de productos: Qwen Audio 3.1, una pila de voz reconstruida, y Qwen Intelligence, un conjunto de agentes móviles. Juntos muestran cómo la empresa está convirtiendo su impulso en modelos en productos desplegables a través de diversas modalidades.

Qwen Audio 3.1: Cinco modelos en una pila de voz completa

Qwen Audio 3.1 consta de cinco modelos organizados en dos grupos: una línea central mejorada que cubre comprensión, generación e interacción, más dos nuevos modelos orientados a la creación y a una comprensión más profunda.

En el lado de la síntesis, el modelo insignia de texto a voz (TTS) ocupa el primer lugar en la tabla independiente Artificial Analysis Text-to-Speech Leaderboard. Admite 16 idiomas y 20 regiones dialectales chinas, genera hasta tres minutos de habla continua en una sola pasada y acepta instrucciones en lenguaje natural de formato libre que controlan emoción, ritmo, timbre y acento. También ofrece 86 etiquetas en línea de grano fino para efectos a nivel de frase, como pausas, respiraciones, risas y suspiros.

Según el informe técnico, un tokenizador de voz de baja tasa de fotogramas de 12,5 Hz reduce el costo de decodificación, mientras que un pipeline de entrenamiento de cinco etapas coordina los modelos de lenguaje y de flujo para garantizar consistencia de contenido, similitud de voz y robustez. El sistema puede producir voz utilizable incluso a partir de audio de referencia ruidoso, con reverberación o degradado. Un modelo complementario, TTS-Next, combina un modelo de lenguaje con un framework de difusión para generar voz, efectos de sonido y audio de fondo en una sola pasada, dirigido a audiolibros, podcasts, videojuegos y publicidad.

En el lado de la comprensión, el modelo mejorado de reconocimiento automático de voz (ASR) añade un reconocimiento multilingüe y dialectal más sólido, junto con un pulido nativo de transcripciones que elimina automáticamente muletillas y repeticiones. ASR-Next amplía esto al reconocimiento multihablante con etiquetas de hablante, marcas de tiempo y transcripciones alineadas. También puede interpretar emociones, ruido ambiental y sonidos de máquinas, lo que habilita la descripción de sonidos, la localización de eventos y la respuesta de preguntas sobre audio.

El modelo Realtime admite hablar y escuchar simultáneamente con interrupción en cualquier momento, y ajusta su ritmo yo cuando detecta un estado de ánimo bajo en la persona que llama. Alibaba acompañó el lanzamiento con reducciones sustanciales de precios: los costos de TTS cayeron alrededor del 70 por ciento, Realtime aproximadamente un 85 por ciento y ASR hasta un 95 por ciento. Las reducciones cubren toda la línea central —síntesis, interacción en tiempo real y reconocimiento— y llegaron junto con los nuevos modelos centrados en la creación y la comprensión.

Meet Qwen-Audio-3.1! ASR, TTS & Realtime are fully upgraded, joined by two new models: TTS-Next for audio creation and ASR-Next for audio understanding. Five models, one complete audio stack: understanding, generation, interaction & creation. Plus big price cuts across the… pic.twitter.com/Qcbvcw0q9C
— Qwen (@Alibaba_Qwen) September 23, 2026 (on X)

Qwen Intelligence: Agentes para la ejecución de tareas móviles

Qwen Intelligence apunta a una capa completamente distinta: la ejecución autónoma de tareas en dispositivos móviles. Su agente Planner descompone y orquesta tareas complejas, ocupando el primer lugar en el MobilePA Bench de la empresa, incluidas sus variantes business y memory.

El agente Mobile Use ejecuta acciones principalmente a través de APIs, recurriendo al control de la interfaz gráfica cuando es necesario. Obtuvo 82,1 en MobileWorld, 92,2 en el benchmark MobileWorld Real en dispositivos reales y 97,2 en AndroidDaily, con una tasa de éxito reportada del 90 por ciento en tareas completas de extremo a extremo. El agente Creative genera una imagen utilizable a partir de una sola frase en unos tres segundos, aproximadamente el doble de rápido que las alternativas líderes, según Alibaba.

La empresa también abrió su suite de benchmarks, incluidos MobilePA Bench, MobileWorld, MobileWorld Real y MobileWorld Safety, a la comunidad de investigación —los parámetros detrás de varios de los puntajes reportados—, proporcionando puntos de referencia externos para evaluar agentes móviles de manera independiente de los propios reportes de Alibaba.

Introducing Qwen Intelligence, bringing personal intelligence within everyone's reach. It launches with three SOTA agents: – Mobile Planner Agent: plans, decomposes & orchestrates complex tasks. #1 on MobilePA-Bench, MobilePA-Bench Business & Memory. – Mobile-Use Agent:… pic.twitter.com/OgCLpxDJgj
— Qwen (@Alibaba_Qwen) September 23, 2026 (on X)

Tras la conferencia: Qwen 4 y los anuncios de infraestructura

Los lanzamientos llegan después de la Conferencia Apsara de Alibaba en Hangzhou el 22 de septiembre, donde se anunció la familia Qwen 4 en cuatro niveles: Max como insignia posicionada frente a los modelos rivales más destacados, Flash para cargas de trabajo de baja latencia y alto volumen, Plus como un nivel multimodal equilibrado, y una variante de pesos abiertos de 27B para uso local. Ninguno de los cuatro cuenta con especificaciones públicas, precios ni fecha de lanzamiento, lo que convierte el anuncio en una declaración de dirección más que en un producto disponible.

Otros anuncios de la conferencia aclararon esa dirección. El director ejecutivo Eddie Wu declaró que el equipo de Qwen planea entrenar modelos de cinco a diez billones de parámetros —un objetivo que las propias declaraciones de Alibaba asignan a Qwen 4.5 y Qwen 5— para abordar tareas más complejas y de mayor alcance. Para soportar modelos de esa escala, la unidad T-Head de Alibaba presentó el acelerador Zhenwu V900, que promete tres veces el rendimiento de su predecesor M890, cuenta con 216 GB de memoria y escala hasta clústeres de 500.000 chips, con producción en masa programada para el primer trimestre de 2027.

Wu estableció como objetivo superar los 20 gigavatios de capacidad global de nube para 2032 y describió una arquitectura de nube de tres capas diseñada para cargas de trabajo agénticas. También señaló que la demanda de IA supera la oferta, conodos de IA entrando en operación a escala comercial este trimestre. Las acciones de Alibaba en Hong Kong subieron un 5,1 por ciento en la jornada.

El impulso nacional de chips se desarrolla en medio de restricciones de exportación de EE. UU. cada vez más estrictas. Los analistas señalan el Qwen3.8 Flash Next de código abierto de agosto, con sus técnicas de atención dispersa y embeddings n-gram, como la vista previa disponible más cercana de la arquitectura de próxima generación, aunque Alibaba no ha confirmado la conexión.

Una trayectoria más amplia: De modelos abiertos a una pila integrada

Los lanzamientos recientes culminan una trayectoria acelerada. Desde su debut en 2023, Qwen se ha convertido en la familia de modelos de pesos abiertos más utilizada, con más de 300 millones de descargas acumuladas y más de 100.000 modelos derivados en Hugging Face, según Alibaba.

El insignia actual, Qwen3.8 Max, lanzado en agosto con pesos abiertos, contiene 2,4 billones de parámetros y maneja un millón de tokens de contexto, mientras que el Qwen3.8 Omni Flash de septiembre extiende el procesamiento nativo a texto, imagen, audio y video. La estructura de licencias ha evolucionado en paralelo: el insignia incluye una cláusula que exige a las empresas con ingresos anuales superiores a 50 millones de dólares compartir esos ingresos con Alibaba, mientras que los modelos destilados más pequeños se distribuyen bajo las licencias permisivas Apache 2.0.

Varias preguntas abiertas definirán cómo se desarrolla esta estrategia: si benchmarks verificados de forma independiente confirman los resultados reportados por el proveedor para los agentes y modelos de voz, si los plazos de producción de chips se alinean con la hoja de ruta de modelos, y cómo se adopta en la práctica la licencia de participación de ingresos. Con las especificaciones de Qwen 4 aún sin revelar y la próxima generación ya en entrenamiento, Alibaba ha trazado una agenda inusualmente amplia que abarca silicio, infraestructura de nube, modelos y agentes de consumo. Los próximos trimestres mostrarán cómo convergen estas piezas en la práctica.

Fuente: Metaverse Post