Microsoft presenta en avance MAI-Realtime, un modelo de voz bidireccional para IA conversacional
Puntos clave
- •MAI-Realtime es un modelo de voz bidireccional que procesa audio en ambas direcciones simultáneamente, permitiendo conversaciones de dúplex completo en lugar de la rígida alternancia de turnos de los sistemas de voz tradicionales.
- •Microsoft ha ensamblado una pila de IA de voz verticalmente integrada que consta de MAI-Transcribe-1 para reconocimiento de voz, MAI-Voice-1 para texto a voz y MAI-Realtime para conversación bidireccional en tiempo real.
- •MAI-Voice-1 puede generar un minuto completo de audio en menos de un segundo en una sola GPU y ya se ha integrado en las funciones de Copilot en múltiples aplicaciones de Microsoft.
- •Al construir sus propios modelos de voz, Microsoft evita pagar costos de inferencia a terceros y obtiene control total sobre su hoja de ruta de productos y decisiones de precios.
- •Microsoft aún no ha abierto MAI-Realtime a pruebas públicas, publicado benchmarks de rendimiento, ni confirmado planes específicos para integrarlo en Copilot u otros productos.

Microsoft está construyendo constantemente su propia pila de IA de voz, y el componente más reciente es MAI-Realtime, un modelo de voz bidireccional actualmente en versión preliminar interna. La empresa afirma que el modelo ofrecerá interacciones más naturales en múltiples idiomas y se integrará con su ecosistema de herramientas más amplio.
A diferencia de los sistemas de voz tradicionales que alternan entre hablar y escuchar al estilo de un walkie-talkie, un modelo bidireccional maneja ambas funciones simultáneamente. MAI-Realtime procesa audio en tiempo real en ambas direcciones, permitiendo interacciones que se sienten conversacionales en lugar de rígidas o robóticas. Este enfoque de dúplex completo refleja cómo funciona realmente la conversación humana — las personas interrumpen, se superponen y responden a mitad de frase — y ha sido una frontera técnica para la IA de voz, donde la latencia y la lógica de alternancia de turnos han hecho que las interacciones se sientan mecánicas durante mucho tiempo.
MAI-Realtime permanece en una fase de versión preliminar interna, lo que significa que Microsoft aún no lo ha abierto a pruebas públicas ni ha publicado benchmarks de rendimiento. Lo que la empresa ha confirmado es que el modelo está diseñado para sentirse más natural, soportar múltiples idiomas y funcionar junto con herramientas existentes — lo cual, dentro del ecosistema de Microsoft, probablemente apunta a la integración con Copilot y su suite de aplicaciones de productividad.
MAI-Realtime no existe de forma aislada. Microsoft ha estado ensamblando una pila completa de IA de voz bajo su paraguas MAI (Microsoft AI). MAI-Voice-1, el modelo expresivo de texto a voz de la empresa, se presentó por primera vez en agosto de 2025 y se amplió en abril de 2026. Ese modelo puede producir un minuto completo de audio en menos de un segundo utilizando una sola GPU y ya se ha integrado en las funciones de Copilot en múltiples aplicaciones de Microsoft. Junto a él, Microsoft introdujo MAI-Transcribe-1, un modelo de reconocimiento de voz que soporta 25 idiomas.
En conjunto, los tres modelos forman una pila de IA de voz verticalmente integrada: MAI-Transcribe-1 maneja la escucha, MAI-Voice-1 maneja la expresión oral, y MAI-Realtime permite conversación bidireccional completa — todo propiedad de Microsoft de extremo a extremo. Para Microsoft, que cuenta con cientos de millones de usuarios empresariales en Teams, Office y Windows, controlar esta pila internamente significa que puede integrar interacciones de IA basadas en voz profundamente en los flujos de trabajo — desde la transcripción y resumen de reuniones en vivo en Teams hasta la redacción de documentos por voz — sin depender del calendario de versiones o los precios de un proveedor externo.
Este enfoque propio tiene implicaciones estratégicas claras. Cuando Microsoft depende de las capacidades de voz de OpenAI, paga por la inferencia, está sujeto a las decisiones de precios de OpenAI y no controla la hoja de ruta del producto. Construir sus propios modelos cambia ese cálculo por completo.
El panorama competitivo está activo. OpenAI lanzó su propia API de voz en tiempo real a finales de 2024, y Google ha estado avanzando en las capacidades multimodales de Gemini, que incluyen procesamiento de audio. Amazon también ha invertido fuertemente en IA de voz a través de Alexa y su plataforma Bedrock. El hilo conductor de estos esfuerzos es impulsar la voz como interfaz principal para la IA — no solo como una función, sino como una forma fundamental en que los usuarios interactúan con los modelos. El movimiento de Microsoft indica que la empresa tiene la intención de competir en este eje con su propia tecnología en lugar de licenciar la de un socio.
Si MAI-Realtime eventualmente se integra en Copilot para Microsoft 365, llegaría a usuarios empresariales en Word, Excel, Teams y Outlook. La interacción por voz en tiempo real en estas herramientas podría reducir la barrera para los usuarios que encuentran engorrosos los comandos escritos, aunque Microsoft no ha confirmado planes específicos de producto.
Las preguntas abiertas clave incluyen si MAI-Realtime avanza de la versión preliminar interna al acceso público para desarrolladores, qué tan rápido se integra en las funciones de voz existentes de Copilot, y si Microsoft comienza a publicar comparaciones de benchmarks frente a la API de voz en tiempo real de OpenAI.