ActualitésActionsMicrosoft présente MAI-Realtime, un modèle vocal bidirectionnel pour l'IA conversationnelle

Microsoft présente MAI-Realtime, un modèle vocal bidirectionnel pour l'IA conversationnelle

Auteur: CryptoBriefing·

Points clés

  • MAI-Realtime est un modèle vocal bidirectionnel qui traite l'audio dans les deux sens simultanément, permettant des conversations en duplex intégral plutôt que le système rigide de tours de parole des systèmes vocaux traditionnels.
  • Microsoft a assemblé une pile d'IA vocale verticalement intégrée composée de MAI-Transcribe-1 pour la reconnaissance vocale, MAI-Voice-1 pour la synthèse vocale, et MAI-Realtime pour la conversation bidirectionnelle en temps réel.
  • MAI-Voice-1 peut générer une minute complète d'audio en moins d'une seconde sur un seul GPU et a déjà été intégré aux fonctionnalités Copilot dans plusieurs applications Microsoft.
  • En construisant ses propres modèles vocaux, Microsoft évite de payer les coûts d'inférence de tiers et obtient un contrôle total sur sa feuille de route produit et ses décisions tarifaires.
  • Microsoft n'a pas encore ouvert MAI-Realtime aux tests publics, ni publié de benchmarks de performances, ni confirmé de plans spécifiques pour l'intégrer à Copilot ou à d'autres produits.
Microsoft présente MAI-Realtime, un modèle vocal bidirectionnel pour l'IA conversationnelle

Microsoft construit progressivement sa propre pile d'IA vocale, et le nouvel élément est MAI-Realtime, un modèle vocal bidirectionnel actuellement en prévisualisation interne. L'entreprise indique que le modèle offrira des interactions plus naturelles dans plusieurs langues et s'intégrera à son écosystème d'outils plus large.

Contrairement aux systèmes vocaux traditionnels qui alternent entre la parole et l'écoute à la manière d'un talkie-walkie, un modèle bidirectionnel gère les deux simultanément. MAI-Realtime traite l'audio en temps réel dans les deux sens, permettant des interactions qui semblent conversationnelles plutôt que rigides ou robotisées. Cette approche en duplex intégral reproduit le fonctionnement réel de la conversation humaine — les gens s'interrompent, se chevauchent et répondent en plein milieu d'une phrase — et constitue une frontière technique pour l'IA vocale, où la latence et la logique de prise de parole ont longtemps rendu les interactions mécaniques.

MAI-Realtime reste en phase de prévisualisation interne, ce qui signifie que Microsoft ne l'a pas encore ouvert aux tests publics ni publié de benchmarks de performances. Ce que l'entreprise a confirmé, c'est que le modèle est conçu pour paraître plus naturel, prendre en charge plusieurs langues et fonctionner aux côtés des outils existants — ce qui, dans l'écosystème de Microsoft, pointe probablement vers une intégration avec Copilot et sa suite d'applications de productivité.

MAI-Realtime n'existe pas isolément. Microsoft a assemblé une pile complète d'IA vocale sous sa marque MAI (Microsoft AI). MAI-Voice-1, le modèle de synthèse vocale expressif de l'entreprise, a d'abord été présenté en prévisualisation en août 2025, puis étendu en avril 2026. Ce modèle peut produire une minute complète d'audio en moins d'une seconde à l'aide d'un seul GPU et a déjà été intégré aux fonctionnalités Copilot dans plusieurs applications Microsoft. À côté de celui-ci, Microsoft a introduit MAI-Transcribe-1, un modèle de reconnaissance vocale prenant en charge 25 langues.

Ensemble, les trois modèles forment une pile d'IA vocale verticalement intégrée : MAI-Transcribe-1 gère l'écoute, MAI-Voice-1 gère la parole, et MAI-Realtime permet une conversation bidirectionnelle complète — le tout détenu par Microsoft de bout en bout. Pour Microsoft, qui compte des centaines de millions d'utilisateurs professionnels sur Teams, Office et Windows, contrôler cette pile en interne signifie qu'elle peut intégrer profondément les interactions IA basées sur la voix dans les flux de travail — de la transcription et la synthèse de réunions en direct dans Teams à la rédaction de documents pilotée par la voix — sans dépendre du rythme de publication ou de la tarification d'un prestataire tiers.

Cette approche propriétaire comporte des implications stratégiques claires. Lorsque Microsoft s'appuie sur les capacités vocales d'OpenAI, elle paie pour l'inférence, reste soumise aux décisions tarifaires d'OpenAI et ne contrôle pas la feuille de route du produit. Construire ses propres modèles change entièrement cette donne.

Le paysage concurrentiel est actif. OpenAI a publié sa propre API vocale en temps réel fin 2024, et Google a fait progresser les capacités multimodales de Gemini, qui incluent le traitement audio. Amazon a également investi massivement dans l'IA vocale via Alexa et sa plateforme Bedrock. Le fil conducteur de ces efforts est une poussée vers la voix comme interface principale de l'IA — non pas simplement une fonctionnalité, mais un mode fondamental d'interaction entre les utilisateurs et les modèles. L'initiative de Microsoft indique que l'entreprise a l'intention de rivaliser sur cet axe avec sa propre technologie plutôt que d'exploiter sous licence celle d'un partenaire.

Si MAI-Realtime est finalement intégré à Copilot pour Microsoft 365, il atteindrait les utilisateurs professionnels de Word, Excel, Teams et Outlook. L'interaction vocale en temps réel dans ces outils pourrait abaisser la barrière pour les utilisateurs qui trouvent les invites saisies fastidieuses, bien que Microsoft n'ait pas confirmé de plans produits spécifiques.

Les questions clés en suspens portent sur le passage éventuel de MAI-Realtime de la prévisualisation interne à un accès public pour les développeurs, la rapidité de son intégration dans les fonctionnalités vocales existantes de Copilot, et la publication éventuelle par Microsoft de comparatifs de benchmarks face à l'API vocale en temps réel d'OpenAI.