Microsoft представила MAI-Realtime — бинаправленную голосовую модель для диалогового ИИ
Ключевые выводы
- •MAI-Realtime — это бинаправленная голосовая модель, которая обрабатывает аудио одновременно в обоих направлениях, обеспечивая полнодуплексные беседы вместо жесткого чередования реплик, как в традиционных голосовых системах.
- •Microsoft собрала вертикально интегрированный стек голосового ИИ, состоящий из MAI-Transcribe-1 для распознавания речи, MAI-Voice-1 для преобразования текста в речь и MAI-Realtime для бинаправленного общения в реальном времени.
- •MAI-Voice-1 способна генерировать целую минуту аудио менее чем за одну секунду на одном GPU и уже интегрирована в функции Copilot в нескольких приложениях Microsoft.
- •Создавая собственные голосовые модели, Microsoft избегает затрат на инференс сторонним разработчикам и получает полный контроль над дорожной картой продукта и решениями о ценообразовании.
- •Microsoft еще не открыла MAI-Realtime для публичного тестирования, не публиковала тесты производительности и не подтвердила конкретные планы по ее интеграции в Copilot или другие продукты.

Microsoft планомерно создает собственный стек голосового ИИ, и его новейшим компонентом является MAI-Realtime — бинаправленная голосовая модель, в настоящее время находящаяся на стадии внутреннего предварительного просмотра. Компания заявляет, что модель обеспечит более естественное взаимодействие на нескольких языках и будет интегрирована с ее более широкой экосистемой инструментов.
В отличие от традиционных голосовых систем, в которых происходит чередование говорения и слушания (как в рации), бинаправленная модель делает и то, и другое одновременно. MAI-Realtime обрабатывает аудио в реальном времени в обоих направлениях, делая взаимодействие похожим на естественную беседу, а не на жесткий или роботизированный диалог. Этот подход с полным дуплексом отражает то, как на самом деле работает человеческое общение — люди перебивают друг друга, говорят одновременно и отвечают на полуслове — и долгое время оставался технической границей для голосового ИИ, где задержки и логика очередности ответов делали взаимодействие механическим.
MAI-Realtime все еще находится на стадии внутреннего предварительного просмотра, что означает, что Microsoft еще не открыла к ней публичный доступ и не публиковала тесты производительности. Компания подтвердила, что модель разработана для более естественного восприятия, поддержки нескольких языков и совместной работы с существующими инструментами — что в экосистеме Microsoft, вероятно, указывает на интеграцию с Copilot и набором приложений для повышения продуктивности.
MAI-Realtime не существует изолированно. Microsoft собирает полный стек голосового ИИ под зонтиком MAI (Microsoft AI). MAI-Voice-1, выразительная модель преобразования текста в речь от компании, была впервые представлена в августе 2025 года, а в апреле 2026 года получила расширение. Эта модель способна генерировать целую минуту аудио менее чем за одну секунду с использованием одного графического процессора (GPU) и уже интегрирована в функции Copilot в нескольких приложениях Microsoft. Наряду с ней Microsoft представила MAI-Transcribe-1 — модель распознавания речи, поддерживающую 25 языков.
Вместе эти три модели формируют вертикально интегрированный стек голосового ИИ: MAI-Transcribe-1 отвечает за прослушивание, MAI-Voice-1 — за говорение, а MAI-Realtime обеспечивает полноценный бинаправленный диалог — всеми ими Microsoft владеет от начала до конца. Для Microsoft, у которой сотни миллионов корпоративных пользователей в Teams, Office и Windows, внутренний контроль над этим стеком означает возможность глубоко встраивать голосовое ИИ-взаимодействие в рабочие процессы — от транскрибации и суммирования совещаний в реальном времени в Teams до голосового составления документов — не завися от графика релизов или ценообразования стороннего поставщика.
Этот подход с использованием собственных технологий имеет явные стратегические последствия. Когда Microsoft полагается на голосовые возможности OpenAI, она платит за инференс, подчиняется решениям OpenAI о ценообразовании и не контролирует дорожную карту продукта. Создание собственных моделей полностью меняет этот расклад.
Конкурентная среда активна. OpenAI выпустила собственный API голосового общения в реальном времени в конце 2024 года, а Google продвигает мультимодальные возможности Gemini, включающие обработку аудио. Amazon также активно инвестирует в голосовой ИИ через Alexa и платформу Bedrock. Общая черта всех этих усилий — стремление сделать голос основным интерфейсом для ИИ, не просто функцией, а фундаментальным способом взаимодействия пользователей с моделями. Шаг Microsoft сигнализирует о том, что компания намерена конкурировать на этом направлении с использованием собственных технологий, а не лицензировать технологии партнера.
Если MAI-Realtime в конечном итоге будет встроена в Copilot для Microsoft 365, она станет доступна корпоративным пользователям в Word, Excel, Teams и Outlook. Голосовое взаимодействие в реальном времени в этих инструментах может снизить барьер для пользователей, которым неудобно использовать текстовые подсказки, хотя Microsoft еще не подтвердила конкретные планы по продуктам.
Ключевые открытые вопросы включают: перейдет ли MAI-Realtime от внутреннего предварительного просмотра к публичному доступу для разработчиков, как быстро она будет интегрирована в существующие голосовые функции Copilot и начнет ли Microsoft публиковать сравнительные тесты производительности с API голосового общения в реальном времени от OpenAI.