新闻股票微软预览MAI-Realtime:面向对话式AI的双向语音模型

微软预览MAI-Realtime:面向对话式AI的双向语音模型

作者: CryptoBriefing·

要点速览

  • MAI-Realtime是一款双向语音模型,可同时双向处理音频,实现全双工对话,而非传统语音系统那种僵化的轮次切换。
  • 微软已构建了一套垂直整合的语音AI技术栈,包括用于语音识别的MAI-Transcribe-1、用于文本转语音的MAI-Voice-1,以及用于实时双向对话的MAI-Realtime。
  • MAI-Voice-1可在单个GPU上不到一秒内生成一整分钟的音频,并已集成到多个微软应用中的Copilot功能中。
  • 通过自建语音模型,微软避免了向第三方支付推理费用,并在产品路线图和定价决策上获得了完全的自主权。
  • 微软尚未向公众开放MAI-Realtime的测试,未发布性能基准数据,也未确认将其集成到Copilot或其他产品的具体计划。
微软预览MAI-Realtime:面向对话式AI的双向语音模型

微软正在稳步构建自己的语音AI技术栈,最新组件是MAI-Realtime——一款目前处于内部预览阶段的双向语音模型。该公司表示,该模型将跨多种语言提供更自然的交互体验,并与更广泛的工具生态系统集成。

不同于传统语音系统以对讲机方式交替进行说和听,双向模型可同时处理两者。MAI-Realtime实时双向处理音频,使交互感觉更像真实对话,而非生硬的机械式交流。这种全双工方式模拟了人类对话的真实运作方式——人们会打断、重叠发言并在句中回应——这长期以来一直是语音AI的技术前沿,延迟和轮次切换逻辑一直使交互感觉机械化。

MAI-Realtime仍处于内部预览阶段,意味着微软尚未向公众开放测试,也未发布性能基准数据。该公司已确认的是,该模型旨在提供更自然的体验、支持多种语言,并能与现有工具协同工作——在微软的生态系统内,这可能意味着与Copilot及其生产力应用套件的集成。

MAI-Realtime并非孤立存在。微软一直在其MAI(Microsoft AI)品牌下构建完整的语音AI技术栈。MAI-Voice-1是该公司具有表现力的文本转语音模型,于2025年8月首次预览,并于2026年4月进行了扩展。该模型使用单个GPU即可在不到一秒内生成一整分钟的音频,并已集成到多个微软应用中的Copilot功能中。与此同时,微软还推出了MAI-Transcribe-1,一款支持25种语言的语音识别模型。

三者结合,构成了一个垂直整合的语音AI技术栈:MAI-Transcribe-1负责听,MAI-Voice-1负责说,MAI-Realtime实现完整的双向对话——全部由微软端到端自主拥有。对于拥有数亿Teams、Office和Windows企业用户的微软而言,内部掌控这一技术栈意味着它可以将基于语音的AI交互深度嵌入工作流程——从Teams中的实时会议转录和摘要,到语音驱动的文档起草——而无需依赖第三方提供商的发布节奏或定价。

这一自有战略具有明确的战略意义。当微软依赖OpenAI的语音能力时,它需要支付推理费用,受制于OpenAI的定价决策,且无法掌控产品路线图。自建模型从根本上改变了这一局面。

竞争格局十分活跃。OpenAI于2024年底发布了自有的实时语音API,Google也一直在推进Gemini的多模态能力(包含音频处理)。Amazon同样通过Alexa及其Bedrock平台在语音AI领域大力投入。这些努力的共同主线是推动语音成为AI的主要交互界面——不仅仅是一项功能,而是用户与模型交互的基本方式。微软的举措表明,该公司有意凭借自有技术在这一维度上竞争,而非授权使用合作伙伴的技术。

如果MAI-Realtime最终被整合到Microsoft 365的Copilot中,它将覆盖Word、Excel、Teams和Outlook的企业用户。这些工具中的实时语音交互可以降低那些觉得键盘输入繁琐的用户的使用门槛,不过微软尚未确认具体的产品计划。

关键的待解问题包括:MAI-Realtime是否会从内部预览推进到公开开发者访问,它将以多快的速度集成到Copilot现有的语音功能中,以及微软是否会开始发布与OpenAI实时语音API的基准对比数据。