新聞股票微軟預覽 MAI-Realtime:面向對話式 AI 的雙向語音模型

微軟預覽 MAI-Realtime:面向對話式 AI 的雙向語音模型

作者: CryptoBriefing·

重點速覽

  • MAI-Realtime 是一款雙向語音模型,能夠同時雙向處理音訊,實現全雙工對話,而非傳統語音系統的僵化輪替模式。
  • 微軟已組建了一個垂直整合的語音 AI 堆疊,包括負責語音辨識的 MAI-Transcribe-1、負責文字轉語音的 MAI-Voice-1,以及負責即時雙向對話的 MAI-Realtime。
  • MAI-Voice-1 能夠在單一 GPU 上於 1 秒內生成長達 1 分鐘的音訊,並且已整合到多個微軟應用程式中的 Copilot 功能。
  • 透過建立自有語音模型,微軟避免了支付第三方推論成本,並獲得了對產品路線圖和定價決策的完全控制權。
  • 微軟尚未開放 MAI-Realtime 進行公開測試、發布效能基準測試結果,也未確認將其整合到 Copilot 或其他產品的具體計畫。
微軟預覽 MAI-Realtime:面向對話式 AI 的雙向語音模型

微軟正穩步建構自身的語音 AI 技術堆疊,最新組件是 MAI-Realtime——一款目前處於內部預覽階段的雙向語音模型。該公司表示,此模型將在多種語言中提供更自然的互動體驗,並與其更廣泛的工具生態系統整合。

不同於傳統語音系統以對講機方式交替進行說話和聆聽,雙向模型能夠同時處理兩者。MAI-Realtime 即時雙向處理音訊,使互動感受更像真實對話,而非生硬或機械化的操作。這種全雙工方法反映了人類對話的實際運作方式——人們會打斷、重疊發言並在句子中途回應——而這一直是語音 AI 的技術前沿領域,在該領域中,延遲和輪替邏輯長期以來使互動感覺機械化。

MAI-Realtime 目前仍處於內部預覽階段,意味著微軟尚未對外公開測試或發布效能基準測試結果。該公司已確認的是,此模型旨在提供更自然的感受、支援多種語言,並可與現有工具搭配使用——在微軟的生態系統中,這很可能指向與 Copilot 及其生產力應用程式套件的整合。

MAI-Realtime 並非獨立存在。微軟一直在其 MAI(Microsoft AI)品牌下組建完整的語音 AI 堆疊。該公司的表達性文字轉語音模型 MAI-Voice-1 於 2025 年 8 月首次預覽,並於 2026 年 4 月進行擴展。該模型能夠在 1 秒內使用單一 GPU 生成長達 1 分鐘的音訊,並且已整合到多個微軟應用程式中的 Copilot 功能。與此同時,微軟還推出了 MAI-Transcribe-1,這是一款支援 25 種語言的語音辨識模型。

三者結合在一起,構成了一個垂直整合的語音 AI 堆疊:MAI-Transcribe-1 負責聆聽,MAI-Voice-1 負責說話,而 MAI-Realtime 實現完整的雙向對話——全部由微軟端到端掌控。對於擁有數億 Teams、Office 和 Windows 企業用戶的微軟而言,在內部掌控此堆疊意味著它可以將語音式 AI 互動深度嵌入工作流程中——從 Teams 中的即時會議轉錄和摘要到語音驅動的文件起草——而無需依賴第三方供應商的發布節奏或定價。

這種專有方法具有明確的戰略意涵。當微軟依賴 OpenAI 的語音功能時,它需要支付推論費用,受到 OpenAI 定價決策的制約,且無法控制產品路線圖。建立自有模型則徹底改變了這一局面。

競爭格局相當活躍。OpenAI 於 2024 年底推出了自有的即時語音 API,Google 則一直在推進 Gemini 的多模態能力,其中包括音訊處理。Amazon 也透過 Alexa 和其 Bedrock 平台大量投資語音 AI。這些努力的共同主線是推動語音成為 AI 的主要互動介面——不僅僅是一項功能,而是使用者與模型互動的根本方式。微軟的舉動表明,該公司打算以自有技術在這一軸線上競爭,而非授權合作夥伴的技術。

如果 MAI-Realtime 最終被納入 Copilot for Microsoft 365,它將觸及 Word、Excel、Teams 和 Outlook 中的企業用戶。在這些工具中進行即時語音互動可以降低那些覺得打字提示繁瑣的使用者的使用門檻,儘管微軟尚未確認具體的產品計畫。

關鍵的待解問題包括:MAI-Realtime 是否會從內部預覽推進到公開開發者使用、它整合到 Copilot 現有語音功能的速度有多快,以及微軟是否會開始發布與 OpenAI 即時語音 API 的基準比較結果。