新聞股票Microsoft 推出自研 AI 模型,稱相較 OpenAI 可將 GPU 成本最高降低 89%

Microsoft 推出自研 AI 模型,稱相較 OpenAI 可將 GPU 成本最高降低 89%

作者: VentureBeat AI·

重點速覽

  • Microsoft AI 推出進入公開預覽的 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,分別鎖定品質、速度與成本曲線的兩端,用於高階影像生成和高量語音應用。
  • 內部部署指標顯示,相較 OpenAI 的 GPT-Image-2,Microsoft 自研模型在 PowerPoint 中可將 GPU 成本最高降低 84%,並在 Dynamics 365 Contact Center 中最高降低 89%。
  • Microsoft 的 MAI-Code-1-Flash 在 Excel 強化學習環境中進一步訓練後,據稱在常見試算表任務上可匹敵 GPT-5.6,同時能在較舊世代的 Nvidia H100 和 A100 GPU 上運行。
  • 執行長 Satya Nadella 表示,當 Microsoft 自家 MAI 模型符合或優於前沿替代方案時,公司正開始將第一方產品流量路由至自家模型,同時保留 OpenAI 和 Anthropic 模型作為編排系統中的元件。
  • Microsoft 正透過 Azure Foundry 和 Frontier Tuning,將其名為 hill-climbing 的內部模型最佳化方法封裝為商業產品,供企業客戶依據自有評估訓練專門模型。
Microsoft 推出自研 AI 模型,稱相較 OpenAI 可將 GPU 成本最高降低 89%

Microsoft AI 週三將兩款新的自研模型推入公開預覽:MAI-Image-2.5-Pro,這是其迄今保真度最高的影像生成器;以及 MAI-Voice-2-Flash,一款為高量企業工作負載打造的語音模型。伴隨模型發布,該公司也公布了生產部署資料,構成其迄今最積極的論點:Microsoft 可以在不依賴 OpenAI 前沿模型的情況下,為自家產品提供動力。

這項公告由 Microsoft AI 的 Superintelligence 團隊發布,距離該公司承諾在內部打造專用模型約一年。公告對這些模型目前在哪些產品中運行提供了少見的具體資訊:Bing、PowerPoint、OneDrive、Dynamics 365、Excel、GitHub Copilot 和 Azure。Microsoft 向企業買家傳遞的訊息——也隱含地傳向 OpenAI——是:Microsoft 自研模型已不再只是研究項目,而是服務數百萬使用者的生產基礎設施。

「這些強化中的每一項,都是朝同一目標邁出的一步:由 Microsoft 模型驅動的 Microsoft 產品,」該公司在其公告部落格中表示。

MAI-Image-2.5-Pro 與 MAI-Voice-2-Flash 鎖定成本曲線兩端

這兩項新發布的模型,刻意分別位於 Microsoft 所稱品質、速度與成本曲線的相反兩端。

MAI-Image-2.5-Pro 瞄準高階層級——主視覺影像、細緻編輯,以及精準的圖中文字渲染;後者長期以來一直是影像生成模型的弱點。Microsoft 將該模型定價為每百萬文字輸入 token $5、每百萬影像輸入 token $8,以及每百萬影像輸出 token $106。基礎版 MAI-Image-2.5 模型近期在 Arena 的影像編輯排名中名列第 2;Arena 是社群排行榜,已成為生成式媒體領域事實上的評分板。

創意產業已開始注意到這項產品。廣告巨頭 WPP 全球首席創意長 Rob Reilly 在 Microsoft 公告所附聲明中稱 Pro 模型是「GenMedia 工具的一次重大躍進」,並補充說「Microsoft 已牢牢確立其在生成式 AI 領域領導者之一的地位。」

MAI-Voice-2-Flash 則走向另一端。Flash 首次在 Microsoft 的 Build 大會上預覽,運行速度是 MAI-Voice-2 的兩倍,成本低 32%,定價為每百萬字元 $15。它面向龐大但較不顯眼的高量語音應用市場——客服中心、語音代理,以及即時語音系統;在這些場景中,延遲與每通電話成本比表達力的邊際提升更重要。整體而言,這兩項發布反映出 Microsoft 正在建立模型家族,而不是單一旗艦模型;因為正如該公司所指出,追求最高保真度的創意工作室,與每天處理數百萬通電話的客服業務,有著根本不同的需求。

生產指標顯示自研模型最高可將 GPU 成本降低 89%

Microsoft 隨模型發布一同公布的部署指標,看起來像是在為其產品組合全面替換第三方前沿模型建立系統性論據。

Bing Image Creator 現在端到端完全運行在 MAI-Image-2.5 之上,這是該消費者影像工具首次完全由內部技術驅動。在 PowerPoint 中,Microsoft 表示,相較於 OpenAI 的影像模型 GPT-Image-2,MAI-Image-2.5 最高可將 GPU 成本降低 84%。在 OneDrive 中,MAI-Image-2.5 現已成為關鍵影像編輯情境的預設模型;該公司報告稱,儲存率提高 26%,P95 延遲約降低 25%,並在中等使用率的生產工作負載下帶來 2.5 倍效率提升。

語音方面,MAI-Voice-2-Flash 現在支援 Dynamics 365 Contact Center——其客戶包括 T-Mobile 和 EasyJet——Microsoft 稱在該平台上 GPU 成本最高可降低 89%。該模型也已整合進 Azure Voice Live,供開發者建立語音到語音代理。

特別具有影響力的一項部署位於醫療保健領域。Microsoft 的 Dragon Copilot 被 170,000 名醫療服務提供者使用,並在上一季負責處理 2,800 萬次病患就診;如今,它在涵蓋 58 種語言的多語言工作流程中運行 MAI-Transcribe-1.5。Microsoft 表示,內部評估顯示,在多數語言中,轉錄與語言識別錯誤率均相對降低 50%——考量到此領域中的轉錄錯誤可能直接進入臨床筆記,這是一項重要主張。

讓小型模型在 Excel 中匹敵 GPT-5.6 的「hill-climbing」策略

在同日發布的一篇配套文章中,Microsoft 詳細說明了這些成果背後的方法論——該公司稱之為「hill-climbing machine」,也就是由資料、模型,以及圍繞它們的產品「harness」所構成的整合式飛輪。

最清楚的例子是 MAI-Code-1-Flash,這款輕量級程式碼模型於 6 月在 GitHub Copilot 中推出。Microsoft 表示,該模型在 VS Code 中的程式碼接受率約比 GPT-5.4 Mini 和 Claude Haiku 4.5 高 10%,同時中位 token 使用量少 10%。開發者留存也呈現類似模式:相較 GPT-5.4 Mini,使用者跨多日回訪的可能性高 6%;相較 Claude Haiku 4.5,則高 11%。

接著,Microsoft 將 MAI-Code-1-Flash 的 checkpoint 置於 Excel 強化學習環境中進一步訓練,讓一個程式碼模型學會試算表知識工作的工具與工作流程。根據生產環境使用者回饋,其結果是一款在最常見 Excel 任務上與 GPT-5.6 相當的模型——同時規模小到可在 Nvidia 較舊的 H100,甚至 A100 GPU 上運行,而不需要最新一代加速器。

這項硬體細節值得注意。當所有主要 AI 公司都在爭奪尖端晶片配額時,一款能在相隔兩代的矽晶片上提供接近前沿品質的模型,從根本上改變了部署經濟學。它也釋放出最新硬體——包括 Microsoft 現已投入運作的 GB200 叢集——用於訓練,而不是推論服務。

Satya Nadella 的「Frontier Diffusion」宣言重塑與 OpenAI 的關係

Microsoft 執行長 Satya Nadella 在一篇標題為「Frontier Diffusion & Control」的長篇 X 貼文中定位這些公告;該文讀起來像是一份策略宣言。Nadella 寫道:「我們現在可以取得已飽和的前沿能力,透過針對高使用量產品最佳化的模型,以規模化且更低成本的方式交付,同時繼續在前沿需求上使用前沿模型。」他並補充說,Microsoft 正「開始在我們的第一方介面中,於自家模型符合或超越前沿替代方案時,將流量路由至 MAI。」

Nadella 謹慎指出,「來自 OpenAI 和 Anthropic 的前沿模型是與 MAI 並列的編排系統一部分」,但他也提出了一項模型獨立性的原則,主張公司的評估「即使在移除任何特定模型後,也應繼續 hill climb」。他認為,將 harness、記憶、情境和技能保留在模型之外,正是讓 Microsoft 掌握控制權的關鍵。

更廣泛的背景也很重要。Reuters 4 月報導,Microsoft 對 OpenAI 技術的獨家授權已被修訂為非獨家安排。The Information 去年 9 月報導,Microsoft 已開始將 Anthropic 模型納入部分產品。週三的公告補上了這個三角形:Microsoft 將自己定位為編排者,把合作夥伴的前沿模型視為可替換元件,同時讓自家模型吸收愈來愈大比例的常規流量。

Microsoft 的舉措也呼應了超大規模雲端業者之間更廣泛的趨勢。Google 一直在 Workspace 和 Search 中逐步以自家 Gemini 系列取代第三方 AI,而 Amazon 則為 AWS 投資 Nova 和 Titan 模型系列。這種趨同反映出一項認知:曾經競相提供最佳外部模型存取的雲端供應商,正愈來愈相信,與自家基礎設施緊密整合的專有模型,將決定誰能掌握企業 AI 市場。

開發者反應:支持與質疑並存

線上反應反映了這項策略的吸引力,也呈現外界的疑慮。

「我喜歡人們把小模型用於利基任務,」X 使用者 @mavihsk 回應 Nadella 的貼文時寫道。「為什麼我只是想在 Excel 裡改欄位,就必須使用全知模型?」另一位使用者 @nabu_lines 概括了這項主張:「當你停止過度使用最大模型時,成本和效能都會改善。」

其他人則更為批判。「Microsoft 在聆聽使用者回饋方面是最糟的,」設計師 @designedbyabin 寫道,並主張該公司「會輸掉 AI 競賽,因為他們一再未能理解使用者需求。」使用者 @tokenoverflow 則以更冷調的方式批評模型獨立性的說法:「i want it keep hill climbing after removing microsoft.」

質疑者提出了一個有效觀點:Microsoft 自行公布的指標——接受率、儲存率、GPU 節省幅度——來自內部評估,而非獨立基準測試,且該公司會選擇要發布哪些比較。缺乏第三方驗證是一個值得關注的缺口,因為 MLCommons 等組織或 Arena 這類社群驅動平台,尚未在等同生產環境的條件下,對多數 MAI 模型與前沿替代方案進行面對面評估。不過,這項策略的底層邏輯並不取決於任何單一數字。Nadella 關於軟體如今「首次具有真正邊際成本」的觀察,解釋了 Microsoft 為何專注於 token、GPU 和服務成本:當 AI 功能在一個擁有十億使用者的產品組合中,隨每一次按鍵而運行時,84% 的 GPU 成本降低不只是最佳化——它是可行業務與燒錢黑洞之間的差異。

Microsoft 將內部 AI 方法論轉化為 Azure 產品

這項策略的最後一個要素是,Microsoft 銷售的不只是模型,而是方法論本身。Nadella 明確將 hill-climbing 方法定位為「每一家 AI 原生、SaaS 或企業公司的範本」。Microsoft 正透過 Foundry 及其所稱的 Frontier Tuning 封裝這套工具鏈,使企業能依據自有專有評估和強化學習環境訓練專門模型。這把 Microsoft 內部的成本削減實驗轉化為 Azure 產品,也讓企業客戶即使底層模型來自其他來源,仍有理由在 Microsoft 雲端上運行其 AI 工作負載。

該公司強調模型是在「乾淨、可追溯、企業級資料上訓練,且未從第三方模型蒸餾而來」,服務於同樣的商業目標。在一個訓練資料來源正面臨日益嚴格審視的產業中——包括 FTC 對 AI 夥伴關係的調查,以及針對多家模型開發商的持續著作權訴訟——Microsoft 正押注企業買家和法院都會在意模型能力來自何處。

Microsoft 表示,現在正將 hill-climbing 方法擴展至 Copilot Chat、Outlook 和 PowerPoint。兩款新模型均可透過 Microsoft Foundry 和 MAI Playground 公開預覽。

「這一切都不是終點,」該公司寫道。「我們才剛開始。」

七年前,Microsoft 投資超過 $13 billion,押注 OpenAI 將打造 AI 的未來。週三的公告顯示,該公司此後得出了另一個結論:AI 的未來或許屬於打造前沿的人,但利潤屬於讓它變得日常的人。