新闻股票微软推出自研AI模型,称相较OpenAI可削减高达89%的GPU成本

微软推出自研AI模型,称相较OpenAI可削减高达89%的GPU成本

作者: VentureBeat AI·

要点速览

  • 微软AI在公开预览中推出了MAI-Image-2.5-Pro和MAI-Voice-2-Flash,分别瞄准质量-速度-成本曲线的两端,面向高端图像生成和高并发语音应用。
  • 内部部署指标显示,微软自研模型在PowerPoint中相较OpenAI的GPT-Image-2可降低高达84%的GPU成本,在Dynamics 365 Contact Center中降幅最高达89%。
  • 微软的MAI-Code-1-Flash经Excel强化学习环境进一步训练后,据称在最常见的电子表格任务上匹敌GPT-5.6,同时可在较旧的Nvidia H100和A100 GPU上运行。
  • CEO萨蒂亚·纳德拉表示,当自有MAI模型达到或超越前沿替代方案时,微软正开始将自有平台的产品流量导向这些模型,同时将OpenAI和Anthropic模型保留为编排系统中的组件。
  • 微软正在通过Azure Foundry和Frontier Tuning将其内部模型优化方法——即"爬山"——打包为商业产品,供企业客户基于自身评估训练专用模型。
微软推出自研AI模型,称相较OpenAI可削减高达89%的GPU成本

微软AI于周三推出了两款进入公开预览的自研模型——MAI-Image-2.5-Pro,其迄今为止保真度最高的图像生成器;以及MAI-Voice-2-Flash,一款专为高并发企业工作负载设计的语音模型。在发布的同时,公司公布了生产部署数据,构成了迄今为止最有力的论据,证明其可以在不依赖OpenAI前沿模型的情况下为自有产品提供AI能力。

这项公告由微软AI超级智能团队发布,距公司承诺内部构建专用模型大约一年。公告以罕见的详细程度说明了这些模型当前的部署位置:Bing、PowerPoint、OneDrive、Dynamics 365、Excel、GitHub Copilot和Azure。向企业买家——也隐含着向OpenAI——传递的信息是,微软的自研模型已超越研究阶段,成为服务于数百万用户的生产基础设施。

"这些增强功能中的每一项都是迈向同一目标的一步:微软产品,由微软模型驱动,"公司在公告博客中写道。

MAI-Image-2.5-Pro与MAI-Voice-2-Flash瞄准成本曲线的两端

这两款新发布的模型在微软所称的质量-速度-成本曲线上占据了刻意对立的位置。

MAI-Image-2.5-Pro瞄准高端层级——核心视觉图、精细编辑和精确的图内文字渲染,后者长期以来一直是图像生成模型的显著弱点。微软将该模型定价为每百万文本输入Token $5、每百万图像输入Token $8、每百万图像输出Token $106。基础版MAI-Image-2.5模型近期在Arena上图像编辑类别排名第二,Arena是已成为生成式媒体事实标准排行榜的社区榜单。

创意行业也正在关注。广告巨头WPP的全球首席创意官Rob Reilly在微软公告中附带的声明中称Pro模型是"GenMedia工具的一次强劲飞跃",并表示"微软已牢牢确立了自身在生成式AI领域的领导者地位。"

MAI-Voice-2-Flash则走向另一方向。该模型首次在微软Build大会上预览,运行速度是MAI-Voice-2的两倍,成本低32%,定价为每百万字符$15。它专为庞大的但不够光鲜的大规模语音应用市场而设计——呼叫中心、语音助手和实时语音系统,在这些场景中延迟和单次通话成本比表达力的边际提升更为重要。这两款模型的发布共同反映了构建模型系列而非单一旗舰模型的策略,因为正如公司所言,追求最高保真度的创意工作室与每天处理数百万通电话的客服运营有着根本不同的需求。

生产数据显示自研模型可削减高达89%的GPU成本

微软在发布模型的同时公布的部署指标,读起来像是用系统性的论据来替换其产品组合中的第三方前沿模型。

Bing Image Creator现在完全端到端运行在MAI-Image-2.5上,标志着这款消费者图像工具首次完全由内部技术驱动。在PowerPoint中,微软报告MAI-Image-2.5相较OpenAI的图像模型GPT-Image-2可降低高达84%的GPU成本。在OneDrive中,MAI-Image-2.5现已成为关键图像编辑场景的默认选择,公司报告保存率提升26%、P95延迟降低约25%,在中等利用率的生产工作负载下效率提高2.5倍。

在语音方面,MAI-Voice-2-Flash现已驱动Dynamics 365 Contact Center——被包括T-Mobile和EasyJet在内的客户使用——微软声称GPU成本降低了高达89%。该模型还集成了Azure Voice Live,供开发者构建语音到语音智能体。

一项尤为重要的部署在医疗领域。微软的Dragon Copilot被170,000名医疗服务提供者使用,上季度负责处理2800万次患者就诊,现已运行MAI-Transcribe-1.5进行跨58种语言的多语言工作流程。微软表示内部评估显示,在大多数语言中,转录和语言识别错误率均实现了50%的相对降低——在这一领域中转录错误可能直接传播到临床记录中,因此这一声明显得格外重要。

小模型在Excel中匹敌GPT-5.6背后的"爬山"策略

在同一天发布的配套文章中,微软详细介绍了这些成果背后的方法论——即其所谓的"爬山机器",一个由数据、模型和围绕它们的产品"框架"组成的集成飞轮。

最清晰的例子是MAI-Code-1-Flash,这款轻量级编码模型于6月在GitHub Copilot中推出。微软表示,该模型在VS Code中的代码接受率比GPT-5.4 Mini和Claude Haiku 4.5高约10%,同时使用的Token中位数减少10%。开发者留存率呈现类似趋势:用户跨多天返回的概率比使用GPT-5.4 Mini高6%,比使用Claude Haiku 4.5高11%。

随后微软做了一件更有趣的事。他们提取了MAI-Code-1-Flash的检查点,在Excel强化学习环境中进一步训练,教会编码模型电子表格知识工作的工具和工作流程。根据生产用户反馈,结果是一个在最常见Excel任务上与GPT-5.6相当的模型——同时体量足够小,可以在Nvidia较旧的H100甚至A100 GPU上运行,而无需最新一代加速器。

这一硬件细节值得注意。在每家主要AI公司都在争夺尖端芯片配额的背景下,一个能在两代之前的芯片上提供接近前沿品质的模型从根本上改变了部署经济学。它还释放了最新硬件——包括微软现已投入运营的GB200集群——用于训练而非推理服务。

萨蒂亚·纳德拉的"前沿扩散"宣言重新定义与OpenAI的关系

微软CEO萨蒂亚·纳德拉在一篇冗长的X帖子中为这些公告定调,标题为"Frontier Diffusion & Control",读起来近乎一份战略宣言。"我们现在可以将已饱和的前沿能力,通过针对高使用量产品优化的模型,以规模化、低成本的方式交付,同时继续在需要前沿能力的场景中使用前沿模型,"纳德拉写道,并补充说微软正"开始在自有平台上,当我们的模型达到或超越前沿替代方案时,将流量导向MAI。"

纳德拉谨慎地指出,"来自OpenAI和Anthropic的前沿模型与MAI一起构成编排系统的一部分",但他同时阐述了模型独立性的原则,认为一家公司的评估"应该在任何给定模型被移除后仍能继续爬山。"将框架、记忆、上下文和技能保留在模型之外,他辩称,正是赋予微软控制力的关键。

更广阔的背景同样值得关注。路透社4月报道,微软对OpenAI技术的独家许可已被修订为非独家安排。The Information去年9月报道,微软已开始在一些产品中引入Anthropic模型。周三的公告完成了三角拼图:微软将自身定位为编排者,合作伙伴的前沿模型作为可互换组件,而自有模型则吸收越来越大部分的日常流量。

微软的举措映射了超大规模云服务商更广泛的趋势。Google一直在Workspace和Search中逐步以自有的Gemini系列替代第三方AI,而Amazon则在AWS上投资了其Nova和Titan模型线。这种趋同反映了一种认知:曾经竞争提供最佳外部模型访问的云服务商,正越来越倾向于押注与自有基础设施紧密集成的专有模型将决定谁能赢得企业AI市场。

开发者反响:热情与质疑并存

网络上的反响反映了围绕该策略的吸引力和疑虑。

"我喜欢人们用小模型做特定任务,"X用户@mavihsk在回复纳德拉的帖子时写道。"为什么我仅仅为了在Excel中改一个字段就必须用万能模型?"另一位用户@nabu_lines简洁地概括了这一主张:"当你停止过度使用最大模型时,成本和性能都会改善。"

其他人的评价则更为严厉。"微软在倾听用户反馈方面是最差的,"设计师@designedbyabin写道,认为公司"会输掉AI竞赛,因为他们反复未能理解用户需求。"用户@tokenoverflow对模型独立性的主张提出了更冷峻的批评:"我希望移除微软后它还能继续爬山。"

质疑者提出了合理的观点:微软自我报告的指标——接受率、保存率、GPU节省——来自内部评估而非独立基准测试,且公司自行选择发布哪些对比。第三方验证的缺失是一个值得关注的空白,因为来自MLCommons等组织或Arena等社区驱动平台的独立评估尚未在生产等效条件下将大多数MAI模型与前沿替代方案进行正面对比。然而,该策略的底层逻辑并不依赖于任何单一数字。纳德拉关于软件现在"首次有了真实的边际成本"的观察解释了微软为何如此执着于Token、GPU和服务成本:当AI功能在拥有十亿用户的产品组合中每次按键都在运行时,84%的GPU成本降低不仅仅是优化——它是可行业务与亏损黑洞之间的区别。

微微将其内部AI方法论转化为Azure产品

该策略的最后一个要素是,微软不仅是在卖模型,更是在卖方法论本身。纳德拉明确将爬山方法定位为"适用于每一家其他AI原生、SaaS或企业的公司的模板。"微软正在通过Foundry和其所谓的Frontier Tuning打包工具链,使企业能够基于自身专有评估和强化学习环境训练专用模型。这将微软内部的降本实践转化为Azure产品,让企业客户有理由在微软云上运行其AI工作负载,即使底层模型来自其他来源。

公司对模型训练所用"干净、可追溯、企业级数据,不使用第三方模型蒸馏"的强调服务于同样的商业目的。在训练数据来源面临日益严格审查的行业环境中——包括FTC对AI合作的调查和针对多家模型开发商的持续版权诉讼——微软押注企业买家和法院都会关心模型能力的来源。

微软表示正将爬山方法扩展至Copilot Chat、Outlook和PowerPoint。两款新模型均可通过Microsoft Foundry和MAI Playground进行公开预览。

"这一切都不是终点,"公司写道。"我们才刚刚开始。"

七年前,微软投资超过$130亿,押注OpenAI将构建AI的未来。周三的公告表明公司此后得出了不同的结论:AI的未来可能属于构建前沿的人,但利润属于让前沿变得平常的人。