新闻股票小米开放MiMo Desktop邀请制测试,成为首家提供计算机使用能力的中国实验室

小米开放MiMo Desktop邀请制测试,成为首家提供计算机使用能力的中国实验室

作者: Metaverse Post·

要点速览

  • 小米推出了MiMo Desktop邀请制测试版,成为首家通过其旗舰模型向用户提供计算机使用能力的中国实验室。
  • MiMo Desktop接受电子表格、图片、视频和PDF等多格式输入,并交付包括文档、演示文稿、3D模型和软件项目在内的可编辑输出。
  • 海外版本提供完整计算机控制,可读取屏幕内容并跨应用程序操作键盘和鼠标,内置结果验证以及“录制与重放”功能。
  • 该系统采用智能调度,根据复杂度和成本在标准模型与旗舰模型之间路由任务,缓存优化在会话内可实现高达99%的命中率。
  • 小米的技术基础包括在OSWorld-G GUI定位基准上创下当时纪录56.1分的开源模型MiMo-VL-7B,其旗舰模型MiMo-V2-Pro目前在智能体基准测试中与Claude 4.5 Sonnet、GPT-5.2和Gemini 3.0 Pro处于同一梯队。
小米开放MiMo Desktop邀请制测试,成为首家提供计算机使用能力的中国实验室

小米已开放MiMo Desktop的邀请制测试,这是一款旨在执行完整工作流程而非在聊天界面中生成回复的桌面AI应用。通过此次发布,这家中国科技公司成为首家通过其旗舰模型向用户提供计算机使用能力的中国实验室。此举使小米进入了一个西方实验室率先布局的领域:Anthropic于2024年底将计算机使用作为Claude的标准API能力推出,此后OpenAI、谷歌等公司也相继推出可操作浏览器和桌面的智能体,因此小米的入场作为首家中国实验室的举措格外引人注目。

现实中的工作很少从一个定义明确的提示词开始。它通常涉及电子表格、图片、视频、PDF文档、音频录音和压缩文件,这些内容共同构成了任务的上下文。MiMo Desktop可直接接受这些多格式输入,无需事先整理或格式转换。用户用自然语言描述目标,系统随后解析材料、分解任务、调用合适的工具,并交付可编辑的输出——包括文档、电子表格、演示文稿、网页、音频、视频、3D模型和软件工程项目。

两项设计决策使该产品脱颖而出。首先,结果预览并非静态渲染,而是一个包含组件结构、交互逻辑和数据可视化的完全可交互交付物。用户可在会话中对其进行操作和修改,无论输出是数据仪表盘、游戏原型还是演示文稿。其次,修改通过选定区域进行:用户高亮某个图表、段落或区域,描述所需的更改,系统仅重新生成该部分。每次修改都会保存在版本历史中,允许用户比较草稿并回滚到早期状态。

该系统还具备“智能”调度功能。MiMo Desktop无需用户手动选择模型,而是评估任务类型、复杂度和成本要求,将常规工作路由到标准模型以获得速度,将复杂的多步骤任务路由到旗舰模型以获得更高的输出质量。大型任务可分布在多个智能体会话中协同完成,同时保持独立的记忆和工作区。小米报告称,缓存优化在长任务的会话内可实现高达99%的命中率,从而减少冗余计算并控制运营成本。

浏览器与计算机控制作为核心能力

此次发布的第二个维度关乎控制。MiMo Desktop将浏览器同时作为信息源和执行环境来操作:它打开网页、检索信息、填写表单、提取资源,并将结果直接导入任务中。在生成基于网页的输出时,系统还可在工作流程中通过浏览器验证交付成果。

最重要的功能是完整计算机控制,该功能在海外版本中提供。MiMo Desktop读取屏幕内容,并跨应用程序操作键盘和鼠标——打开文件、验证数据、在程序之间传输信息——同时内置结果验证,可在必要时触发纠正或停止执行。对于稳定的重复性流程,“录制与重放”(Record & Replay)功能允许用户演示一次工作流程,然后让系统通过自然语言指令重新执行它。

这体现了一种深思熟虑的架构方法:桌面被视为操作环境,模型在其中作为智能体运行,而不是叠加在现有应用之上的语言界面。

一年磨一剑:小米如何为计算机使用构建技术基础

计算机使用能力主要不是界面问题,而是技术问题,小米开发其底层基础已超过一年。基础工作于2025年年中奠定,小米发布了开源视觉语言模型MiMo-VL-7B,该模型在OSWorld-G(GUI定位的标准基准测试)上取得了当时创纪录的56.1分,超越了UI-TARS等专门为此任务开发的模型。这一能力通过覆盖移动、网页和桌面界面的四阶段训练流水线开发而成,同时结合了大量中文GUI数据语料库,以及一个通过前后截图推断中间动作的训练任务——这正是一个计算机使用智能体所需的感知基础。

模型谱系持续演进。到2026年初,小米的旗舰模型MiMo-V2-Pro在编程智能体、通用智能体和工具使用基准测试中与Claude 4.5 Sonnet、GPT-5.2和Gemini 3.0 Pro处于同一梯队。这为桌面客户端提供了处理复杂任务的顶级模型,同时路由层为常规操作保持成本效率。此外,小米在消费级硬件和软件生态系统方面拥有二十余年的经验,这体现在产品专注于用户桌面环境的实际条件,而不仅仅是基准性能。

对于AI行业的观察者而言,此次发布标志着评估标准的更广泛转变:前沿正从推理基准转向操作能力——即能够填写表单、验证自身输出并保持在既定算力预算内的智能体。小米将GUI定位模型、前沿级旗舰模型和现已进入测试阶段的计算机使用界面相结合,使其成为自主桌面智能体这一新兴类别中的领先竞争者之一。接下来值得关注的是邀请制测试在受控基准之外的真实桌面上的表现——其他实验室的计算机使用智能体已经展示了这一形式的潜力,同时也暴露了在多步骤工作流上的可靠性挑战——以及小米是否会在海外版本的完整计算机控制之外,向更广泛的用户开放测试。

来源:Metaverse Post