新聞股票小米開放 MiMo Desktop 邀請制測試,成為首家提供電腦操作能力的中國實驗室

小米開放 MiMo Desktop 邀請制測試,成為首家提供電腦操作能力的中國實驗室

作者: Metaverse Post·

重點速覽

  • 小米推出 MiMo Desktop 的邀請制 beta,成為首家透過旗艦模型向用戶提供電腦操作能力的中國實驗室。
  • MiMo Desktop 接受試算表、圖片、影片與 PDF 等多格式輸入,並產出可編輯成果,包括文件、簡報、3D 模型與軟體專案。
  • 海外版本提供完整電腦控制,可讀取螢幕內容並跨應用程式操作鍵盤與滑鼠,具備內建結果驗證與錄製與重播功能。
  • 系統採用智慧調度,依複雜度與成本在標準模型與旗艦模型之間路由任務,快取最佳化在工作階段內命中率可達 99%。
  • 小米的技術基礎包括開源模型 MiMo-VL-7B,曾在 OSWorld-G GUI 定位基準測試創下 56.1 分紀錄,其旗艦模型 MiMo-V2-Pro 目前在代理基準測試上與 Claude 4.5 Sonnet、GPT-5.2 和 Gemini 3.0 Pro 同級。
小米開放 MiMo Desktop 邀請制測試,成為首家提供電腦操作能力的中國實驗室

小米已為 MiMo Desktop 啟動邀請制測試。這是一款桌面 AI 應用程式,旨在執行完整的工作流程,而非在聊天介面中產生回應。透過此次發布,這家中國科技公司成為首家透過其旗艦模型向用戶提供電腦操作能力的中國實驗室。此舉使小米進入一個西方實驗室率先布局的領域:Anthropic 於 2024 年底將電腦操作作為 Claude 的標準 API 功能推出,OpenAI、Google 等公司隨後也發布了可操作瀏覽器與桌面的代理,因此小米的加入作為首家來自中國實驗室的業者格外引人注目。

現實世界的工作很少從定義完善的提示詞開始,通常涉及試算表、圖片、影片、PDF 文件、錄音與壓縮檔,這些共同構成任務的背景資料。MiMo Desktop 可直接接受這些多格式輸入,無需事先整理或轉換格式。用戶以自然語言描述目標,系統便會解讀資料、拆解任務、呼叫適當的工具,並產出可編輯的成果——包括文件、試算表、簡報、網頁、音訊、影片、3D 模型與軟體工程專案。

兩項設計決策使該產品脫穎而出。首先,結果預覽並非靜態渲染,而是完全互動的可交付成果,涵蓋組件結構、互動邏輯與資料視覺化。無論輸出是資料儀表板、遊戲原型還是簡報,用戶都能在工作階段內操作與修改。其次,修改採選取方式進行:用戶選取圖表、段落或區域,描述想要的變更,系統便只重新生成該部分。每次修改都會保存在版本歷史中,讓用戶可比較草稿並回溯至先前的狀態。

系統還具備「智慧」調度功能。MiMo Desktop 不需用戶手動選擇模型,而是評估任務類型、複雜度與成本需求,將例行工作分配給標準模型以追求速度,將複雜的多步驟任務分配給旗艦模型以獲得更高的輸出品質。大型任務可分散到多個代理工作階段協同合作,同時保持各自獨立的記憶與工作區。小米表示,快取最佳化在長任務的工作階段內可達到高達 99% 的命中率,減少冗餘運算並控制營運成本。

瀏覽器與電腦控制為核心能力

此次發布的第二個層面是控制。MiMo Desktop 將瀏覽器同時作為資訊來源與執行環境:它能開啟網頁、檢索資訊、填寫表單、擷取素材,並將結果直接匯入任務。在產出網頁形式的成果時,系統還能在工作流程中透過瀏覽器驗證交付成果。

最重要的功能是海外版本提供的完整電腦控制。MiMo Desktop 會讀取螢幕內容,並跨應用程式操作鍵盤與滑鼠——開啟檔案、驗證資料、在程式之間傳輸資訊——並內建結果驗證機制,必要時可觸發修正或中止執行。針對穩定且重複的流程,錄製與重播(Record & Replay)功能讓用戶示範一次工作流程,之後即可透過自然語言指令讓系統重新執行。

這反映了一種深思熟慮的架構取向:桌面被視為作業環境,模型則是其中的代理,而非疊加在現有應用程式之上的語言介面。

#‌# 一年磨一劍:小米如何為電腦操作建立技術基礎

電腦操作能力本質上並非介面問題,而是技術問題,而小米已投入一年以上開發其底層基礎。這項基礎於 2025 年中奠定,即該公司的開源視覺語言模型 MiMo-VL-7B,它在 OSWorld-G(GUI 定位的標準基準測試)上取得當時創紀錄的 56.1 分,超越了專為此任務開發的模型如 UI-TARS。這項能力是透過涵蓋行動裝置、網頁與桌面介面的四階段訓練管線所開發,並輔以大量中文 GUI 資料集,以及一項從前後截圖推斷中間動作的訓練任務——正是電腦操作代理所需的感知基礎。

模型譜系持續演進。到 2026 年初,小米的旗艦模型 MiMo-V2-Pro 在編碼代理、通用代理與工具使用基準測試上,與 Claude 4.5 Sonnet、GPT-5.2 和 Gemini 3.0 Pro 同級。這讓桌面用戶端在處理複雜任務時擁有頂尖模型,同時路由層為例行操作維持成本效益。此外,小米在消費性硬體與軟體生態系統方面擁有逾二十年經驗,這反映在產品專注於用戶桌面環境的實際條件,而非僅追求基準測試表現。

對 AI 產業的觀察者而言,此次發布象徵評估標準的更廣泛轉變:前沿正從推理基準測試轉向操作能力——能填寫表單、驗證自身輸出並控制在既定運算預算內的代理。小米結合 GUI 定位模型、前沿級旗艦模型與現已進入 beta 階段的電腦操作介面,使其躋身自主桌面代理新興類別中的領先競爭者。接下來值得關注的是,這項邀請制 beta 在受控基準測試之外的真實桌面上表現如何——其他實驗室的電腦操作代理已展現此形式的潛力,同時也顯露多步驟工作流程上的可靠性挑戰——以及小米是否會將 beta 開放給海外版本完整電腦控制之外的更廣泛用戶。

來源:Metaverse Post