Xiaomi otwiera zamkniętą betę MiMo Desktop, stając się pierwszym laboratorium z Chin oferującym funkcję computer use
Najważniejsze informacje
- •Xiaomi uruchomiło zamkniętą betę MiMo Desktop, stając się pierwszym laboratorium z Chin oferującym możliwości computer use użytkownikom za pośrednictwem flagowych modeli.
- •MiMo Desktop przyjmuje wieloformatowe dane, takie jak arkusze kalkulacyjne, obrazy, wideo i PDF-y, i dostarcza edytowalne rezultaty, w tym dokumenty, prezentacje, modele 3D i projekty programistyczne.
- •Wersja zagraniczna zapewnia pełną kontrolę nad komputerem: agent odczytuje zawartość ekranu i operuje klawiaturą oraz myszą w różnych aplikacjach, z wbudowaną weryfikacją rezultatów i funkcją Record & Replay.
- •System stosuje inteligentne kierowanie zadań między modelami standardowymi i flagowymi w oparciu o złożoność i koszty, a optymalizacja cache osiąga wskaźnik trafień do 99% w ramach sesji.
- •Podstawy Xiaomi obejmują otwarty model MiMo-VL-7B, który ustanowił wówczas rekordowy wynik 56.1 na benchmarku GUI grounding OSWorld-G, a flagowy MiMo-V2-Pro plasuje się obecnie w tej samej lidze co Claude 4.5 Sonnet, GPT-5.2 i Gemini 3.0 Pro w benchmarkach agentowych.

Xiaomi uruchomiło testy w wersji invitation-only dla MiMo Desktop — desktopowej aplikacji AI zaprojektowanej do wykonywania pełnych przepływów pracy, a nie do generowania odpowiedzi w interfejsie czatu. wraz z tym wydaniem chińska firma technologiczna staje się pierwszym laboratorium z Chin, które oferuje użytkownikom możliwości computer use za pośrednictwem swoich flagowych modeli. Posunięcie to umieszcza Xiaomi w kategorii, w której zachodnie laboratoria były pierwsze: Anthropic wprowadziło computer use jako standardową funkcję API dla Claude pod koniec 2024 roku, a OpenAI, Google i inni od tego czasu wypuścili agentów operujących przeglądarką i pulpitem, dzięki czemu wejście Xiaomi jest godne uwagi jako pierwsze ze strony laboratorium z Chin.
Prawdziwa praca rzadko zaczyna się od dobrze zdefiniowanego promptu. Zwykle obejmuje arkusze kalkulacyjne, obrazy, wideo, dokumenty PDF, nagrania audio i pliki skompresowane, które razem tworzą kontekst zadania. MiMo Desktop przyjmuje te wieloformatowe dane bezpośrednio, bez wcześniejszej organizacji ani konwersji formatów. Użytkownicy opisują swoje cele w języku naturalnym, a system interpretuje materiały, rozbija zadanie na części, uruchamia odpowiednie narzędzia i dostarcza edytowalne rezultaty — w tym dokumenty, arkusze kalkulacyjne, prezentacje, strony internetowe, audio, wideo, modele 3D i projekty inżynierii oprogramowania.
Dwie decyzje projektowe wyróżniają produkt. Po pierwsze, podgląd wyniku nie jest statycznym renderingiem, lecz w pełni interaktywnym produktem zawierającym strukturę komponentów, logikę interakcji i wizualizację danych. Użytkownicy mogą nim operować i wprowadzać zmiany w trakcie sesji — niezależnie od tego, czy wynikiem jest dashboard danych, prototyp gry czy prezentacja. Po drugie, modyfikacje dokonywane są przez zaznaczenie: użytkownik podświetla wykres, akapit lub obszar, opisuje pożądaną zmianę i tylko ta część jest generowana ponownie. Każda korekta jest zapisywana w historii wersji, co pozwala porównywać wersje robocze i cofać się do wcześniejszych stanów.
System oferuje również "inteligentne" harmonogramowanie („Smart” scheduling). Zamiast wymagać ręcznego wyboru modelu, MiMo Desktop ocenia typ zadania, jego złożoność i wymagania kosztowe, kierując rutynowe prace do standardowych modeli dla szybkości, a złożone, wieloetapowe zadania do modeli flagowych dla wyższej jakości rezultatów. Duże zadania mogą być rozdzielane między wiele sesji agentów, które współpracują, zachowując niezależną pamięć i przestrzenie robocze. Xiaomi podaje, że optymalizacja cache osiąga wskaźniki trafień sięgające 99% w ramach sesji przy długich zadaniach, co ogranicza redundantne obliczenia i kontroluje koszty operacyjne.
Kontrola przeglądarki i komputera jako kluczowe możliwości
Drugi wymiar wydania dotyczy kontroli. MiMo Desktop obsługuje przeglądarkę zarówno jako źródło informacji, jak i środowisko wykonawcze: otwiera strony, pobiera informacje, wypełnia formularze, pobiera zasoby i importuje wyniki bezpośrednio do zadania. Przy tworzeniu rezultatów opartych na sieci system może dodatkowo weryfikować efekty pracy przez przeglądarkę w trakcie przepływu.
Najważniejszą funkcją jest pełna kontrola nad komputerem, dostępna w wersji zagranicznej. MiMo Desktop odczytuje zawartość ekranu i operuje klawiaturą oraz myszą w różnych aplikacjach — otwiera pliki, weryfikuje dane i przesyła informacje między programami — z wbudowaną weryfikacją rezultatów, która może uruchamiać korekty lub w razie potrzeby zatrzymać wykonanie. Dla stabilnych, powtarzalnych procesów funkcja Record & Replay pozwala użytkownikowi zademonstrować przepływ pracy raz, a system wykona go ponownie na podstawie instrukcji w języku naturalnym.
Odbija to przemyślane podejście architektoniczne: pulpit traktowany jest jako środowisko operacyjne, a model funkcjonuje jako agent w jego ramach, a nie jako warstwa językowa nałożona na istniejące aplikacje.
Rok pracy: jak Xiaomi zbudowało techniczne podstawy dla computer use
Możliwość computer use to przede wszystkim problem techniczny, a nie interfejsowy, i Xiaomi rozwija fundamenty od ponad roku. Podstawy położono w połowie 2025 roku wraz z MiMo-VL-7B, firmowym otwartym modelem wizyjno-językowym, który osiągnął wówczas rekordowy wynik 56.1 na OSWorld-G — standardowym benchmarku dla GUI grounding — wyprzedzając modele budowane specjalnie do tego zadania, takie jak UI-TARS. Możliwość tę rozwinięto dzięki czteroetapowemu procesowi treningowemu obejmującemu interfejsy mobilne, internetowe i desktopowe, wraz ze znacznym korpusem chińskich danych GUI oraz zadaniem treningowym polegającym na wnioskowaniu akcji pośrednich na podstawie zrzutów ekranu „przed i po” — dokładnie takiej percepcyjnej podstawy, jakiej wymaga agent computer use.
Linia modeli stale się rozwijała. Na początku 2026 roku flagowy MiMo-VL-7B następca — MiMo-V2-Pro Xiaomi — plasował się w tej samej lidze co Claude 4.5 Sonnet, GPT-5.2 i Gemini 3.0 Pro w benchmarkach agentów kodujących, ogólnych agentów i korzystania z narzędzi. Dzięki temu klient Desktop dysponuje modelem najwyższej klasy dla złożonych zadań, podczas gdy warstwa routingu utrzymuje efektywność kosztową przy operacjach rutynowych. Xiaomi wnosi też ponad dwie dekady doświadczenia w ekosystemach sprzętu i oprogramowania konsumenckiego, co znajduje odzwierciedlenie w skupieniu produktu na praktycznych warunkach środowiska desktopowego użytkownika, a nie wyłącznie na wynikach benchmarków.
Dla obserwatorów sektora AI wydanie to sygnalizuje szerszą zmianę kryteriów oceny: granica możliwości przesuwa się od benchmarków rozumowania ku kompetencjom operacyjnym — agentom, którzy wypełniają formularze, weryfikują własne wyniki i mieszczą się w określonych budżetach obliczeniowych. Połączenie u Xiaomi modeli GUI-grounding, flagowego modelu klasy frontier oraz interfejsu computer use dostępnego obecnie w becie plasuje firmę wśród czołowych kandydatów w rodzącej się kategorii autonomicznych agentów desktopowych. Pozostaje obserwować, jak zamknięta beta sprawdzi się na prawdziwych pulpitach poza kontrolowanymi benchmarkami — agenci computer use z innych laboratoriów pokazali potencjał tego formatu, ale również problemy z niezawodnością przy wieloetapowych przepływach pracy — oraz czy Xiaomi otworzy testy do szerszego dostępu wykraczającego poza pełną kontrolę nad komputerem w wersji zagranicznej.
Źródło: Metaverse Post