AktualnościAkcjeXiaomi MiMo-V2.6 stawia na agentów, cyberbezpieczeństwo i światy 3D w pełni otwartoźródłowej premierze

Xiaomi MiMo-V2.6 stawia na agentów, cyberbezpieczeństwo i światy 3D w pełni otwartoźródłowej premierze

Autor: Metaverse Post·

Najważniejsze informacje

  • •MiMo-V2.6-Pro zajął pierwsze miejsce wśród modeli open-source w Artificial Analysis Intelligence Index z wynikiem 46,32, wyprzedzając Kimi K3 i Qwen3.8 Max.
  • •Seria utrzymuje ceny API na poziomie poprzednika V2.5, poszerzając granicę inteligencja–koszt bez podwyżek.
  • •W benchmarku inżynierii oprogramowania DeepSWE v1.1 MiMo-V2.6-Flash skoczył do 67,9 z 19,0 osiągniętych przez MiMo-V2.5-Pro, podczas gdy Pro zdobył 71,9, ustępując DeepSeek V4.1 Flash oraz liderom Claude i GPT.
  • •Transmitowane na żywo uruchomienie uczenia ze wzmocnieniem zakończyło się w niecałe sześć dni, obejmując około 750 000 trajektorii, przy kosztach około 0,85 mln USD dla Flash i 2,62 mln USD dla Pro, z przyrostami na odłożonym DeepSWE wynoszącymi odpowiednio około 17 i 14 punktów.
  • •W zastosowaniach badawczych MiMo-V2.6-Pro pomógł sformalizować twierdzenie Li-Yorke w Lean 4 w ponad 6000 liniach kodu zweryfikowanego przez kernel i przyczynił się do przesiewania nowych materiałów MOF do adsorpcji PFAS.
Xiaomi MiMo-V2.6 stawia na agentów, cyberbezpieczeństwo i światy 3D w pełni otwartoźródłowej premierze

Xiaomi udostępniło i w pełni otworzyło źródła serii MiMo-V2.6, najnowszej generacji swoich natywnie omnimodalnych modeli AI, przedstawiając premierę jako kluczowy krok w kierunku skalowania uczenia ze wzmocnieniem (RL) na weryfikowalnych, złożonych zadaniach. Oferta składa się z dwóch głównych modeli — MiMo-V2.6-Pro, opisywanego przez firmę jako jej najzdolniejszy model do tej pory, oraz bardziej efektywnego kosztowo MiMo-V2.6-Flash — uzupełnionych wariantem Pro-UltraSpeed, który zapewnia prędkość generowania do 20 razy wyższą.

W rankingu Artificial Analysis Intelligence Index (v4.3, wrzesień 2026) MiMo-V2.6-Pro uzyskał wynik 46,32, wyprzedzając Kimi K3 i Qwen3.8 Max i obejmując najwyższą ocenę wśród modeli open-source. Seria zachowuje również ceny API swojego poprzednika V2.5, przesuwając granicę Pareto inteligencja–koszt przy niezmienionych kosztach. Wpisuje się to w szerszy wzorzec, w którym otwarte i zamknięte modele graniczne są oceniane na tych samych publicznych benchmarkach, utrzymując segment open-source w bezpośrednim, równorzędnym porównaniu z systemami zamkniętymi.

W benchmarkach modele wypadają konkurencyjnie w różnych dziedzinach. W DeepSWE v1.1, teście inżynierii oprogramowania o długim horyzoncie, MiMo-V2.6-Pro zdobył 71,9 — za DeepSeek V4.1 Flash (74,2) oraz Claude Opus 5 i GPT 6 Astra (po 74,0) — podczas gdy MiMo-V2.6-Flash osiągnął 67,9, co stanowi dramatyczny skok z 19,0 osiągniętego przez MiMo-V2.5-Pro. W ogólnych przepływach pracy agentów seria prowadziła w Automation Bench v1.0.6 wśród modeli granicznych wyłącznym wyjątkiem DeepSeek V4.1 Flash, a w ukierunkowanym na cyberbezpieczeństwo benchmarku CyberGym uzyskała wyniki 94,0 i 95,1.

Introducing Xiaomi MiMo-V2.6 — Pro & Flash. Frontier intelligence, all the modalities, built in public. Two omnimodal models, advancing through scaled reinforcement learning Pro performs on par with Claude Opus 5 and GPT-5.6 Sol across most agent benchmarks Pro scores… pic.twitter.com/oqfYPC00uK

— Xiaomi MiMo (@XiaomiMiMo) September 21, 2026

Uczenie ze wzmocnieniem w skali, transmitowane na żywo

Technicznym fundamentem premiery jest skalowane uruchomienie treningu RL, które Xiaomi transmitowało na żywo. W niecałe sześć dni każdy model ukończył 30 kroków RL obejmujących około 750 000 trajektorii, przy kosztach około 0,85 mln USD dla Flash i 2,62 mln USD dla Pro. Średnie wskaźniki zaliczenia zadań treningowych wzrosły odpowiednio o 25% i 12% w ujęciu względnym, a przyrosty na odłożonych benchmarkach były znaczne: wyniki DeepSWE v1.1 wzrosły o około 17 punktów dla Flash (z 48,8 do 65,68) i 14 punktów dla Pro (z 58,4 do 72,57). Według firmy proces RL okazał się efektywny próbkowo i uogólniał poza rozkład treningowy.

Skalowanie realizowano w trzech wymiarach: większe partie na w pełni asynchronicznej architekturze (1568 próbek na aktualizację, długość kontekstu do 1 miliona oraz 3,5–3,7 miliarda tokenów na krok); pakiet wielozadaniowy obejmujący programowanie, agentów ogólnych, dziedziny wizualne i cyber; oraz zwiększona moc obliczeniowa oceniającego wykorzystująca porównania względne dla dokładniejszych sygnałów nagrody. Zespół zamroził również router, aby stłumić dryf treningowy, i wdrożył obronę przed reward hackingiem łączącą projektowanie nagród, ocenę adwersaryjną, wykrywanie anomalii i weryfikację krzyżową.

Poza benchmarkami Xiaomi prezentuje możliwości aplikacyjne w ramach tzw. „Vibe World” — rozszerzając programowanie w języku naturalnym z oprogramowania na interaktywne światy 3D, tworzenie gier, modelowanie 3D oparte na Blenderze, zamkniętą kontrolę ramienia robota, projektowanie frontendu i prezentacji oraz kompleksową produkcję wideo i muzyki. W badaniach MiMo-V2.6-Pro przyczynił się do obliczeniowego przesiewania nowych materiałów MOF do adsorpcji PFAS i pomógł w formalizacji twierdzenia Li–Yorke w Lean 4, generując ponad 6000 linii kodu zweryfikowanego przez kernel bez żadnego post-treningu specyficznego dla Lean. Wynik w Lean 4 ilustruje deklarowany nacisk premiery na zadania weryfikowalne — wygenerowane wyjście potwierdza kernel asystenta dowodowego, a nie ludzki recenzent.

Modele są dostępne poprzez platformę API MiMo, AI Studio, MiMo Desktop i OpenRouter, w cenach niezmienionych względem V2.5. Xiaomi otwiera również źródła pełnego raportu technicznego, środowisk treningowych i kodu RL, umożliwić replikację i dalsze badania. Bezpośrednio po premierze warto obserwować niezależne replikacje sześciodniowego uruchomienia oraz weryfikacje zgłoszonych wyników przez strony trzecie.

Źródło: Metaverse Post