NotizieAzioniMiMo-V2.6 di Xiaomi punta ad agenti, cybersecurity e mondi 3D con un rilascio completamente open-source

MiMo-V2.6 di Xiaomi punta ad agenti, cybersecurity e mondi 3D con un rilascio completamente open-source

Autore: Metaverse Post·

Punti chiave

  • •MiMo-V2.6-Pro ha conquistato la prima posizione tra i modelli open-source nell'Artificial Analysis Intelligence Index con un punteggio di 46.32, superando Kimi K3 e Qwen3.8 Max.
  • •La serie mantiene i prezzi delle API ai livelli del predecessore V2.5, estendendo la frontiera intelligenza-costi senza aumenti di prezzo.
  • •Nel benchmark di ingegneria del software DeepSWE v1.1, MiMo-V2.6-Flash è balzato a 67.9 dal 19.0 di MiMo-V2.5-Pro, mentre Pro ha ottenuto 71.9, dietro a DeepSeek V4.1 Flash e ai leader Claude e GPT.
  • •L'addestramento con reinforcement learning trasmesso in diretta si è concluso in meno di sei giorni su circa 750.000 traiettorie, con costi di circa 0,85 milioni di dollari per Flash e 2,62 milioni per Pro, e guadagni DeepSWE di verifica di circa 17 e 14 punti rispettivamente.
  • •Nelle applicazioni di ricerca, MiMo-V2.6-Pro ha contribuito a formalizzare il teorema di Li-Yorke in Lean 4 con oltre 6.000 righe di codice verificato dal kernel e ha partecipato allo screening di nuovi materiali MOF per l'adsorbimento di PFAS.
MiMo-V2.6 di Xiaomi punta ad agenti, cybersecurity e mondi 3D con un rilascio completamente open-source

Xiaomi ha rilasciato e reso completamente open-source MiMo-V2.6, la nuova generazione dei suoi modelli AI nativamente omnimodale, presentando il lancio come un passo fondamentale verso il potenziamento del reinforcement learning (RL) su compiti complessi e verificabili. La lineup è composta da due modelli principali — MiMo-V2.6-Pro, descritto dall'azienda come il suo modello più potente fino a oggi, e il più conveniente MiMo-V2.6-Flash — affiancati da una variante Pro-UltraSpeed che offre velocità di output fino a 20 volte superiori.

Nell'Artificial Analysis Intelligence Index (v4.3, settembre 2026), MiMo-V2.6-Pro ha ottenuto un punteggio di 46.32, superando Kimi K3 e Qwen3.8 Max e conquistando la prima posizione tra i modelli open-source. La serie mantiene inoltre i prezzi delle API del predecessore V2.5, spingendo in avanti la frontiera Pareto intelligenza-costi a costi invariati. Fa parte di un trend più ampio in cui modelli frontier aperti e chiusi vengono valutati sugli stessi benchmark pubblici, mantenendo la fascia open-source in confronto diretto e paritario con i sistemi chiusi.

I modelli si collocano a livelli competitivi nei benchmark di diverse discipline. Su DeepSWE v1.1, un test di ingegneria del software a lungo orizzonte, MiMo-V2.6-Pro ha ottenuto 71.9 — dietro a DeepSeek V4.1 Flash (74.2) e a Claude Opus 5 e GPT 6 Astra (entrambi a 74.0) — mentre MiMo-V2.6-Flash ha raggiunto 67.9, un netto balzo rispetto al 19.0 di MiMo-V2.5-Pro. Nei flussi di lavoro agentici generali, la serie ha guidato Automation Bench v1.0.6 tra i modelli frontier con l'unica eccezione di DeepSeek V4.1 Flash, e ha registrato punteggi di 94.0 e 95.1 nel benchmark CyberGym, orientato alla cybersecurity.

Introducing Xiaomi MiMo-V2.6 — Pro & Flash. Frontier intelligence, all the modalities, built in public. Two omnimodal models, advancing through scaled reinforcement learning Pro performs on par with Claude Opus 5 and GPT-5.6 Sol across most agent benchmarks Pro scores… pic.twitter.com/oqfYPC00uK

— Xiaomi MiMo (@XiaomiMiMo) September 21, 2026

Reinforcement learning su larga scala, trasmesso in diretta pubblica

Il pilastro tecnico del rilascio è un addestramento RL su larga scala trasmesso in diretta da Xiaomi. In meno di sei giorni, ciascun modello ha completato 30 step di RL su circa 750.000 traiettorie, con costi di circa 0,85 milioni di dollari per Flash e 2,62 milioni per Pro. I tassi di superamento medi sui compiti di addestramento sono cresciuti rispettivamente del 25% e del 12% in termini relativi, e i guadagni sui benchmark di verifica sono stati sostanziosi: i punteggi DeepSWE v1.1 sono saliti di circa 17 punti per Flash (da 48.8 a 65.68) e di 14 punti per Pro (da 58.4 a 72.57). Secondo'azienda, il processo RL si è dimostrato efficiente in termini di campioni e ha generalizzato oltre la distribuzione di addestramento.

Il ridimensionamento è stato perseguito su tre assi: batch più grandi su un'architettura completamente asincrona (1.568 campioni per aggiornamento, lunghezze di contesto fino a 1 milione e 3,5–3,7 miliardi di token per step); una suite multi-task che copre coding, agenti generali, domini visivi e di cybersecurity; e un aumento del calcolo del grader che utilizza confronti relativi per produrre segnali di ricompensa più precisi. Il team ha inoltre congelato il router per contenere la deriva dell'addestramento e ha implementato una difesa contro il reward hacking che combina progettazione delle ricompense, valutazione avversaria, rilevamento di anomalie e verifica incrociata.

Oltre ai benchmark, Xiaomi mette in mostra capacità applicative nell'ambito di quella che chiama "Vibe World", estendendo la programmazione in linguaggio naturale dal software ai mondi 3D interattivi, allo sviluppo di videogiochi, alla modellazione 3D basata su Blender, al controllo in circuito chiuso di bracci robotici, al design di frontend e presentazioni e alla produzione end-to-end di video e musica. In ambito di ricerca, MiMo-V2.6-Pro ha contribuito allo screening computazionale di nuovi materiali MOF per l'adsorbimento di PFAS e ha aiutato a formalizzare il teorema di Li–Yorke in Lean 4, generando oltre 6.000 righe di codice verificato dal kernel senza alcun post-addestramento specifico per Lean. Il risultato in Lean 4 illustra il focus dichiarato del rilascio sui compiti verificabili, con il kernel del proof assistant — e non un revisore umano — a confermare l'output generato.

I modelli sono accessibili tramite la Piattaforma API MiMo, AI Studio, MiMo Desktop e OpenRouter, con prezzi invariati rispetto a V2.5. Xiaomi sta inoltre rendendo open-source il report tecnico completo, gli ambienti di addestramento e il codice RL per consentire la riproduzione e ulteriori ricerche. Le riproduzioni indipendenti del ciclo di sei giorni e le verifiche di terze parti dei punteggi riportati sono i prossimi sviluppi da monitorare man mano che il rilascio si diffonde.

Fonte: Metaverse Post