NotizieMacroOx Alpha è gratuito, supera le affermazioni su Claude Fable 5 e GPT-5.6 Sol, ma il suo creatore resta sconosciuto

Ox Alpha è gratuito, supera le affermazioni su Claude Fable 5 e GPT-5.6 Sol, ma il suo creatore resta sconosciuto

Autore: Decrypt·

Punti chiave

  • Ox Alpha è stato lanciato come modello stealth gratuito il 20 agosto su OpenRouter, OpenCode, Cline e sul portal+ di Nous Research.
  • Un piccolo campione DeepSWE da 10 task ha inizialmente suggerito che Ox Alpha superasse Claude Fable 5 e GPT-5.6 Sol, ma successivi run completi da 113 task lo hanno collocato intorno al 63%.
  • Il modello supporta input di testo, immagini e video, ha una context window di circa 1 milione di token e offre tool e function calling con output JSON non vincolato da schema.
  • Le ipotesi sul creatore hanno incluso Google, Xiaomi, DeepSeek e l'MAI di Microsoft, ma gli indizi più forti puntano alla famiglia GLM-5.3 di Zhipu AI.
  • Il CEO di Stripe Patrick Collison ha definito pubblicamente Ox Alpha "very impressive", contribuendo ad amplificarne l'attenzione.
Ox Alpha è gratuito, supera le affermazioni su Claude Fable 5 e GPT-5.6 Sol, ma il suo creatore resta sconosciuto

Ox Alpha, un modello "stealth" gratuito, è stato lanciato il 20 agosto su OpenRouter, OpenCode, Cline e sul portal+ di Nous Research.

Un'affermazione diventata virale sosteneva che Ox Alpha superasse Anthropic's Claude Fable 5 e OpenAI's GPT-5.6 Sol su DeepSWE; tale affermazione proveniva da un campione di 10 task. Due run completi separati da 113 task sono poi risultati vicini al 63%, sostanzialmente in linea con GPT-5.6 Sol.

Google, Xiaomi, DeepSeek e l'MAI di Microsoft sono stati tutti ipotizzati come possibili sviluppatori del modello. Tuttavia, la teoria più solida punta alla famiglia GLM-5.3 di Zhipu AI.

Gli appassionati di AI stanno seguendo con grande attenzione un modello chiamato Ox Alpha, apparso su OpenRouter il 20 agosto senza alcun nome aziendale associato. La scheda lo descrive come "a reasoning model designed for coding, sustained agentic work, and production workloads", sviluppato da un provider terzo che ha scelto di restare anonimo durante la preview.

Il modello misterioso ha attirato attenzione anche perché sembra superare Anthropic's Claude Fable 5 e OpenAI's GPT-5.6 Sol nei benchmark di coding, un dato rilevante perché gli sviluppatori usano sempre più spesso questi test per confrontare modelli che forse non sono ancora in grado di identificare.

DeepSWE è un benchmark che misura quanto spesso un coding agent risolve correttamente al primo tentativo problemi reali di GitHub, espresso come percentuale di task superati su 113 task tratti da 91 repository. Su questo benchmark, Ox Alpha si è dimostrato competitivo con i modelli di fascia alta.

Lo sviluppatore Ben Davis ha eseguito per primo Ox Alpha su un campione di 10 task e ha riportato un punteggio dell'80% al primo passaggio, davanti al 65% di Claude Fable 5 e al 52% di GPT-5.6 Sol. Quel risultato si è diffuso rapidamente e le sue varianti hanno continuato a circolare come se Ox Alpha avesse un chiaro vantaggio su entrambi i modelli, nonostante il campione ridotto lasciasse spazio a variazioni.

I ran this thing through 10 tasks on DeepSWE (so there could be a ton of variance in it's real score, this is a subset), but uh... gpt-5.6-sol: 52% fable: 65% whatever the hell this is: 80% (was a near miss on the "x"s so actually over 80%) I am very confused pic.twitter.com/NdDSTjoHLj — Ben Davis (@davis7) August 21, 2026

Al 22 agosto, Ox Alpha non risultava ancora elencato su Artificial Analysis o Arena, lasciando meno punti di riferimento pubblici agli utenti che cercano di confrontarlo con altri modelli frontier.

Il modello è gratuito, può leggere fino a circa 1 milione di token in una singola context window e accetta input di testo, immagini e video restituendo testo. Supporta anche tool e function calling, anche se il suo output JSON non è vincolato da uno schema, un limite per gli sviluppatori che costruiscono agenti e si aspettano risposte strutturate.

OpenCode ha dichiarato che il suo routing può gestire 100 trilioni di token al giorno, mentre Nous Research, che offre il modello gratuitamente tramite il proprio portal, ha affermato di avere capacità per 1 quadrilione. I token sono l'unità di base dell'informazione che un modello AI elabora, e un throughput di questa scala colloca il sistema accanto ai modelli più usati e capaci oggi sul mercato.

Ox Alpha (stealth model) is free for the next week - 1M Context - Multi-modal - Zero Data Retention Generous rate limits, near unlimited usage We have capacity for 100T tokens per day, lets see what you can do — OpenCode (@opencode) August 20, 2026

Perché tutti ci stanno prestando attenzione

Il CEO di Stripe Patrick Collison, la cui società ha concordato il 19 agosto di acquisire OpenRouter, ha definito Ox Alpha "very impressive" in un post su X. Quel commento di un noto dirigente tecnologico ha contribuito a portare il modello in una conversazione più ampia nel giro di poche ore dal lancio, soprattutto perché il modello aveva già iniziato a circolare attraverso più punti di accesso prima che se ne conoscesse il creatore.

$ ori --model stealth/ox-alpha

It's very impressive. — Patrick Collison (@patrickc) August 21, 2026

Nessuno ha rivendicato pubblicamente il modello. L'analista AI Andrew Curran ha scritto venerdì che le persone "seem less sure of anything" riguardo alla provenienza di Ox Alpha.

Con la crescita dell'interesse, le ipotesi si sono rapidamente moltiplicate. Gli sviluppatori hanno indicato la famiglia MAI non ancora rilasciata di Microsoft, la linea MiMo di Xiaomi, DeepSeek, Qwen di Alibaba e persino Gemini di Google. A tal punto che alcuni sono arrivati a Gemini, da spingere uno sviluppatore a scherzare sul fatto che Google stesse usando il modello stealth di un rivale come marketing per il proprio.

La maggior parte di queste ipotesi non regge però di fronte alle evidenze. MiMo v2.5 di Xiaomi accetta input audio, una funzione di primo piano che Ox Alpha rifiuta chiaramente. DeepSeek non ha mai rilasciato capacità video e pubblica open weights invece di usare preview stealth. Google e Qwen utilizzano entrambi tokenizer ed encoder video diversi, rendendo difficile sostenere un collegamento diretto.

Le prove residue puntano con maggiore forza ai modelli di Zhipu AI. Un fingerprinting indipendente ha associato il tokenizer di Ox Alpha a GLM-5.3 in ogni test normalizzato e il suo consumo di video token a GLM-5V-Turbo con corrispondenza esatta su quattro clip separate. Condivide inoltre gli errori distintivi di GLM e il suo rifiuto dell'audio.

Ox Alpha's tokenizer is one for one identical to GLM's. No other lab's tokenizer gets past 4/11 when it comes to tokenizer similarity. (h/t: @sushsrinivasan ) (3/n) pic.twitter.com/dNwwZmCYZ7 — Ananay (@ananayarora) August 21, 2026

Un dettaglio, tuttavia, complica una corrispondenza perfetta. GLM-5.3 è stato lanciato il 14 agosto come modello solo testuale, sei giorni prima che Ox Alpha apparisse con pieno supporto video. Se il fingerprinting è corretto, Ox Alpha è più probabilmente un aggiornamento multimodale non rilasciato di quella linea che una copia identica, ipotesi che gli analisti hanno iniziato a chiamare GLM-5.3 Flash.

Zhipu AI non ha commentato pubblicamente Ox Alpha.

Che cos'è, in fondo, un modello stealth

Un modello stealth è un sistema AI di fascia frontier rilasciato senza attribuzione attraverso una piattaforma di routing come OpenRouter. Questo consente a un laboratorio di raccogliere dati d'uso reali prima di impegnarsi in un lancio pubblico.

Il modello è diventato una pratica abituale per i laboratori cinesi. Pony Alpha di Zhipu AI è stato identificato come GLM-5 entro cinque giorni a febbraio. Hunter Alpha di Xiaomi si è rivelato essere MiMo-V2-Pro a marzo. Meituan ha mantenuto Owl Alpha anonimo per due mesi prima di confermarlo come LongCat-2.0 a giugno.

Ox Alpha è ora attivo su OpenRouter con l'ID modello stealth/ox-alpha ed è disponibile anche tramite OpenCode, Cline e Nous Portal, tutti gratuiti da interrogare. La nota di lancio di OpenCode ha fissato la finestra gratuita a circa una settimana dal debutto del 20 agosto, collocando la probabile scadenza intorno al 27 agosto; dopo di che, se si confermasse il pattern degli ultimi quattro modelli anonimi, qualcuno potrebbe finalmente attribuirgli un nome.