Ox Alpha es gratuito, presuntamente supera a Claude Fable 5 y GPT-5.6 Sol, pero su creador sigue siendo desconocido
Puntos clave
- •Ox Alpha se lanzó como un modelo sigiloso gratuito el 20 de agosto en OpenRouter, OpenCode, Cline y el portal+ de Nous Research.
- •Una pequeña muestra de 10 tareas en DeepSWE sugirió inicialmente que Ox Alpha superaba a Claude Fable 5 y GPT-5.6 Sol, pero ejecuciones completas posteriores de 113 tareas lo ubicaron en torno al 63%.
- •El modelo admite entrada de texto, imagen y video, tiene una ventana de contexto de aproximadamente 1 millón de tokens y ofrece llamadas a herramientas y funciones con una salida JSON no sujeta a un esquema obligatorio.
- •Las especulaciones sobre su creador han incluido a Google, Xiaomi, DeepSeek y el MAI de Microsoft, pero la evidencia más sólida apunta a la familia GLM-5.3 de Zhipu AI.
- •Patrick Collison, CEO de Stripe, calificó públicamente a Ox Alpha de muy impresionante, lo que ayudó a ampliar la atención sobre el modelo.

Ox Alpha, un "modelo sigiloso" gratuito, se lanzó el 20 de agosto en OpenRouter, OpenCode, Cline y el portal+ de Nous Research.
Una afirmación viral de que Ox Alpha supera a Claude Fable 5 de Anthropic y a GPT-5.6 Sol de OpenAI en DeepSWE provino de una muestra de 10 tareas. Dos ejecuciones completas y separadas de 113 tareas arrojaron después un resultado cercano al 63%, aproximadamente en línea con GPT-5.6 Sol.
Google, Xiaomi, DeepSeek y el MAI de Microsoft fueron mencionados como posibles creadores del modelo. Sin embargo, la teoría más sólida apunta a la familia GLM-5.3 de Zhipu AI.
Los entusiastas de la inteligencia artificial prestan mucha atención a un modelo de IA llamado Ox Alpha, que apareció en OpenRouter el 20 de agosto sin ningún nombre de empresa asociado. La ficha lo describe como "un modelo de razonamiento diseñado para programación, trabajo agéntico sostenido y cargas de producción", creado por un proveedor externo que ha optado por permanecer en el anonimato durante la vista previa.
El modelo misterioso también ha llamado la atención porque aparentemente supera a Claude Fable 5 de Anthropic y a GPT-5.6 Sol de OpenAI en pruebas de programación, una afirmación relevante porque los desarrolladores usan cada vez más estas pruebas para comparar modelos que quizás aún no puedan identificar.
DeepSWE es una prueba de referencia que mide con qué frecuencia un agente de programación resuelve correctamente problemas reales de GitHub en el primer intento, expresado como el porcentaje de tareas superadas entre 113 tareas extraídas de 91 repositorios. En esa prueba, Ox Alpha ha demostrado ser competitivo frente a los modelos de primer nivel.
El desarrollador Ben Davis ejecutó primero Ox Alpha en una muestra de 10 tareas y reportó una puntuación de 80% en la primera pasada, por encima del 65% de Claude Fable 5 y el 52% de GPT-5.6 Sol. Ese resultado se difundió rápidamente y versiones del mismo siguieron circulando como si Ox Alpha tuviera una ventaja clara sobre ambos modelos, aunque la pequeña muestra dejaba margen para la varianza.
I ran this thing through 10 tasks on DeepSWE (so there could be a ton of variance in it's real score, this is a subset), but uh... gpt-5.6-sol: 52% fable: 65% whatever the hell this is: 80% (was a near miss on the "x"s so actually over 80%) I am very confused pic.twitter.com/NdDSTjoHLj — Ben Davis (@davis7) August 21, 2026
Al 22 de agosto, Ox Alpha todavía no tenía ficha en Artificial Analysis ni en Arena, lo que deja menos puntos de referencia públicos para los usuarios que intentan compararlo con otros modelos de frontera.
El modelo es gratuito, puede leer hasta aproximadamente 1 millón de tokens en una sola ventana de contexto y acepta entradas de texto, imagen y video mientras devuelve texto. También admite llamadas a herramientas y funciones, aunque su salida JSON no está sujeta a un esquema obligatorio, lo que puede ser una limitación para los desarrolladores que construyen agentes que requieren respuestas estructuradas.
OpenCode dijo que su ruta podía manejar 100 billones de tokens al día, mientras que Nous Research, que ofrece el modelo de forma gratuita a través de su propio portal, dijo que tenía capacidad para 1 cuatrillón. Los tokens son la unidad básica de información que procesa un modelo de IA, y un rendimiento a esa escala sitúa al sistema junto a los modelos más utilizados y capaces del mercado.
Ox Alpha (stealth model) is free for the next week - 1M Context - Multi-modal - Zero Data Retention Generous rate limits, near unlimited usage We have capacity for 100T tokens per day, lets see what you can do — OpenCode (@opencode) August 20, 2026
Por qué todos están prestando atención
Patrick Collison, CEO de Stripe, cuya empresa acordó el 19 de agosto adquirir OpenRouter, calificó a Ox Alpha de "muy impresionante" en una publicación en X. Ese comentario de un destacado ejecutivo tecnológico ayudó a llevar el modelo a una discusión más amplia en cuestión de horas tras su lanzamiento, especialmente porque el modelo ya había comenzado a circular a través de múltiples puntos de acceso antes de que se conociera a su creador.
$ ori --model stealth/ox-alpha
It's very impressive. — Patrick Collison (@patrickc) August 21, 2026
Nadie ha reclamado públicamente la autoría del modelo. El analista de IA Andrew Curran publicó el viernes que la gente "parece estar menos segura de todo" sobre el origen de Ox Alpha.
A medida que crecía el interés, la especulación se amplió rápidamente. Los desarrolladores mencionaron la familia MAI aún no lanzada de Microsoft, la línea MiMo de Xiaomi, DeepSeek, Qwen de Alibaba e incluso Gemini de Google. Tanta gente se decidió por Gemini que un desarrollador bromeó que Google estaba usando el modelo sigiloso de un rival como marketing para el suyo.
La mayoría de esas teorías no encajan con la evidencia. El MiMo v2.5 de Xiaomi acepta entrada de audio, una característica destacada que Ox Alpha rechaza explícitamente. DeepSeek no ha lanzado capacidad de video y publica pesos abiertos en lugar de usar vistas previas sigilosas. Google y Qwen utilizan tokenizadores y codificadores de video completamente diferentes, lo que dificulta sostener un vínculo directo.
La evidencia restante apunta con mayor fuerza a los modelos de Zhipu AI. La identificación de huellas digitales independiente coincidió el tokenizador de Ox Alpha con GLM-5.3 en todas las pruebas normalizadas, y su uso de tokens de video coincidió exactamente con GLM-5V-Turbo en cuatro clips separados. También comparte los errores distintivos de GLM y su negativa a aceptar audio.
Ox Alpha's tokenizer is one for one identical to GLM's. No other lab's tokenizer gets past 4/11 when it comes to tokenizer similarity. (h/t: @sushsrinivasan ) (3/n) pic.twitter.com/dNwwZmCYZ7 — Ananay (@ananayarora) August 21, 2026
Sin embargo, un detalle complica una coincidencia perfecta. GLM-5.3 se lanzó el 14 de agosto como un modelo de solo texto, seis días antes de que apareciera Ox Alpha con soporte completo de video. Si la identificación de huellas es correcta, Ox Alpha tiene más probabilidades de ser una mejora multimodal aún no lanzada de esa línea que una copia directa, y los analistas han comenzado a llamar a esa posibilidad GLM-5.3 Flash.
Zhipu AI no ha comentado públicamente sobre Ox Alpha.
¿Qué es un modelo sigiloso, exactamente?
Un modelo sigiloso es un sistema de IA de clase frontera que se lanza sin atribución a través de una plataforma de enrutamiento como OpenRouter. Este esquema permite a un laboratorio recopilar datos de uso del mundo real antes de comprometerse con un lanzamiento público.
El patrón se ha vuelto común entre los laboratorios chinos. El Pony Alpha de Zhipu AI fue identificado como GLM-5 en cinco días en febrero. El Hunter Alpha de Xiaomi resultó ser MiMo-V2-Pro en marzo. Meituan mantuvo su Owl Alpha en el anonimato durante dos meses antes de confirmarlo como LongCat-2.0 en junio.
Ox Alpha está actualmente disponible en OpenRouter bajo el identificador de modelo stealth/ox-alpha, y también se puede acceder a través de OpenCode, Cline y Nous Portal, todos de consulta gratuita. OpenCode dijo que el período gratuito dura aproximadamente una semana desde el debut del 20 de agosto, lo que situaría el corte probable alrededor del 27 de agosto. Después de eso, si se mantiene el patrón observado con modelos anónimos anteriores, el proveedor podría finalmente revelar su nombre.