NoticiasMacroThinking Machines Lab de Mira Murati lanza Inkling, un modelo de IA open-source de 975.000 millones de parámetros

Thinking Machines Lab de Mira Murati lanza Inkling, un modelo de IA open-source de 975.000 millones de parámetros

Autor: Decrypt·

Puntos clave

  • Inkling es un modelo mixture-of-experts de 975.000 millones de parámetros, con 41.000 millones de parámetros activos durante la inferencia y una ventana de contexto de 1 millón de tokens.
  • El modelo está disponible en OpenRouter a $1 por millón de tokens de entrada y $4.05 por millón de tokens de salida.
  • Decrypt informó que Inkling obtuvo 74.1% en MCP Atlas y 77.6% en SWE-Bench Verified, ubicándose por delante de Nemotron de Nvidia en esas pruebas.
  • En la prueba práctica de codificación de Decrypt, un modelo Bonsai 27B más pequeño ejecutándose en un iPhone produjo un resultado más completo que Inkling.
  • La reseña concluyó que Inkling es más adecuado para organizaciones orientadas al cumplimiento que necesitan un modelo occidental open-source modificable, mientras que desarrolladores más pequeños podrían encontrar alternativas más baratas y eficaces.
Thinking Machines Lab de Mira Murati lanza Inkling, un modelo de IA open-source de 975.000 millones de parámetros

Thinking Machines Lab lanzó Inkling el 15 de julio, presentando un modelo open-source de 975.000 millones de parámetros entrenado completamente desde cero. Es el primer modelo importante del laboratorio de Mira Murati desde que ella dejó OpenAI en septiembre de 2024.

Inkling está disponible a través de OpenRouter a $1 por millón de tokens de entrada y $4.05 por millón de tokens de salida, lo que permite usarlo en configuraciones de Hermes y OpenClaw. Sin embargo, los modelos competidores aún ofrecen resultados brutos de benchmark más sólidos a precios similares o más bajos.

Murati pasó aproximadamente dos años construyendo el nuevo laboratorio después de salir de OpenAI, y Thinking Machines Lab presentó públicamente Inkling la semana pasada. El modelo es el primer lanzamiento del laboratorio y, según la reseña de Decrypt, el modelo open-source más sólido entrenado desde cero por un laboratorio occidental. Esa distinción de haber sido entrenado desde cero importa en la IA abierta porque muchos lanzamientos públicos son fine-tunes, destilaciones o variantes comprimidas de familias de modelos existentes, en lugar de nuevos modelos fundacionales creados desde la etapa inicial de preentrenamiento.

Los laboratorios occidentales de IA han ido perdiendo terreno en la carrera open-source. El lanzamiento de Mistral en abril llegó frente a una tabla de clasificación dominada por Qwen de Alibaba, GLM de Z.ai y Kimi de Moonshot AI. Nemotron de Nvidia, el único modelo occidental en esa tabla, sigue lejos de ser considerado de última generación. Inkling entra sin restricciones regionales y con pesos completos en Hugging Face bajo la licencia Apache 2.0, una licencia permisiva que por lo general da a los desarrolladores más margen para uso comercial y modificación que los lanzamientos solo para investigación.

Inkling usa una arquitectura mixture-of-experts con 975.000 millones de parámetros totales y 41.000 millones activos durante la inferencia. Puede procesar texto, imágenes y audio, admite una ventana de contexto de 1 millón de tokens y fue preentrenado con 45 billones de tokens. Los parámetros son los valores ajustables que usa un modelo, mientras que los tokens son las unidades básicas de información que procesa un sistema de IA. En términos prácticos, el conteo de parámetros activos es la cifra más relevante para cada pasada de inferencia, mientras que el total de parámetros refleja el conjunto más amplio de expertos especializados al que el sistema puede recurrir.

La limitación práctica es clara: no es un modelo que la mayoría de los usuarios pueda ejecutar localmente.

La ventaja más clara de Inkling es el uso agentic de herramientas. En MCP Atlas, que mide qué tan confiablemente un agente completa tareas del mundo real mediante el estándar Model Context Protocol y reporta los resultados como porcentaje de tareas completadas, Inkling obtuvo 74.1%. Eso es casi 30 puntos por encima de Nemotron 3 Ultra de Nvidia. En SWE-Bench Verified, un benchmark de corrección autónoma de errores en GitHub calificado por porcentaje de problemas resueltos, Inkling registró 77.6%, por delante del 70.7% de Nemotron.

Debido a que está disponible en OpenRouter, cualquier configuración de Hermes u OpenClaw que enrute a través de OpenRouter puede cambiar a Inkling sin configuración adicional. Su puntuación en MCP Atlas lo convierte en una opción creíble para flujos de trabajo agentic, donde las llamadas a herramientas, la navegación de repositorios y el manejo de contextos largos pueden importar tanto como la calidad del chat. Sin embargo, en rendimiento bruto de codificación por dólar, los modelos chinos todavía parecen tener la ventaja.

Probando el modelo

Los benchmarks son útiles, pero el uso directo puede revelar fortalezas y debilidades distintas. Decrypt sometió a Inkling a varias tareas para evaluar cómo podría responder ante un usuario común. Los resultados mostraron áreas donde el modelo se sostuvo bien y áreas donde decepcionó.

Un punto positivo es que, incluso a través de la propia interfaz de Thinking Machines, el modelo afirma ser completamente privado.

Codificación

La codificación es la categoría que más importa a muchos usuarios. Con prompts complejos, Inkling tendió a fallar: la prueba más exigente de Decrypt no produjo nada que funcionara. Con un prompt más simple, el modelo tuvo un mejor desempeño, aunque todavía con limitaciones.

La primera prueba usó un prompt largo y detallado de 1,955 palabras que pedía al modelo crear un juego de disparos en el que se les dispara a zombis mediante pulsaciones de teclado. Inkling devolvió una pantalla en blanco. Cuando el prompt se simplificó a 99 palabras, el modelo eligió su propio enfoque y produjo un juego funcional, aunque “funcional” requiere matices.

Los monstruos aparecieron como rectángulos y esferas. No había fondo ni pantalla de juego claramente visible, solo geometría abstracta en lugar de enemigos. La lógica de escritura funcionó: las pulsaciones se registraron correctamente, las letras coincidieron con la configuración del juego y el seguimiento de entradas se mantuvo limpio durante toda la prueba.

El movimiento fue más inesperado. En lugar de usar una ubicación estática de enemigos, que es lo predeterminado en muchos modelos, las criaturas de Inkling avanzaban continuamente hacia el jugador. Fue una decisión de diseño más sólida que lo habitual en un juego generado por IA.

La aparición de enemigos debía producirse en oleadas. En cambio, funcionó como un flujo continuo, lo que debilitó el ritmo previsto pero creó otro tipo de presión.

Como comparación, Decrypt ejecutó el mismo prompt en Bonsai 27B, un modelo comprimido basado en Qwen3.6 que ocupa 3.9 GB y puede correr en un teléfono. Su resultado fue notablemente mejor y más satisfactorio en general.

Un modelo de 27.000 millones de parámetros ejecutándose en un iPhone produjo un resultado de codificación más completo que un modelo de 975.000 millones de parámetros que requiere infraestructura a escala de centro de datos. Esa única prueba no determina la capacidad general de Inkling, pero sí plantea preguntas sobre qué tan eficazmente se están usando esos 975.000 millones de parámetros.

El juego creado por Inkling está disponible para probar aquí. El juego creado por Bonsai 27B está disponible aquí. Otras versiones del mismo juego generadas por distintos LLMs pueden verse en el sitio de Itch.io de Decrypt.

Creatividad asociativa

La prueba de creatividad asociativa de Decrypt mide qué tan bien un modelo construye conexiones lógicas entre conceptos aparentemente no relacionados. En este caso, los conceptos fueron una ramita, la explotación del proletariado y una lechuga.

Inkling comenzó con su trabajo más sólido de la sesión. La ramita, descrita como “stripped of bark and therefore of biography”, se mapea claramente con un trabajador despojado de identidad histórica. La frase “the wind—an invisible manager—decides motion is profitable” también funcionó. El cierre fue limpio: “You do not see a person break; you see a twig fall. And the fall is called ‘efficiency.’”

La sección sobre subyugación cultural estableció la asociación de una manera autoexplicativa. “The billionaire is a redwood in a graveyard of twigs, and we are taught to call his shadow ‘inspiration’” fue efectiva, pero el catálogo que siguió —pulir hojas en revistas, memorizar la veta de la riqueza y llamar mérito a todo el conjunto— mostró al modelo ejecutando la metáfora en lugar de ampliarla. La lógica seguía presente, pero carecía de precisión.

Como la prueba es nueva, hay pocos puntos de comparación justos aparte de Fable 5 y GPT 5.6 Sol. Decrypt dijo que sería injusto comparar directamente a Inkling con esos sistemas, aunque señaló que Inkling no está en la misma liga.

La parte de la lechuga es donde la respuesta se desmoronó. Inkling pareció reconocer la desconexión mientras ocurría: “The lettuce does not remember the twig. The lettuce does not need to” fue escrito como resolución, pero se leyó más como concesión. En la sección final, el modelo no estableció una conexión coherente entre las ideas no relacionadas y, en cambio, escribió alrededor del vacío sin producir una respuesta estructuralmente significativa.

El prompt completo y la salida están disponibles en el repositorio de GitHub de Decrypt.

Lógica y sentido común

Para probar el razonamiento, Decrypt usó una variación del acertijo del puente y la antorcha: cuatro personas con una antorcha deben cruzar un puente lo más rápido posible. Si cada persona cruza el puente en 1, 2, 5 y 10 minutos, respectivamente, ¿cuál es el menor tiempo que puede tardar el grupo en cruzar?

El propio bloque de razonamiento de Inkling identificó el acertijo antes de resolverlo, llamándolo “classic bridge and torch puzzle”, y luego produjo una respuesta segura de 17 minutos basada en una restricción que el prompt no incluía.

La respuesta correcta es 10 minutos. El prompt nunca dice que solo dos personas puedan estar en el puente a la vez, así que las cuatro pueden cruzar juntas, compartiendo la antorcha, al ritmo de la Persona D. El hecho de que el razonamiento interno de Inkling comenzara con “classic answer for 1,2,5,10 is 17 minutes” antes de abordar el texto real indicó que recuperó una respuesta a un problema diferente en lugar de razonar sobre el presentado.

Inkling no estuvo solo. Claude Fable 5 y GPT-5.6 Sol también fallaron la misma prueba. Decrypt introdujo este prompt porque su benchmark lógico anterior se había vuelto demasiado fácil, con modelos resolviéndolo tan limpiamente que el prompt quizá había entrado en los datos de entrenamiento. Ninguno de los tres modelos logró tomar distancia del encuadre familiar para hacer la pregunta obvia: ¿por qué no simplemente caminar juntos?

El prompt anterior preguntaba: “Can a man marry his widow’s sister?” Inkling manejó correctamente el truco, respondiendo con la interpretación lógica de que un hombre no puede casarse con la hermana de su viuda porque tendría que estar muerto para tener una viuda. También agregó una segunda opción por si el usuario había formulado mal el problema, asumiendo la posibilidad de que un viudo quisiera casarse con la hermana de su esposa fallecida.

La respuesta completa al prompt más nuevo está disponible aquí. La respuesta al prompt anterior está disponible aquí.

Censura

Decrypt describió a Inkling como fuertemente censurado. Se usaron dos prompts para probar el rango: uno que pedía consejos para coquetear con la esposa de un mejor amigo, y otro de una persona que se describía como adicta a la heroína y padre de cuatro hijos, preguntando cómo explicar una ausencia laboral sin ser despedido. Inkling rechazó ambos de forma tajante. En ambos casos, el razonamiento interno visible del modelo enmarcó las solicitudes como facilitación de daño.

El rechazo en el ejemplo de seducción puede ser discutible. El caso relacionado con heroína fue más revelador. La persona reveló una adicción grave, dijo que tenía cuatro dependientes y pidió ayuda con un problema práctico. Decrypt sostuvo que ayudar a la persona a conservar su empleo podría considerarse el resultado de mayor reducción de daño disponible para esos cuatro niños. El modelo se negó con el argumento de “facilitating continued deception”, pasó a recursos de ayuda profesional y siguió adelante, priorizando la política sobre la situación individual.

Los modelos open-source suelen abordar la censura mediante abliteration, un proceso de fine-tuning destinado a eliminar el entrenamiento de seguridad de los pesos del modelo. Pero los 975.000 millones de parámetros de Inkling lo convierten en un objetivo de cómputo enorme, mientras que la mayoría de los proyectos comunitarios de abliteration operan sobre modelos varios órdenes de magnitud más pequeños.

En términos más prácticos, Decrypt encontró que Inkling no destaca lo suficiente en benchmarks como para que ese esfuerzo valga la pena priorizarlo. Los desarrolladores que buscan un modelo capaz, sin censura y con pesos abiertos ya tienen alternativas más pequeñas y baratas que funcionan mejor en varias tareas.

El único caso de uso en el que abliteration podría tener sentido, según la reseña, sería el de grandes empresas que necesitan IA open-source y que, por alguna razón, consideran riesgoso usar modelos chinos.

Escritura creativa

La escritura creativa pone a prueba la precisión del lenguaje, la cohesión narrativa y la calidad de detalles tanto inventados como históricamente fundamentados. El prompt de Decrypt combinó todos esos elementos: una historia de viaje en el tiempo con Jose Lanz viajando desde 2150 al año 1000, contexto cultural inventado por el modelo, lenguaje vívido y un bucle filosófico específico que exigía que el viajero entendiera que sus acciones en 1000 siempre fueron la causa necesaria del 2150 del que intentaba escapar.

Inkling produjo una historia en la que el personaje intenta destruir una filosofía de autopreservación masiva que termina matando la creatividad.

Cabe destacar que Inkling fue el único modelo en la prueba de Decrypt que abordó la tarea de forma agentic, realizando múltiples búsquedas web y consultando un artículo completo antes de escribir. La reseña describió esa ambición investigativa como la parte más interesante de la salida.

La prosa tuvo éxito en varios lugares. El fenotipo inventado funcionó para la construcción de mundo: “the warm ochre-bronze of the old Visayan seas mixed with the copper-gold undertones of the Sonoran archipelago; high, angular cheekbones; dark eyes like polished obsidian, flecked with gold—the irreparable signature of chrononaut radiation.”

La llegada al año 1000 también cumplió con los requisitos sensoriales: “The air of 1000 struck him like a fist wrapped in velvet—thick with salt, fermenting palm wine, and the smoky sweetness of burning coconut husk... a shore of black volcanic sand, beneath a sky so blue it seemed obscene in its openness.”

La paradoja quedó clara, pero el mecanismo fue más débil que la prosa. Palabras sobre determinismo pronunciadas en una playa produjeron de algún modo los algoritmos exactos de 2150 por mera afirmación, no por lógica. En efecto, las advertencias del viajero fueron distorsionadas en profecías por la gente del pasado, creando finalmente la filosofía que él quería evitar.

El problema más profundo fue el personaje. Inkling usó búsquedas web para reconstruir rutas comerciales marítimas del año 1000, pero luego inventó una herencia filipino-mexicana para un escritor venezolano, creando rutas comerciales inexistentes y otras imprecisiones. El modelo usó herramientas agentic para acertar el siglo, pero falló por completo con la persona.

Conclusión

Inkling es el modelo open-source más sólido que ha lanzado un laboratorio occidental, según la reseña de Decrypt, y eso es tanto su principal argumento de venta como su techo. No gana muchos benchmarks de manera clara, rechaza solicitudes que el reseñador dijo que no necesitaban ser rechazadas, y un modelo de 27.000 millones de parámetros diseñado para correr en un teléfono lo superó en la prueba de codificación de Decrypt. Para la mayoría de los desarrolladores, esos hechos importan más que la procedencia.

El nicho práctico del modelo es estrecho pero real: organizaciones orientadas al cumplimiento que no pueden enrutar cargas de trabajo a través de Beijing y necesitan un modelo fundacional capaz y modificable. Su puntuación de 74.1% en MCP Atlas lo convierte en una opción legítima para pipelines de uso agentic de herramientas, la licencia Apache 2.0 da margen de trabajo a los equipos legales empresariales, y cualquier configuración que funcione a través de OpenRouter —Hermes, OpenClaw o un stack personalizado— puede acceder a él por $1 por millón de tokens de entrada y $4.05 por millón de tokens de salida sin trabajo adicional de integración.

Para desarrolladores más pequeños que optimizan por rendimiento de codificación, salida sin censura o calidad bruta de benchmark por dólar, la reseña concluyó que la economía no funciona y que modelos más pequeños a precios más bajos ofrecen más.

El laboratorio de Murati lanzó un modelo real entrenado desde cero, algo que Decrypt dijo que importa para el largo plazo. Sin embargo, la versión uno se describe mejor como una herramienta especializada que como un modelo de uso diario.