NoticiasAccionesxAI lanza Grok 4.7 tras retrasos repetidos y queda detrás de sus rivales de frontera en los benchmarks

xAI lanza Grok 4.7 tras retrasos repetidos y queda detrás de sus rivales de frontera en los benchmarks

Autor: Decrypt·

Puntos clave

  • Grok 4.7 usa 2.1 billones de parámetros, un aumento del 40% respecto a los 1.5 billones de Grok 4.6, y tiene un precio de $2 por millón de tokens de entrada y $6 por millón de tokens de salida.
  • xAI complementó el entrenamiento del modelo con datos de SpaceX, incluida telemetría satelital de Starlink, registros de fabricación y bitácoras de fallas de ingeniería, con el objetivo de mejorar el razonamiento sobre hardware y sistemas físicos.
  • Los primeros resultados de benchmarks ubican a Grok 4.7 en segundo lugar, detrás de Claude Fable 5.1 en GDPval (1695 frente a 1735) y AA-Briefcase (1657 frente a 1678), y detrás de GPT-6 Astra en la prueba de ingeniería eléctrica EEBench.
  • El lanzamiento llegó tras al menos cinco cronogramas de lanzamiento revisados desde finales de julio, y el modelo se activó de inmediato, sin lista de espera, en la app de Grok, Cursor, Grok Build y la API de xAI.
  • Musk dijo que Grok 4.7 debería quedar aproximadamente a la par con Claude Opus 5.0 de Anthropic, y esbozó los próximos modelos (Grok 4.8, Grok 4.9 y un posible Grok 5 líder de frontera) sin asignar fechas de lanzamiento.
xAI lanza Grok 4.7 tras retrasos repetidos y queda detrás de sus rivales de frontera en los benchmarks

xAI, de Elon Musk, lanzó Grok 4.7 el lunes por la tarde, su modelo más capaz hasta la fecha, que la empresa calificó como "una mejora notable sobre Grok 4.6 al mismo precio y velocidad".

Los primeros resultados de benchmarks ubicaron al modelo en segundo lugar, detrás de Claude Fable 5.1 en GDPval y AA-Briefcase, y detrás de GPT-6 Astra en EEBench, una prueba de referencia de ingeniería eléctrica.

El lanzamiento llegó tras una cadena de fechas incumplidas. Musk retrasó el cronograma de lanzamiento al menos cinco veces desde finales de julio: primero "en cuatro semanas", luego "unas semanas", después "3 a 4 semanas", luego "10 días" el 1 de septiembre y, finalmente, "necesita unos días más de cocción" el 11 de septiembre.

Esta vez no hay lista de espera. Grok 4.7 está disponible de inmediato en la app de Grok, Cursor, Grok Build y la API de xAI.

Musk hizo un seguimiento en X, calificando a Grok 4.7 como "una combinación sólida de inteligencia, velocidad y bajo costo".

Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO

SpaceXAI (@SpaceXAI) September 21, 2026

Según el anuncio oficial de xAI, el modelo pasa más tiempo resolviendo problemas difíciles y verifica sus propias respuestas con más frecuencia que Grok 4.6, junto con lo que la empresa describe como sus barreras de seguridad más fuertes hasta ahora.

Escala, precios y datos de SpaceX

Grok 4.7 cuenta con 2.1 billones de parámetros, un aumento del 40% respecto a los 1.5 billones de Grok 4.6 que a su vez era un refinamiento de Grok 4.5. Los costos se fijan en $2 por millón de tokens de entrada y $6 por millón de tokens de salida. Los parámetros son los ajustes internos que un modelo calibra durante el entrenamiento, y una mayor cantidad generalmente significa más capacidad para aprender patrones, mientras que los tokens son las unidades básicas de información que un modelo de IA puede registrar o generar.

xAI también incorporó datos de entrenamiento adicionales obtenidos de SpaceX, la empresa de cohetes de Musk: telemetría satelital de Starlink, registros de fabricación y bitácoras de fallas de ingeniería. La propuesta es un modelo que razona mejor sobre hardware y sistemas físicos que cualquier otro entrenado únicamente con texto de internet.

Los benchmarks cuentan una historia familiar

GDPval mide el desempeño de un modelo en trabajo de conocimiento real y económicamente valioso —memorandos legales, hojas de cálculo, presentaciones— usando tareas validadas por profesionales activos de cada campo, y lo puntúa como una calificación Elo, el mismo sistema de clasificación cabeza a cabeza que usa el ajedrez. Grok 4.7 obtuvo 1695 en GDPval, mientras que Claude Fable 5.1 encabezó la tabla con 1735, una brecha de 40 puntos en la escala Elo.

AA-Briefcase, creado por Artificial Analysis, evalúa trabajo de oficina de varias horas que encadena investigación, análisis y producción de documentos en una sola tarea larga, también puntuado en la escala Elo. Grok 4.7 registró 1657 frente a 1678 de Fable 5.1, una brecha más estrecha de 21 puntos y el mismo resultado en una prueba diferente.

CursorBench 4.0, el benchmark de Cursor para tareas reales de programación dentro de su editor, grafica la precisión frente al costo y la cantidad de tokens que consume cada tarea. Grok 4.7 queda en el punto medio: más caro por tarea que GPT-6 Astra, el sucesor de GPT-5.6 Sol, y Claude Sonnet 5, pero aún por debajo de Fable 5.1, que gana en cada punto de precio del gráfico.

Un patrón recurrente para xAI

La empresa ha lanzado repetidamente modelos insignia que llegaron detrás de sus rivales en evaluaciones independientes. Grok 4.5 debutó en julio con el clúster de entrenamiento más grande de la industria y puntajes en tercer lugar, detrás de los modelos de Claude y OpenAI. Antes de este, Grok 4.20 sacrificó confiabilidad por velocidad y personalidad, y Grok 4.6 quedó detrás del grupo de frontera en autonomía de programación.

Nada de esto convierte a Grok 4.7 en un mal producto para los millones de personas que conversan con él a través de X, la app independiente o el tablero de su Tesla. Lo que significa es que el modelo más propenso a responder las preguntas de los usuarios, o a alimentar el asistente de voz de su auto, funciona sobre un sistema que los propios benchmarks de su creador ubican un escalón por debajo de la cima.

Esa brecha explica por qué, para la mayoría de las personas, el precio importa más que la posición en la tabla de clasificación. xAI ha mantenido consistentemente precios por token más bajos que Anthropic y OpenAI, incluso cuando queda detrás de ellas en capacidad pura, apostando a que "suficientemente bueno, barato y en todas partes" gana a "el mejor, pero más caro" para la mayor parte del uso cotidiano.

Las expectativas de Musk y el camino adelante

Musk ya había moderado las expectativas días antes del lanzamiento, escribiendo en X que Grok 4.7 debería quedar "aproximadamente a la par con" Claude Opus 5.0 de Anthropic, no con el más nuevo Opus 5.1, y que el desempeño multimodal aún necesitaba trabajo.

En esa misma publicación esbozó los próximos tres modelos: Grok 4.8 como un salto significativo, Grok 4.9 en la "clase Astra/Fable" y Grok 5 como un posible líder de frontera. Esas actualizaciones aún no tienen fechas de lanzamiento, un detalle que cobra mayor peso dado que el propio cronograma de Grok 4.7 fue retrasado al menos cinco veces antes del lanzamiento. "Veremos", escribió.