xAI lanza Grok 4.7 con nuevos salvaguardas y mayor rendimiento en tareas de varias horas
Puntos clave
- •Grok 4.7 está construido sobre una base nueva y más grande y entrenado con una ejecución extendida de aprendizaje por refuerzo con tareas más difíciles, lo que según xAI mejora la generación de código, el manejo de contextos largos y la autoverificación.
- •Las mayores mejoras en benchmarks del modelo se produjeron en trabajo de programación y terminal de larga duración, con Terminal-Bench 4.0 subiendo a 38.0% desde 20.3% y CursorBench 4.0 subiendo a 46.3% desde 40.4%.
- •Grok 4.7 se lanza con una pila de seguridad completamente nueva que xAI describió como la más fuerte que ha probado en comportamiento de rechazo y resistencia a jailbreaks, y lidera el benchmark de bioseguridad de LatchBio con 62.4%.
- •El precio se mantiene en los niveles de Grok 4.6: 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida, por debajo de las tarifas de GPT-5.6 Sol y Fable 5.1.
- •Artificial Analysis le dio a Grok 4.7 un puntaje de 46 en su Intelligence Index, una ganancia de dos puntos que ubicó a SpaceXAI entre los cuatro laboratorios de IA principales, pero encontró que el modelo usó alrededor de 81,000 tokens de salida por tarea, más del doble de los 36,000 de Grok 4.6, lo que aumenta los costos efectivos.

xAI ha lanzado Grok 4.7, al que describe como su modelo más capaz hasta la fecha para programación y trabajo de conocimiento. La empresa posicionó el modelo como una oferta de frontera a un precio competitivo, con precios sin cambios respecto a su predecesor, Grok 4.6.
Grok 4.7 está construido sobre una base nueva y más grande y fue entrenado mediante una ejecución extendida de aprendizaje por refuerzo con una mezcla de tareas más difícil, ponderada hacia problemas que requieren muchas horas para completarse. Según xAI, los cambios de entrenamiento mejoran la generación de código, el manejo de contextos largos y la autoverificación. El modelo también comprende de forma nativa el harness de Grok Bot, lo que, según la empresa, lo hace más eficaz en tareas conversacionales y de trabajo de conocimiento general.
Las mayores mejoras reportadas se concentraron en tareas de programación y terminal de mayor duración. En CursorBench 4.0, Grok 4.7 obtuvo 46.3%, frente al 40.4% de Grok 4.6. Su puntaje superó el 41.7% de GPT-5.6 Sol, pero quedó por debajo del 51.8% de Fable 5.1. Con alto esfuerzo en DeepSWE v1.1, Grok 4.7 obtuvo 71.0%, por detrás del 72.7% de GPT-5.6 Sol y superando por poco el 70.0% de Fable 5.1.
El modelo también mejoró a Grok 4.6 en GDPval y AA Briefcase, este último evalúa tareas de oficina de varias horas realizadas por profesionales como abogados, enfermeros y analistas financieros. En AA Briefcase, Grok 4.7 obtuvo 1,657, cerca del 1,678 de Fable 5.1. Su aumento más pronunciado en benchmarks se produjo en Terminal-Bench 4.0, que mide trabajo de terminal de varias horas. El puntaje de Grok 4.7 pasó del 20.3% de Grok 4.6 a 38.0%.
En HackerBench v0.3, que cubre tareas cibernéticas riesgosas, el modelo permitió el paso del 3.3% de los prompts peligrosos de doble uso, mientras que rara vez bloqueó trabajo de seguridad legítimo.
Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed. pic.twitter.com/H3OTBbXyvO — SpaceXAI (@SpaceXAI) September 21, 2026
https://x.com/SpaceXAI/status/2102069815225586149?ref_src=twsrc%5Etfw
Nueva pila de seguridad y precios sin cambios
Una característica central del lanzamiento es la pila de seguridad de Grok 4.7, que xAI describió como completamente nueva y la más fuerte que ha probado en comportamiento de rechazo y resistencia a jailbreaks. El modelo lidera el benchmark de bioseguridad de LatchBio con un puntaje de 62.4%, combinando el rendimiento en tareas benignas con rechazos ante solicitudes peligrosas en campos de doble uso como la ciberseguridad y la investigación bi. xAI también ha comenzado a proporcionar a determinados socios de ciberseguridad acceso solo por invitación a las capacidades de red team del modelo para investigación de defensa.
Grok 4.7 está disponible a las mismas tarifas que Grok 4.6: 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida. Esas tarifas están por debajo de los precios de GPT-5.6 Sol, de 4 y 20 dólares respectivamente, y de los precios de Fable 5.1, de 10 y 50 dólares. Una variante rápida con el doble de velocidad de salida está disponible al doble del precio. Las tarifas fijas por token hacen que la comparación de precios sea sencilla, aunque el costo total del trabajo de larga duración también depende de cuántos tokens consuma un modelo para terminar una tarea.
En la frontera de precio-rendimiento de CursorBench, la tarificación ubica a Grok 4.7 entre las opciones más eficientes en costo para cargas de trabajo extendidas de programación. El modelo está disponible de inmediato en Cursor y Grok Build, además de a través de la API de Grok, harnesses de programación de terceros, enrutadores de modelos y plataformas en la nube.
El lanzamiento intensifica la competencia entre proveedores de modelos de frontera, que cada vez más comparan los sistemas por tareas agentivas de larga duración, calibración de seguridad y costo por tarea completada, además de los puntajes destacados en benchmarks. Para los desarrolladores y empresas que evalúan modelos orientados a la programación, Grok 4.7 combina precios estables con puntajes más altos en tareas de varias horas y nuevos salvaguardas.
Artificial Analysis confirma las mejoras pero señala el consumo de tokens
La firma independiente de benchmarking Artificial Analysis también evaluó Grok 4.7, otorgándole un puntaje de 46 en el Intelligence Index. Fue dos puntos más alto que Grok 4.6 y ubicó a SpaceXAI entre los cuatro laboratorios de IA principales, según la firma. La evaluación externa coincide con el posicionamiento de xAI del lanzamiento como un avance en programación y trabajo de conocimiento.
La evaluación utilizó esfuerzo de razonamiento xhigh e identificó el progreso más claro en trabajo de conocimiento agentivo de largo alcance. En el benchmark privado AA-Briefcase de Artificial Analysis, Grok 4.7 ganó 111 puntos Elo sobre su predecesor para alcanzar 1,657, situándolo junto a Claude Opus 5 y Claude Fable 5.1 en la frontera. El aumento fue impulsado principalmente por la calidad analítica, que subió a 1,994 Elo desde 1,690. La calidad de presentación se mantuvo aproximadamente estable.
En GDPval-AA, que mide productos de trabajo prácticos como documentos, hojas de cálculo y diapositivas, Grok 4.7 obtuvo 1,695 Elo, un aumento de 90 puntos.
Grok 4.7 scores 46 on the Artificial Analysis Intelligence Index to bring SpaceXAI into the top 4 AI labs. Coding Agent Index performance has also improved, overtaking GPT-5.6 Sol Grok 4.7 scores +2 points over Grok 4.6 on the Intelligence Index, with strong performance on… pic.twitter.com/8p4KC6cgZy — Artificial Analysis (@ArtificialAnlys) September 21, 2026
https://x.com/ArtificialAnlys/status/2102074898327932987?ref_src=twsrc%5Etfw
Artificial Analysis encontró que las mejoras de rendimiento requirieron considerablemente más cómputo. Con esfuerzo xhigh, Grok 4.7 utilizó aproximadamente 81,000 tokens de salida por tarea del Intelligence Index, más del doble de los 36,000 tokens usados por Grok 4.6 y casi el triple de los 27,000 tokens consumidos por GPT-6 Astra a máximo esfuerzo. Dado que las tarifas por token no cambiaron, ese mayor consumo eleva el costo efectivo de una tarea comparable aunque los precios publicados se mantuvieron sin cambios.
La firma reportó mejoras adicionales modest en Terminal-Bench 4.0 y GDP.pdf, junto con pequeñas regresiones en AA-LCR y AutomationBench-AA. La confiabilidad mejoró de forma moderada: la tasa de alucinaciones de AA-Omniscience cayó a 29% desde 34%, mientras que la precisión se mantuvo casi sin cambios en 47%.
Otras especificaciones técnicas siguen siendo las mismas que en la generación anterior, incluida una ventana de contexto de 500,000 tokens. La tarificación de aciertos de caché tiene un descuento a 0.50 dólares por millón de tokens. Con el modelo activo en Cursor, Grok Build, la API de Grok, harnesses de terceros, enrutadores de modelos y plataformas en la nube, los desarrolladores ahora pueden sopesar las mejoras en benchmarks frente al mayor consumo de tokens en sus propias cargas de trabajo. El reporte original está disponible en Metaverse Post.