SpaceXAI de Elon Musk lanza Grok 4.7 con 71% en el benchmark DeepSWE
Puntos clave
- •SpaceXAI lanzó Grok 4.7 el 21 de septiembre, describiéndolo como su modelo más capaz hasta la fecha para programación y trabajo de conocimiento, con entrenamiento enfocado en tareas que toman varias horas en completarse.
- •El modelo se lanza a $2 por millón de tokens de entrada y $6 por millón de tokens de salida, idéntico a Grok 4.6 y muy por debajo de GPT-5.6 Sol a $4/$20 y Fable 5.1 a $10/$50.
- •Según los benchmarks publicados por SpaceXAI, Grok 4.7 obtuvo 71.0% en DeepSWE v1.1, elevó Terminal-Bench 4.0 a 38.0% desde el 20.3% de su predecesor, y lideró en EEBench y el benchmark de agentes legales Harvey, quedando detrás de Fable 5.1 en CursorBench 4.0 y HealthBench Professional.
- •Un stack de seguridad reconstruido bloqueó todo menos el 3.3% de los prompts de alto riesgo de doble uso en HackerBench v0.3, con pocos rechazos erróneos, y socios de ciberseguridad seleccionados recibieron acceso de equipo rojo solo por invitación.
- •Horas antes del lanzamiento, las tres configuraciones de Grok 4.6 perdieron contra todas las configuraciones de Codex y Claude en el Brood War Bench de Ben Swerdlow, con un mejor resultado de 2 victorias en 18 partidos, y Grok 4.7 no ha sido clasificado.

Grok 4.7 está diseñado para cargas de trabajo de varias horas
SpaceXAI, la unidad de inteligencia artificial de Elon Musk, lanzó Grok 4.7 el 21 de septiembre, describiéndolo como el modelo más capaz de la empresa hasta la fecha para programación y trabajo de conocimiento. Según el anuncio oficial, el nuevo sistema funciona sobre un modelo base más grande que Grok 4.6 y pasó por ciclos más largos de aprendizaje por refuerzo con mezclas de tareas más difíciles, con un énfasis deliberado en problemas que toman varias horas en completarse.
La empresa enmarcó el lanzamiento en torno a la resistencia. Mientras los modelos anteriores respondían en minutos, Grok 4.7 está afinado para trabajar durante horas en tareas que ocuparían a un ingeniero o analista humano. SpaceXAI dijo que el modelo ahora es notablemente mejor verificando su propio resultado en ejecuciones largas, manejando ventanas de contexto muy extensas (la cantidad de texto que un modelo puede mantener a la vez en su vista de trabajo) y operando de forma nativa el framework de agentes Grok Bot, un esquema de múltiples pasos en el que un modelo planifica, llama herramientas y ejecuta trabajo por sí mismo en lugar de responder a un solo prompt — mejoras que, según la empresa, son visibles en la conversación, las tareas de conocimiento general y la generación de documentos y presentaciones profesionales.
En los benchmarks publicados, la configuración xhigh se sitúa cerca de la frontera. En DeepSWE v1.1, una suite de ingeniería de software, Grok 4.7 obtuvo 71.0%, superando a Fable 5.1 max con 70.0% y siendo superado solo por GPT-5.6 Sol max con 72.7%. En Terminal-Bench4.0, que evalúa trabajo de terminal de varias horas, el modelo saltó a 38.0% desde el 20.3% de su predecesor. En suites que simulan trabajos profesionales de varias horas para abogados, enfermeros y analistas financieros — AA Briefcase y HealthBench entre ellas — SpaceXAI dijo que Grok 4.7 ahora está a la par de los mejores de la industria.
La seguridad es la otra afirmación destacada. Un stack de seguridad reconstruido hace de esta la versión más resistente de la empresa hasta la fecha para rechazar solicitudes impropias y resistir jailbreaks, los intentos de convencer a un modelo de eludir sus salvaguardas. En HackerBench v0.3, que evalúa tareas cibernéticas maliciosas, solo el 3.3% de los prompts de alto riesgo de doble uso — solicitudes con aplicaciones legítimas y dañinas a la vez — pasó el filtro, con pocos rechazos erróneos de trabajo legítimo de seguridad defensiva. Algunos socios de ciberseguridad seleccionados recibieron acceso de equipo rojo solo por invitación, pruebas adversarias en las que investigadores de seguridad buscan debilidades de un sistema, para apoyar la investigación de defensa.
El modelo ya está disponible a través de Cursor, Grok Build, la API de Grok, las principales plataformas en la nube y los enrutadores de modelos, los servicios que entregan la solicitud de un desarrollador al modelo de IA que elijan a través de una sola interfaz.
El precio de $2 se mantiene mientras el Brood War Bench avergüenza a Grok 4.6
El precio es la constante silenciosa: Grok 4.7 se lanza a $2 por millón de tokens de entrada y $6 por millón de tokens de salida — idéntico a Grok 4.6 — además de una variante rápida que duplica la velocidad de salida al doble del precio. Los tokens son las unidades de texto que los modelos de lenguaje leen y generan, y la facturación de la API se mide en ellos: la entrada cubre lo que el desarrollador envía y la salida lo que el modelo responde. Las tarifas socavan fuertemente a la competencia: GPT-5.6 Sol se lista a $4/$20 por millón de tokens y Fable 5.1 a $10/$50, lo que sitúa el precio de Grok en aproximadamente un tercio a la mitad de los niveles rivales, con entrega más rápida.
La propia tabla comparativa de SpaceXAI muestra que Grok 4.7 lidera en ingeniería eléctrica (EEBench: 64.0% frente a 39.4% de GPT-5.6 Sol y 56.4% de Fable 5.1) y en el benchmark de agentes legales Harvey (19.6% frente a 2.5% y 6.7%), mientras que queda detrás de Fable 5.1 en ingeniería de software (CursorBench 4.0: 46.3% frente a 51.8%) y en razonamiento clínico (HealthBench Professional: 56.7% frente a 62.1%). Todas las cifras provienen de los datos publicados por SpaceXAI.
El trasfondo corporativo importa: SpaceXAI adquirió su forma actual en febrero, cuando xAI se fusionó con SpaceX, seguido por la adquisición de Cursor en junio, el editor de código con IA que también funciona como uno de los canales de lanzamiento de Grok 4.7 — parte del imperio Musk que abarca Tesla (TSLA) y, según informes anteriores, un impulso para consolidar planes de suscripción de IA en cuestión de semanas.
Sin embargo, horas antes del lanzamiento, un benchmark generado por la comunidad golpeó al predecesor. El Brood War Bench del desarrollador Ben Swerdlow, en el que agentes de IA juegan StarCraft: Brood War, circuló en X el 20 de septiembre: 19 configuraciones de Codex, Claude y Grok disputaron 171 enfrentamientos directos, y Codex Astra barrió los 18 de sus partidos con razonamiento máximo. Las tres configuraciones de Grok 4.6 perdieron contra todas las configuraciones de Codex y Claude, con un mejor resultado de 2 victorias en 18. La estrategia en tiempo real es una prueba exigente para los agentes porque las decisiones de economía, producción y combate llegan de manera continua — no hay un turno en el que pausar y planificar.
Swerdlow registró un partido en el que una configuración de Grok con razonamiento máximo consumió 11,138 tokens de razonamiento durante 43 minutos y solo emitió seis lotes de comandos — sin desplegar jamás una sola unidad de combate. Escribió que Grok aún no es lo suficientemente inteligente para el juego, con modelos más antiguos que tratan la estrategia en tiempo real como por turnos, y agregó que ningún participante superó el nivel principiante. Grok 4.7 no ha sido clasificado.
La lectura de COINOTAG: la presión sobre los precios es la verdadera señal
En conjunto, las cifras del día de lanzamiento y los resultados de Brood War cuentan una sola historia: los laboratorios fronterizos ahora venden razonamiento a precios de commodity, y la confiabilidad agéntica — no los puntajes estáticos de benchmarks — decide quién gana. En la evaluación de COINOTAG, el esquema de $2/$6 le da a Grok 4.7 una tokenómica que los rivales deben igualar, de la misma manera que los precios de futuros obligan a los mercados a reanclar expectativas, mientras que los laboratorios sin cómputo comparable corren el riesgo de convertirse en liquidez de salida en esta guerra de precios. El medio agregó que los titulares de cómputo de Musk históricamente han movido el sentimiento en activos vinculados a Musk como Dogecoin (DOGE), y recomendó observar los resultados agénticos de Grok 4.7 en lugar de sus afirmaciones de lanzamiento.