Los nuevos benchmarks de juegos de Epoch AI dejan a los mejores modelos de IA por debajo del 60%, exponiendo brechas de razonamiento
Puntos clave
- •Epoch AI lanzó dos benchmarks que comprenden 100 puzzles generados de forma programática cada uno, diseñados para evitar la memorización y medir el razonamiento auténtico sin permitir andamiaje de agentes, prompting de cadena de pensamiento ni uso de herramientas.
- •En Mystery Game Puzzles, el modelo con mejor rendimiento alcanzó solo el 59% mientras que los modelos de pesos abiertos se estancaron en el 38%, revelando una brecha significativa entre los sistemas de código cerrado y los de pesos abiertos en tareas de razonamiento intensivo.
- •El rendimiento en Chess Puzzles mejoró del 37% con GPT-5 en su lanzamiento en diciembre de 2025 al 54% con lanzamientos posteriores de modelos, lo que indica un progreso medible pero aún incompleto en razonamiento independiente.
- •Una evaluación relacionada llamada EBR-bench mostró una mejora limitada de la IA en el aprendizaje a partir de interacciones repetidas hasta julio de 2026, reforzando que el razonamiento interactivo sigue siendo un desafío persistente.
- •El diferencial de rendimiento entre los modelos de pesos abiertos y los de código cerrado plantea interrogantes sobre si las mejoras en la arquitectura por sí solas pueden cerrar la brecha de razonamiento o si las metodologías de entrenamiento propietarias desempeñan un papel decisivo.

Epoch AI, un instituto de investigación sin fines de lucro, ha introducido dos herramientas de evaluación basadas en juegos —Mystery Game Puzzles y Chess Puzzles— orientadas a probar rigurosamente las capacidades de razonamiento de los principales modelos de inteligencia artificial. Los hallazgos iniciales revelan limitaciones significativas en la capacidad de los sistemas de IA actuales para manejar escenarios novedosos de resolución de problemas, un resultado que llega en un momento en el que múltiples laboratorios de vanguardia comercializan cada vez más sus últimos modelos en torno a la proficiency en razonamiento y planificación.
El resultado destacado: la puntuación más alta alcanzada en el benchmark Mystery Game Puzzles es de apenas el 59%, mientras que los modelos de pesos abiertos no superan el 38%.
Cómo funcionan los benchmarks
Cada benchmark consta de 100 puzzles generados de forma programática. Los Chess Puzzles siguen un formato relativamente convencional: dada una posición específica en el tablero, el modelo debe identificar la mejor jugada.
Los Mystery Game Puzzles adoptan un enfoque fundamentalmente distinto. En esta variante, no se le indica a la IA qué juego está jugando. La identidad del juego se oculta intencionalmente, eliminando cualquier dependencia de patrones memorizados o atajos en los datos de entrenamiento. Este diseño aborda directamente lo que Epoch AI identifica como un problema de contaminación en los benchmarks tradicionales de IA, donde los modelos suelen entrenarse con conjuntos de datos de internet que incluyen las mismas pruebas utilizadas para evaluarlos.
Esa preocupación por la contaminación se ha vuelto más apremiante a medida que benchmarks de uso generalizado como MMLU y GSM8K han visto sus puntuaciones máximas agruparse cerca del techo, reduciendo su capacidad para diferenciar entre los modelos líderes. Las evaluaciones que resisten la memorización se han vuelto escasas, lo que hace que las pruebas generadas programáticamente sean cada vez más valiosas para una evaluación honesta de las capacidades.
Al generar puzzles de forma programática y ocultar el formato del juego, Epoch AI elimina la red de seguridad del reconocimiento de patrones, obligando a los modelos a exhibir capacidades auténticas de razonamiento espacial y planificación.
Las respuestas se evalúan utilizando notación de movimientos normalizada medida contra una clave de respuestas establecida. Los benchmarks no permiten el uso de andamiaje de agentes, técnicas de prompting de cadena de pensamiento ni uso de herramientas.
Resultados de rendimiento actuales
En los Mystery Game Puzzles, ningún modelo ha superado el 59%. Los modelos de pesos abiertos se estancan en el 38%, lo que subraya una notable brecha de rendimiento entre los sistemas de vanguardia de código cerrado y sus contrapartes de pesos abiertos.
Los Chess Puzzles presentan un panorama algo más alentador. GPT-5 registró una puntuación del 37% cuando se introdujo el benchmark en diciembre de 2025. Lanzamientos posteriores de modelos han elevado esa cifra al 54%, reflejando una mejora medible dentro de un período de tiempo relativamente corto.
Sin embargo, incluso el resultado del 54% en los puzzles de ajedrez subraya una distinción crítica: la proficiencia en el ajedrez con acceso a herramientas basadas en búsqueda es fundamentalmente distinta de razonar a través de posiciones desconocidas de forma independiente. Los motores de ajedrez tradicionales como Stockfish logran un juego sobrehumano mediante árboles de búsqueda exhaustivos y funciones de evaluación, no a través del tipo de razonamiento generalizado que se espera que demuestren los modelos de lenguaje. Un modelo que obtiene un 54% sin herramientas está siendo medido contra un estándar fundamentalmente diferente al del juego asistido por motor.
Ningún benchmark parece estar acercándose a la saturación, una propiedad notable en un momento en que muchas evaluaciones de IA establecidas ya no pueden separar de manera significativa a los modelos de vanguardia entre sí.
Implicaciones más amplias
Epoch AI opera un hub de benchmarking más amplio que incluye el Epoch Capabilities Index (ECI), el cual agrega evaluaciones de modelos en matemáticas, programación y jugabilidad. El ECI está diseñado para ofrecer estimaciones rápidas de capacidad sin depender de ninguna prueba individual.
Una evaluación relacionada llamada EBR-bench, basada en el juego Earthborne Rangers, mostró una mejora limitada de la IA en el aprendizaje a partir de interacciones repetidas hasta julio de 2026. Este resultado refuerza la observación de que el razonamiento interactivo sigue siendo un desafío persistente para los sistemas de IA.
El avance del 37% al 54% en los puzzles de ajedrez durante varios meses indica que el progreso continúa. Sin embargo, los resultados de mystery game sugieren que el razonamiento generalizado avanza a un ritmo más lento de lo que podrían implicar los materiales promocionales de las empresas de IA.
La brecha del 38% frente al 59% entre los modelos de pesos abiertos y los de código cerrado en tareas de razonamiento intensivo pone de relieve una disparidad competitiva tangible. Para los proyectos de IA descentralizada que dependen de modelos abiertos, este diferencial de rendimiento representa una desventaja estructural que es poco probable que se resuelva únicamente con infraestructura de cómputo adicional. La brecha también plantea interrogantes sobre si el desarrollo de pesos abiertos puede cerrar el déficit de razonamiento simplemente mediante mejoras en la arquitectura, o si las metodologías de entrenamiento propietarias y la curación de datos desempeñan un papel decisivo que las licencias abiertas actuales no pueden replicar.