Datos de Arena AI muestran que la brecha entre modelos de IA de frontera y de pesos abiertos se amplía a 29 puntos Elo
Puntos clave
- •La brecha de calificación Elo entre los mejores modelos de IA cerrados y de pesos abiertos se amplió de cero en enero de 2025 a 29 puntos hasta septiembre de 2026, según datos de evaluación de Arena AI.
- •El análisis de Epoch AI muestra que los modelos de pesos abiertos ahora van aproximadamente cuatro meses por detrás de los modelos cerrados en las tareas más desafiantes, frente al retraso de tres meses observado hasta finales de 2025.
- •Arena, que comenzó como un proyecto de investigación de la UC Berkeley en 2023, alcanzó 100 millones de dólares en ingresos anualizados en ocho meses tras lanzar sus servicios de evaluación de pago.
- •La mayor parte del desarrollo de frontera de modelos de pesos abiertos proviene ahora de laboratorios chinos como Moonshot AI, Zhipu, DeepSeek y Alibaba, mientras los responsables de políticas en EE. UU. y Europa debaten restringir los lanzamientos de pesos abiertos por encima de ciertos umbrales de capacidad.
- •La ampliación de la brecha significa que empresas y gobiernos que priorizan el control de datos y el cumplimiento normativo enfrentan una disyuntiva creciente entre soberanía y desempeño puro de los modelos.

En enero de 2025, los modelos de IA de pesos abiertos alcanzaron brevemente la paridad con sus rivales de código cerrado, con la brecha de calificación Elo en la tabla de clasificación colaborativa de Arena cayendo a cero. Ese momento ya pasó. Hasta septiembre de 2026, la brecha entre los mejores modelos cerrados de frontera y sus principales competidores de pesos abiertos se ha ampliado a 29 puntos Elo, según los datos de evaluación de Arena AI.
Claude Opus 5 Max ostenta actualmente una calificación de 1505, mientras que Kimi K3 Max de Moonshot AI, el contendiente de pesos abiertos más fuerte, se queda atrás por casi 30 puntos. Peter Gostev, líder de Capacidades de IA de Arena, ha sido central en el seguimiento y la visualización de esta divergencia.
Lo que está en juego con esta brecha va más allá de las tablas de clasificación. Los modelos de pesos abiertos —cuyos parámetros pueden descargarse y ejecutarse en la infraestructura propia del cliente— resultan atractivos para empresas y gobiernos que priorizan el control de datos, el cumplimiento normativo y evitar tarifas de API por token. Una brecha de capacidades creciente significa que las organizaciones con esos requisitos enfrentan cada vez más una disyuntiva entre soberanía y desempeño puro. A la inversa, el retraso de aproximadamente cuatro meses significa que los usuarios de pesos abiertos obtienen capacidades que los modelos cerrados ya ofrecen, solo que con demora.
Qué significan realmente los números
La trayectoria revela más que cualquier instantánea aislada. De cero en enero de 2025 a 29 puntos en septiembre de 2026, la tendencia se aleja de la paridad para los modelos de pesos abiertos. El análisis de Epoch AI refuerza este panorama desde otro ángulo: los modelos de pesos abiertos ahora van aproximadamente cuatro meses por detrás de sus contrapartes cerradas en el desempeño en las tareas más desafiantes, frente al retraso de tres meses observado hasta finales de 2025.
Arena procesa más de 10 millones de evaluaciones al mes, aprovechando un gran volumen de interacciones de usuarios reales en lugar de pruebas sintéticas. Esto importa porque las pruebas estáticas han sido criticadas repetidamente por contaminación —filtración de datos de prueba en los conjuntos de entrenamiento— y por no capturar cómo se comportan los modelos ante instrucciones reales y desordenadas. Cuando millones de usuarios anónimos prefieren de forma constante las salidas de un modelo sobre las de otro, esa señal es difícil de ignorar.
Los puntos Elo también requieren interpretación: una brecha de 29 puntos en la escala de Arena no significa que los modelos cerrados sean categóricamente mejores en todo. Los modelos pueden estar cerca en general y mostrar grandes diferencias en tipos de tareas específicas, razón por la cual el trabajo de Gostev en desgloses por capacidad ha llamado la atención.
El negocio de medir la IA
Arena en sí se ha convertido en una notable historia empresarial. Lo que comenzó como un proyecto de investigación de la UC Berkeley en 2023 se ha convertido en una empresa que genera 100 millones de dólares en ingresos anualizados, alcanzando ese nivel apenas ocho meses después de lanzar sus servicios de evaluación de pago. Su monetización refleja una señal de demanda más amplia: a medida que las empresas destinan presupuestos a la IA, están dispuestas a pagar por mediciones independientes basadas en preferencias humanas sobre qué modelos realmente funcionan.
La contribución de Gostev se ha centrado en hacer legibles las debilidades de los modelos. Su trabajo destaca la tensión entre el desempeño de los modelos cuando los evalúan expertos en el dominio frente a usuarios generales, una distinción que importa significativamente para los despliegues empresariales —el favorito de una tabla de usuarios generales puede no ser el mejor modelo para, por ejemplo, trabajos legales o médicos.
La geopolítica de los modelos abiertos
El desarrollo más activo de modelos de pesos abiertos se ha desplazado fuertemente hacia los laboratorios chinos. La serie Kimi de Moonshot AI, GLM de Zhipu, DeepSeek y Qwen de Alibaba representan la frontera de lo que está disponible públicamente. Esto tiene peso en materia de políticas: en Estados Unidos y Europa, los lanzamientos de pesos abiertos se debaten en el marco de regulaciones de IA propuestas, y algunos responsables de políticas abogan por restringir los pesos abiertos por encima de ciertos umbrales de capacidad. Mientras tanto, la mayoría de los lanzamientos de frontera de pesos abiertos ahora se originan en China, lo que significa que la frontera públicamente inspeccionable de la IA está cada vez más moldeada por decisiones de ingeniería y términos de licencia chinos. Sin embargo, la brecha persiste, ya que Anthropic, OpenAI y Google DeepMind siguen avanzando sus modelos cerrados más lejos y más rápido.
La pregunta abierta hacia adelante es si el retraso de cuatro meses se mantiene, se amplía o se reduce —la respuesta condicionará las decisiones de adquisición de las organizaciones que apostaron por la infraestructura abierta, y cuánto poder de negociación conservarán los proveedores de modelos cerrados en materia de precios.