Gemini 3.7 Flash de Google DeepMind alcanza el puesto 20 en el ranking de Agent Arena
Puntos clave
- •Agent Arena clasifica los modelos de IA según el rendimiento en tareas en vivo utilizando datos de más de 1,7 millones de sesiones de usuario.
- •Gemini 3.7 Flash ascendió al puesto 20 tras registrar una mejora de puntuación del 3,4%.
- •Actualmente hay diecinueve modelos clasificados por encima de Gemini 3.7 Flash en la tabla de clasificación.
- •Gemini 3.5 Flash de Google ocupa el puesto 27, mientras que Gemini 3.6 Flash se encuentra alrededor del puesto 34.
- •Gemini 3.7 Flash no ha sido lanzado oficialmente a mediados de agosto de 2026.

Gemini 3.7 Flash de Google DeepMind ha avanzado a la posición 20 en la tabla de clasificación de Agent Arena, un sistema de ranking en vivo operado por arena.ai que evalúa los modelos de IA según su rendimiento en tareas del mundo real. El modelo registró una mejora de puntuación del 3,4%, lo que lo sitúa en un ranking diseñado para reflejar cómo se comportan los modelos en flujos de trabajo prácticos en lugar de en pruebas de referencia estáticas.
Cómo Agent Arena evalúa los modelos
A diferencia de las clasificaciones convencionales que se basan en preguntas de cultura general o exámenes estandarizados, Agent Arena clasifica los modelos de IA en función de la orquestación de herramientas en el mundo real y la eficacia en la finalización de tareas. La plataforma se basa en datos de más de 1,7 millones de sesiones de usuario y supervisa métricas como la alucinación de herramientas —cuando un modelo intenta con seguridad usar una herramienta que no existe o aplica incorrectamente una disponible— junto con las tasas de éxito generales.
Debido a que el ranking se basa en datos de uso en vivo, los cambios pueden ir más allá de una simple actualización de puntuación: pueden indicar cómo está rindiendo un modelo cuando tiene que elegir herramientas, recuperarse de errores y completar tareas en entornos que se asemejan más a los despliegues de agentes que a las indicaciones de estilo examinario.
Comparación generacional de los modelos Flash
La progresión dentro de la línea Flash de Google pone de relieve el ritmo de iteración de los modelos. Gemini 3.5 Flash ocupa actualmente el puesto 27 con una mejora neta del 0,39%, mientras que Gemini 3.6 Flash se sitúa más atrás, aproximadamente en el puesto 34.
Gemini 3.6 Flash se lanzó el 21 de julio de 2026. Esa generación de modelos se centró en lograr una reducción del 17% en los tokens de salida en comparación con sus predecesores.
Las referencias encontradas en el SDK de Python GenAI de Google indican que la variante 3.7 está diseñada para mejorar aún más la eficiencia de tokens al mismo tiempo que integra el rendimiento del agente multimodal. Esto permitiría al modelo operar con texto, imágenes y potencialmente otros tipos de datos dentro de un mismo flujo de trabajo agéntico. A mediados de agosto de 2026, Gemini 3.7 Flash aún no ha sido lanzado oficialmente.
Posición competitiva
Con Gemini 3.7 Flash en el puesto 20, actualmente hay 19 modelos que superan su rendimiento en tareas de agentes del mundo real. No se ha divulgado ninguna metodología oficial que detalle cómo se calculó la cifra de mejora del 3,4%. La puntuación de Agent Arena es dinámica: los modelos pueden subir o bajar en el ranking a medida que entran nuevos competidores y se recopilan datos adicionales de sesiones de usuario.