Claude Sonnet 5.5 ocupa el tercer lugar en el leaderboard de Agent Arena
Puntos clave
- •Claude Sonnet 5.5 ingresó al Agent Arena de Arena.ai en el tercer lugar con una puntuación neta de mejora de 12.52%, detrás de dos modelos de Anthropic: Claude Fable 5.1 (Max) con 14.31% y Claude Opus 5.5 (High) con 13.82%.
- •El modelo superó por poco a GPT-6 Astra (Max) de OpenAI, que ocupa el cuarto lugar con 12.27%, pero la brecha de 0.25 puntos es menor que el margen de error de Sonnet 5.5 de más o menos 3.09%, por lo que la clasificación podría cambiar.
- •En Terminal-Bench 4.0, Sonnet 5.5 obtuvo 70.6%, un gran aumento frente al aproximadamente 10-14% que logró su predecesor Sonnet 5, y también superó el 66.4% de Opus 5.5.
- •Sonnet 5.5 corre más de 30% más rápido que Sonnet 5 manteniendo los mismos precios de $2 por millón de tokens de entrada y $10 por millón de tokens de salida, con una ventana de contexto de 1 millón de tokens.
- •Arena lista el costo de Sonnet 5.5 en $2.74 por tarea, y su mayor consumo de tokens en comparación con la mayoría de sus pares puede determinar su gasto real por trabajo en despliegues de producción.

El nuevo modelo de gama media de Anthropic se ubicó en el tercer lugar del leaderboard de Agent Arena de Arena.ai. Claude Sonnet 5.5, lanzado el 28 de septiembre de 2026, registró una puntuación neta de mejora de 12.5%, suficiente para superar al principal competidor de OpenAI. Solo dos modelos están por encima, y ambos también son de Anthropic.
Cómo queda el leaderboard
Días después de su lanzamiento, Sonnet 5.5 había escalado hasta la tercera posición de Agent Arena. Su puntuación neta de mejora exacta es de 12.52%, con un margen de error de más o menos 3.09%.
Los dos modelos que lo preceden son Claude Fable 5.1 (Max) con 14.31% y Claude Opus 5.5 (High) con 13.82%. Justo debajo se ubica GPT-6 Astra (Max) de OpenAI con 12.27%. Con estos resultados, Anthropic ocupa tres de las cuatro primeras posiciones del ranking.
Agent Arena evalúa a los modelos en millones de tareas agentivas del mundo real, en las que una IA debe usar herramientas, completar trabajos de varios pasos y satisfacer a usuarios reales. La puntuación incorpora la confiabilidad en el uso de herramientas, la finalización de tareas y la retroalimentación de los usuarios. Ese énfasis refleja un cambio más amplio en la industria: a medida que los despliegues dependen de los modelos para invocar herramientas y ejecutar trabajos de varios pasos, los rankings se disputan cada vez más en la ejecución de tareas de extremo a extremo y no solo en la respuesta estática a preguntas.
El costo es el otro dato destacado. Arena lista a Sonnet 5.5 en $2.74 por tarea, mientras que las capturas de principios de octubre sitúan su costo mediano en alrededor de $2.78 por tarea. El modelo también consume más tokens que la mayoría de sus pares.
Los benchmarks más allá de Arena
El buen desempeño de Sonnet 5.5 se extiende a otros benchmarks. En el Artificial Analysis Intelligence Index obtuvo 56 puntos, suficiente para el segundo lugar detrás de Opus 5.5 (Max).
En Terminal-Bench 4.0, Sonnet 5.5 logró 70.6%, un salto considerable respecto a su predecesor, Sonnet 5, que alcanzó aproximadamente entre 10% y 14% en la misma prueba. El nuevo modelo también superó a Opus 5.5, que obtuvo 66.4% en Terminal-Bench 4.0.
La velocidad también mejoró: Sonnet 5.5 corre más de 30% más rápido que Sonnet 5. Los precios, sin embargo, no cambiaron. El modelo sigue costando $2 por millón de tokens de entrada y $10 por millón de tokens de salida, igual que antes. Sonnet 5.5 ofrece una ventana de contexto de 1 millón de tokens y una salida máxima de 128,000 tokens. Con precios por token sin cambios mientras la velocidad y las puntuaciones medidas aumentaron, la actualización modifica la ecuación de capacidad por dólar, aunque el mayor apetito de tokens del modelo, visible en sus cifras de Arena, sigue siendo la variable que determina el costo real por trabajo.
Lo que esto significa para la carrera de modelos de IA
Lo primero que hay que observar es el margen de error. La puntuación de Sonnet 5.5 lleva un margen de más o menos 3.09%, y la diferencia total que separa a los cuatro primeros modelos es menor que eso. GPT-6 Astra (Max) va detrás de Sonnet 5.5 por solo 0.25 puntos porcentuales. Con brechas tan estrechas, el orden puede cambiar a medida que Arena agrega resultados de tareas, por lo que la clasificación debe leerse como una foto actual y no como una jerarquía definida.
El consumo de tokens también importa aquí. Un mayor uso de tokens puede erosionar la ventaja de costo según la carga de trabajo: un modelo barato por token pero verboso no siempre es barato por trabajo. Para los equipos que ejecutan agentes en producción, esas dos columnas, puntuación y costo por tarea, terminan en la misma hoja de cálculo, razón por la cual cualquier lanzamiento que reordene la cima de rankings como Agent Arena se pondera en ambas dimensiones.