Stair AI Publica Resultados del Arena de Agentes de la Copa Mundial de 39 Días
Puntos clave
- •Stair AI evaluó a 56 agentes de IA autónomos mientras realizaban apuestas en Polymarket durante los 39 días del torneo de la Copa Mundial.
- •El Arena generó 71,203 registros de trazas en 20,851 sesiones utilizando el SDK de razonamiento de Stair AI.
- •El enfoque de evaluación de Stair AI examinó la trazabilidad del razonamiento, la consistencia de probabilidades, el desempeño frente al precio de cierre y la capacidad de respuesta a nueva información.
- •En 103 partidos resueltos, el 68% de los agentes habría ganado más alineando el tamaño de sus apuestas con sus propias probabilidades declaradas.
- •Stair AI planea poner las trazas de razonamiento del Arena a disposición para investigación académica a través de una alianza que se anunciará.

SAN FRANCISCO, CA — Stair AI, una empresa con sede en San Francisco que desarrolla infraestructura de auditabilidad y responsabilidad para agentes de IA, publicó los resultados de su World Cup Agent Arena, una evaluación en vivo en la que 56 agentes de IA autónomos realizaron apuestas en Polymarket durante los 39 días del torneo.
Polymarket, un mercado de predicción basado en blockchain, permite a los usuarios operar sobre los resultados de eventos del mundo real, con precios que reflejan estimaciones de probabilidad generadas colectivamente. La plataforma se ha convertido en un campo de prueba popular para evaluar la toma de decisiones de la IA bajo incertidumbre.
Cada agente que participó en el Arena funcionó con el SDK de razonamiento de Stair AI. El SDK registra trazas completas de razonamiento, incluyendo creencias, estimaciones de probabilidad y las decisiones que se derivan de ellas. A lo largo del torneo, el Arena generó 71,203 registros de trazas en 20,851 sesiones.
En lugar de clasificar a los agentes únicamente por sus ganancias, Stair AI indicó que utilizó una rúbrica de evaluación multidimensional. La evaluación midió si el razonamiento de un agente podía rastrearse hasta los datos de entrada, si sus apuestas eran consistentes con sus propias probabilidades declaradas, si superaba el precio de cierre del mercado y si se actualizaba adecuadamente a medida que llegaba nueva información. La calidad de las políticas se evaluó comparando las acciones de un agente con sus propias creencias registradas. Este enfoque refleja un cambio más amplio en la evaluación de la IA hacia la medición de la coherencia interna y la alineación, no solo de los resultados de las tareas — una preocupación que ha crecido a medida que los agentes autónomos se implementan cada vez más en entornos financieros, operativos y de investigación, donde el razonamiento detrás de una decisión importa tanto como el resultado.
Los resultados mostraron una brecha costosa entre lo que los agentes registraron como sus creencias y cómo finalmente colocaron sus apuestas. En 103 partidos resueltos, el 68% de los agentes habría terminado con más dinero si hubiera ajustado el tamaño de sus apuestas de acuerdo con sus propias probabilidades declaradas, utilizando los mismos pronósticos y el mismo capital. En el 24% de las apuestas, los agentes actuaron en contra del resultado que su propio razonamiento respaldaba con mayor fuerza.
"El Arena demostró que el resultado por sí solo no te dice si un agente razonó bien," dijo Cagri Yalcin, gerente de comunidad de Stair AI. "Los errores costosos no fueron malas interpretaciones de un partido. Fueron agentes que formaron una opinión a partir de los datos y luego actuaron en contra de ella, un tipo muy humano de segunda guessing. Se encuentra la brecha midiendo el razonamiento, no el resultado."
Stair AI indicó que pondrá las trazas de razonamiento del Arena a disposición para investigación académica a través de una alianza que se anunciará. El conjunto de datos incluye 71,203 registros de trazas que cubren 103 partidos y 56 agentes.
Los resultados completos, la metodología de evaluación y la documentación de trazas están disponibles en stair-ai.com/arena.
Stair AI desarrolla infraestructura diseñada para hacer que el comportamiento de los agentes de IA sea medible, auditable y mejorable. Su SDK de razonamiento registra trazas completas de razonamiento, incluyendo creencias, decisiones y los vínculos entre ellas. La empresa tiene su sede en San Francisco.