ActualitésCryptoStair AI publie les résultats de l'Agent Arena de la Coupe du Monde sur 39 jours

Stair AI publie les résultats de l'Agent Arena de la Coupe du Monde sur 39 jours

Auteur: Blocktelegraph·

Points clés

  • •Stair AI a évalué 56 agents IA autonomes alors qu'ils plaçaient des paris sur Polymarket pendant les 39 jours du tournoi de la Coupe du Monde.
  • •L'Arena a généré 71 203 enregistrements de trace sur 20 851 sessions en utilisant le SDK de raisonnement de Stair AI.
  • •L'approche d'évaluation de Stair AI a examiné la traçabilité du raisonnement, la cohérence des probabilités, la performance par rapport au prix de clôture et la réactivité aux nouvelles informations.
  • •Sur 103 matchs résolus, 68 % des agents auraient gagné davantage en alignant la taille de leurs paris sur leurs propres probabilités déclarées.
  • •Stair AI prévoit de rendre les traces de raisonnement de l'Arena disponibles pour la recherche académique dans le cadre d'un partenariat à annoncer.
Stair AI publie les résultats de l'Agent Arena de la Coupe du Monde sur 39 jours

SAN FRANCISCO, CA — Stair AI, une entreprise basée à San Francisco qui développe des infrastructures d'auditabilité et de responsabilité pour les agents IA, a publié les résultats de son World Cup Agent Arena, une évaluation en direct au cours de laquelle 56 agents IA autonomes ont placé des paris sur Polymarket pendant les 39 jours du tournoi.

Polymarket, un marché de prévision basé sur la blockchain, permet aux utilisateurs d'échanger sur les résultats d'événements réels, les prix reflétant des estimations de probabilité issues de la foule. La plateforme est devenue un terrain d'essai populaire pour évaluer la prise de décision des IA en conditions d'incertitude.

Chaque agent participant à l'Arena fonctionnait sur le SDK de raisonnement de Stair AI. Le SDK enregistre des traces de raisonnement complètes, y compris les croyances, les estimations de probabilité et les décisions qui en découlent. Au cours du tournoi, l'Arena a généré 71 203 enregistrements de trace sur 20 851 sessions.

Plutôt que de classer les agents uniquement selon leurs profits, Stair AI a indiqué avoir utilisé une grille d'évaluation multidimensionnelle. L'évaluation mesurait si le raisonnement d'un agent pouvait être rattaché aux données d'entrée, si ses paris étaient cohérents avec ses propres probabilités déclarées, s'il battait le prix de clôture du marché et s'il se mettait à jour de manière appropriée à mesure que de nouvelles informations devenaient disponibles. La qualité de la politique a été évaluée en comparant les actions d'un agent avec ses propres croyances enregistrées. Cette approche reflète une évolution plus large dans l'évaluation de l'IA vers l'analyse de la cohérence interne et de l'alignement, et non plus seulement des résultats — une préoccupation croissante à mesure que les agents autonomes sont déployés dans des contextes financiers, opérationnels et de recherche où le raisonnement derrière une décision importe autant que le résultat.

Les résultats ont révélé un écart coûteux entre ce que les agents ont enregistré comme croyances et la manière dont ils ont finalement placé leurs paris. Sur 103 matchs résolus, 68 % des agents auraient fini avec plus d'argent s'ils avaient dimensionné leurs paris conformément à leurs propres probabilités déclarées, en utilisant les mêmes prévisions et le même capital. Dans 24 % des paris, les agents ont agi à l'encontre du résultat le plus fortement soutenu par leur propre raisonnement.

« L'Arena a montré que le résultat seul ne permet pas de déterminer si un agent a bien raisonné », a déclaré Cagri Yalcin, Community Manager de Stair AI. « Les erreurs coûteuses n'étaient pas de mauvaises analyses d'un match. Il s'agissait d'agents qui ont formé une opinion à partir des données puis ont agi à l'encontre, un type d'autocensure très humain. C'est en mesurant le raisonnement, et non le résultat, que l'on identifie cet écart. »

Stair AI a indiqué qu'elle rendra les traces de raisonnement de l'Arena disponibles pour la recherche académique dans le cadre d'un partenariat à annoncer. L'ensemble de données comprend 71 203 enregistrements de trace couvrant 103 matchs et 56 agents.

Les résultats complets, la méthodologie de notation et la documentation des traces sont disponibles sur stair-ai.com/arena.

Stair AI construit des infrastructures destinées à rendre le comportement des agents IA mesurable, auditable et améliorable. Son SDK de raisonnement enregistre des traces de raisonnement complètes, y compris les croyances, les décisions et les liens entre elles. L'entreprise est basée à San Francisco.