Stair AI опубликовала результаты 39-дневной World Cup Agent Arena
Ключевые выводы
- •Stair AI оценила 56 автономных ИИ-агентов, которые делали ставки на Polymarket на протяжении всех 39 дней турнира World Cup.
- •Arena сформировала 71,203 записи трасс в 20,851 сессии с использованием reasoning SDK от Stair AI.
- •Подход Stair AI к оценке анализировал прослеживаемость рассуждений, согласованность вероятностей, результат относительно цены закрытия и реакцию на новую информацию.
- •По 103 завершенным матчам 68% агентов заработали бы больше, если бы согласовывали размеры ставок со своими собственными заявленными вероятностями.
- •Stair AI планирует сделать трассы рассуждений Arena доступными для академических исследований в рамках партнерства, о котором будет объявлено позднее.

САН-ФРАНЦИСКО, CA — Stair AI, базирующаяся в Сан-Франциско компания, разрабатывающая инфраструктуру проверяемости и подотчетности для ИИ-агентов, опубликовала результаты своей World Cup Agent Arena — оценки в реальном времени, в ходе которой 56 автономных ИИ-агентов делали ставки на Polymarket на протяжении всех 39 дней турнира.
Polymarket, рынок прогнозов на базе блокчейна, позволяет пользователям торговать исходами реальных событий, при этом цены отражают агрегированные вероятностные оценки участников. Платформа стала популярной средой для оценки принятия решений ИИ в условиях неопределенности.
Каждый агент, участвовавший в Arena, работал на reasoning SDK от Stair AI. SDK фиксирует полные трассы рассуждений, включая убеждения, вероятностные оценки и решения, которые из них следуют. За время турнира Arena сформировала 71,203 записи трасс в 20,851 сессии.
Вместо того чтобы ранжировать агентов исключительно по прибыли, Stair AI сообщила, что использовала многомерную систему оценки. Оценка измеряла, можно ли проследить рассуждения агента до входных данных, были ли его ставки согласованы с его собственными заявленными вероятностями, превосходил ли он цену закрытия рынка и корректно ли обновлял свои выводы по мере появления новой информации. Качество политики оценивалось путем сопоставления действий агента с его собственными зафиксированными убеждениями. Такой подход отражает более широкий сдвиг в оценке ИИ в сторону анализа внутренней согласованности и выравнивания, а не только результатов выполнения задач — вопрос, который стал более значимым по мере того, как автономные агенты все чаще применяются в финансовых, операционных и исследовательских средах, где логика принятия решения важна не меньше, чем результат.
Результаты показали дорогостоящее расхождение между тем, что агенты фиксировали как свои убеждения, и тем, как они в итоге размещали ставки. По 103 завершенным матчам 68% агентов закончили бы с большей суммой, если бы определяли размер ставок в соответствии со своими собственными заявленными вероятностями, используя те же прогнозы и тот же капитал. В 24% ставок агенты действовали против исхода, который наиболее сильно поддерживался их собственными рассуждениями.
"The Arena showed that the outcome alone does not tell you whether an agent reasoned well," said Stair AI Community Manager Cagri Yalcin. "The expensive mistakes were not bad reads of a match. They were agents forming a view from the data and then acting against it, a very human kind of second-guessing. You find the gap by measuring the reasoning, not the result."
Stair AI сообщила, что сделает трассы рассуждений Arena доступными для академических исследований в рамках партнерства, о котором будет объявлено позднее. Набор данных включает 71,203 записи трасс, охватывающие 103 матча и 56 агентов.
Полные результаты, методология оценки и документация по трассам доступны на stair-ai.com/arena.
Stair AI создает инфраструктуру, предназначенную для того, чтобы сделать поведение ИИ-агентов измеримым, проверяемым и улучшаемым. Ее reasoning SDK фиксирует полные трассы рассуждений, включая убеждения, решения и связи между ними. Компания базируется в Сан-Франциско.