NotizieCryptoStair AI pubblica i risultati della World Cup Agent Arena durata 39 giorni

Stair AI pubblica i risultati della World Cup Agent Arena durata 39 giorni

Autore: Blocktelegraph·

Punti chiave

  • •Stair AI ha valutato 56 agenti AI autonomi mentre piazzavano scommesse su Polymarket durante tutti i 39 giorni del torneo della World Cup.
  • •L’Arena ha generato 71,203 record di tracce in 20,851 sessioni utilizzando il reasoning SDK di Stair AI.
  • •L’approccio di valutazione di Stair AI ha esaminato tracciabilità del ragionamento, coerenza delle probabilità, performance rispetto al prezzo di chiusura e reattività alle nuove informazioni.
  • •Su 103 partite concluse, il 68% degli agenti avrebbe guadagnato di più allineando le dimensioni delle scommesse alle proprie probabilità dichiarate.
  • •Stair AI prevede di rendere disponibili le tracce di ragionamento dell’Arena per la ricerca accademica attraverso una partnership che sarà annunciata.
Stair AI pubblica i risultati della World Cup Agent Arena durata 39 giorni

SAN FRANCISCO, CA — Stair AI, società con sede a San Francisco che sviluppa infrastrutture di verificabilità e responsabilità per agenti AI, ha pubblicato i risultati della sua World Cup Agent Arena, una valutazione live in cui 56 agenti AI autonomi hanno piazzato scommesse su Polymarket durante tutti i 39 giorni del torneo.

Polymarket, un mercato predittivo basato su blockchain, consente agli utenti di negoziare sugli esiti di eventi reali, con prezzi che riflettono stime di probabilità aggregate dalla folla. La piattaforma è diventata un banco di prova popolare per valutare il processo decisionale dell’AI in condizioni di incertezza.

Ogni agente partecipante all’Arena operava sul reasoning SDK di Stair AI. L’SDK registra tracce complete di ragionamento, incluse convinzioni, stime di probabilità e le decisioni che ne derivano. Nel corso del torneo, l’Arena ha generato 71,203 record di tracce in 20,851 sessioni.

Invece di classificare gli agenti esclusivamente in base al profitto, Stair AI ha dichiarato di aver utilizzato una griglia di valutazione multidimensionale. La valutazione ha misurato se il ragionamento di un agente potesse essere ricondotto ai dati di input, se le sue scommesse fossero coerenti con le probabilità da lui stesso dichiarate, se avesse battuto il prezzo di chiusura del mercato e se si fosse aggiornato in modo appropriato man mano che diventavano disponibili nuove informazioni. La qualità della policy è stata valutata confrontando le azioni di un agente con le sue convinzioni registrate. Questo approccio riflette un più ampio spostamento nella valutazione dell’AI verso l’analisi della coerenza interna e dell’allineamento, non solo degli esiti dei compiti — una questione diventata più rilevante con il crescente impiego di agenti autonomi in contesti finanziari, operativi e di ricerca, dove il ragionamento alla base di una decisione conta quanto il risultato.

I risultati hanno mostrato un divario costoso tra ciò che gli agenti registravano come proprie convinzioni e il modo in cui alla fine piazzavano le scommesse. Su 103 partite concluse, il 68% degli agenti avrebbe terminato con più denaro se avesse dimensionato le scommesse in linea con le probabilità da lui stesso dichiarate, utilizzando le stesse previsioni e lo stesso capitale. Nel 24% delle scommesse, gli agenti hanno agito contro l’esito maggiormente sostenuto dal proprio ragionamento.

"L’Arena ha mostrato che il solo esito non dice se un agente abbia ragionato bene," ha dichiarato Cagri Yalcin, Community Manager di Stair AI. "Gli errori costosi non erano cattive letture di una partita. Erano agenti che formulavano una visione a partire dai dati e poi agivano contro di essa, una forma molto umana di ripensamento. Il divario si individua misurando il ragionamento, non il risultato."

Stair AI ha dichiarato che renderà disponibili le tracce di ragionamento dell’Arena per la ricerca accademica attraverso una partnership che sarà annunciata. Il dataset include 71,203 record di tracce relativi a 103 partite e 56 agenti.

I risultati completi, la metodologia di valutazione e la documentazione delle tracce sono disponibili su stair-ai.com/arena.

Stair AI sviluppa infrastrutture pensate per rendere il comportamento degli agenti AI misurabile, verificabile e migliorabile. Il suo reasoning SDK registra tracce complete di ragionamento, incluse convinzioni, decisioni e i collegamenti tra esse. L’azienda ha sede a San Francisco.