NachrichtenKryptoStair AI veröffentlicht Ergebnisse aus dem 39-tägigen World Cup Agent Arena

Stair AI veröffentlicht Ergebnisse aus dem 39-tägigen World Cup Agent Arena

Autor: Blocktelegraph·

Wichtige Erkenntnisse

  • •Stair AI evaluierte 56 autonome KI-Agenten, die über alle 39 Tage des World-Cup-Turniers Wetten auf Polymarket platzierten.
  • •Der Arena generierte 71.203 Trace-Datensätze über 20.851 Sessions mithilfe des Reasoning-SDK von Stair AI.
  • •Der Bewertungsansatz von Stair AI untersuchte Reasoning-Rückverfolgbarkeit, Wahrscheinlichkeitskonsistenz, Performance gegenüber dem Marktabschlusspreis und Reaktionsfähigkeit auf neue Informationen.
  • •Bei 103 abgeschlossenen Spielen hätten 68 % der Agenten mehr verdient, wenn sie ihre Einsätze an ihren eigenen angegebenen Wahrscheinlichkeiten ausgerichtet hätten.
  • •Stair AI plant, die Reasoning-Traces des Arena durch eine noch bekanntzugebende Partnerschaft für die akademische Forschung verfügbar zu machen.
Stair AI veröffentlicht Ergebnisse aus dem 39-tägigen World Cup Agent Arena

SAN FRANCISCO, CA — Stair AI, ein in San Francisco ansässiges Unternehmen, das Infrastruktur für Auditierbarkeit und Verantwortlichkeit von KI-Agenten entwickelt, veröffentlichte die Ergebnisse seines World Cup Agent Arena, einer Live-Evaluierung, bei der 56 autonome KI-Agenten über alle 39 Tage des Turniers hinweg Wetten auf Polymarket platzierten.

Polymarket, ein blockchainbasierter Prognosemarkt, ermöglicht es Nutzern, auf die Ergebnisse realer Ereignisse zu handeln, wobei die Preise crowdsourced Wahrscheinlichkeitsschätzungen widerspiegeln. Die Plattform hat sich zu einem beliebten Testfeld für die Bewertung von KI-Entscheidungsfindung unter Unsicherheit entwickelt.

Jeder am Arena teilnehmende Agent lief auf dem Reasoning-SDK von Stair AI. Das SDK zeichnet vollständige Reasoning-Traces auf, darunter Überzeugungen, Wahrscheinlichkeitsschätzungen und die daraus resultierenden Entscheidungen. Im Verlauf des Turniers generierte der Arena 71.203 Trace-Datensätze über 20.851 Sessions.

Anstatt die Agenten ausschließlich nach Gewinn zu bewerten, verwendete Stair AI laut eigenen Angaben ein multidimensionales Bewertungsrubrik. Die Evaluierung maß, ob das Reasoning eines Agenten auf Eingabedaten zurückgeführt werden konnte, ob seine Wetten mit seinen eigenen angegebenen Wahrscheinlichkeiten übereinstimmten, ob er den Marktabschlusspreis schlug und ob er sich bei neuen Informationen angemessen anpasste. Die Qualität der Entscheidungsfindung wurde bewertet, indem die Handlungen eines Agenten mit seinen eigenen protokollierten Überzeugungen verglichen wurden. Dieser Ansatz spiegelt einen breiteren Wandel in der KI-Evaluierung hin zur Bewertung interner Kohärenz und Alignment wider, nicht nur von Aufgabe-Ergebnissen – ein Anliegen, das an Bedeutung gewonnen hat, da autonome Agenten zunehmend in finanziellen, operativen und Forschungsumgebungen eingesetzt werden, in denen das Reasoning hinter einer Entscheidung genauso wichtig ist wie das Ergebnis.

Die Ergebnisse zeigten eine kostspielige Lücke zwischen dem, was Agenten als ihre Überzeugungen protokollierten, und der Art, wie sie letztendlich Wetten platzierten. Bei 103 abgeschlossenen Spielen hätten 68 % der Agenten mit mehr Geld abgeschlossen, wenn sie ihre Einsätze entsprechend ihren eigenen angegebenen Wahrscheinlichkeiten bemessen hätten, bei gleichen Prognosen und gleichem Kapital. Bei 24 % der Wetten handelten die Agenten gegen das Ergebnis, das von ihrem eigenen Reasoning am stärksten unterstützt wurde.

„Der Arena zeigte, dass das Ergebnis allein nicht darüber aussagt, ob ein Agent gut gereasoniert hat“, sagte Cagri Yalcin, Community Manager bei Stair AI. „Die kostspieligen Fehler waren keine Fehleinschätzungen eines Spiels. Sie bestanden darin, dass Agenten eine Sichtweise aus den Daten bildeten und dann dagegen handelten – eine sehr menschliche Art des Selbstzweifels. Man findet die Lücke, indem man das Reasoning misst, nicht das Ergebnis.“

Stair AI gab an, die Reasoning-Traces des Arena durch eine noch bekanntzugebende Partnerschaft für die akademische Forschung verfügbar zu machen. Der Datensatz umfasst 71.203 Trace-Datensätze, die 103 Spiele und 56 Agenten abdecken.

Vollständige Ergebnisse, die Bewertungsmethodik und die Trace-Dokumentation sind unter stair-ai.com/arena verfügbar.

Stair AI entwickelt Infrastruktur, die das Verhalten von KI-Agenten messbar, auditierbar und verbesserbar machen soll. Das Reasoning-SDK des Unternehmens protokolliert vollständige Reasoning-Traces, einschließlich Überzeugungen, Entscheidungen und der Verbindungen zwischen ihnen. Das Unternehmen hat seinen Sitz in San Francisco.