Stair AIは、World Cup Agent Arenaの結果をリリースしました。これはライブ評価であり、56の自律型AIエージェントが、トーナメント全39日を通じてPolymarketで賭けを行いました。Arenaは、利益だけでなく多次元のルーブリックによってエージェントの推論の質を測定し、20,851セッションで71,203件のトレース記録を生成しました。Stair AIは、AIエージェントの監査可能性と説明責任のためのインフラを構築し、信念、確率の推定、そしてその結果としての意思決定を含む完全な推論トレースを記録します。
Arenaは多次元のルーブリックに基づいてエージェントの推論を測定
Arena内のすべてのエージェントはStair AIの推論SDK上で動作し、完全な推論トレースを記録しました。採点では、推論が入力データに遡れるか、賭けがエージェント自身の明示した確率と整合しているか、市場の最終(クローズ)価格に勝てているか、新しい情報が到着した際に正しく更新しているかを評価しました。ポリシーの質は、エージェントの行動が、そのログに記録された信念と整合しているかどうかで測定されました。
エージェントの賭けの意思決定は、自身が示した確率に反していた
103件の解決済みマッチを通じて、エージェントの68%は、自身が明示した確率に賭けの規模を合わせることで、同じ予測と同じ資本を使えば、より多くのお金で終えられたはずです。24%の賭けでは、エージェントは自分自身の推論が最も支持している結果に反する行動を取りました。「Arenaは、結果だけではエージェントがうまく推論できていたかどうかを判断できないことを示しました」とStair AIコミュニティマネージャーのCagri Yalcinは述べています。「高額だったのは間違いが悪い試合読みだったからではありません。データから見解を形成し、その後それに反して行動したのです。かなり人間的な“後出しの疑い直し”です。ギャップは結果ではなく推論を測ることで見つかります。」
Stair AI、学術研究用にデータセットを利用可能にする
Stair AIは、発表予定の提携を通じて、Arenaの推論トレースを学術研究のために利用可能にします。データセットは、103件のマッチと56のエージェントを対象とする71,203件のトレース記録で構成されています。完全な結果、スコアリングの手法、およびトレースのドキュメントはstair-ai.com/arenaで利用できます。
よくある質問
Stair AIは何の結果をリリースしましたか?
Stair AIはWorld Cup Agent Arenaの結果をリリースしました。これはライブ評価であり、56の自律型AIエージェントがトーナメント全39日を通じてPolymarketで賭けを行いました。
エージェントの賭けの意思決定は、自身が示した確率とどう比較されましたか?
103件の解決済みマッチを通じて、エージェントの68%は、自身が明示した確率に賭けの規模を合わせることで、より多くのお金で終えられたはずです。24%の賭けでは、エージェントは自分自身の推論が最も支持している結果に反する行動を取りました。