現在のAIエージェント評価は固定ベンチマークに依存することが多く、オーバーフィッティングや誤解を招くパフォーマンス指標につながっています。この記事では、より堅牢なアプローチとして、シナリオモデルを使用して各評価ラウンドで新しいアウトオブサンプルタスクを生成する方法を提案しています。ベースラインと候補エージェントはこれらの新しいタスクで比較され、真の汎化能力を測定します。この方法はエージェントがベンチマークを「ゲーム」するリスクを減らし、より適応性の高いシステムの開発を促進します。また、この評価フレームワークの実装上の考慮事項についても議論しています。
固定ベンチマークによるAIエージェント評価への批判と、シナリオモデルを用いた動的なアウトオブサンプルテストの提案。