Les évaluations actuelles des agents IA reposent souvent sur des benchmarks fixes, ce qui entraîne un surapprentissage et des métriques de performance trompeuses. Cet article propose une approche plus robuste : utiliser des modèles de scénarios pour générer de nouvelles tâches hors échantillon à chaque cycle d'évaluation. Les agents de référence et candidats sont ensuite comparés sur ces nouvelles tâches, fournissant une mesure plus fidèle de la généralisation. Cette méthode réduit le risque que les agents 'trichent' sur le benchmark et encourage le développement de systèmes plus adaptables. L'article aborde également les considérations pratiques de mise en œuvre de ce cadre d'évaluation.
Une critique des évaluations basées sur des benchmarks fixes pour les agents IA et une proposition de tests dynamiques hors échantillon utilisant des modèles de scénarios.