Las evaluaciones actuales de agentes de IA a menudo se basan en benchmarks fijos, lo que lleva a sobreajuste y métricas de rendimiento engañosas. Este artículo propone un enfoque más robusto: usar modelos de escenarios para generar nuevas tareas fuera de muestra en cada ronda de evaluación. Los agentes de referencia y candidatos se comparan luego en estas tareas novedosas, proporcionando una medida más verdadera de la generalización. Este método reduce el riesgo de que los agentes 'jueguen' con el benchmark y fomenta el desarrollo de sistemas más adaptables. El artículo también discute consideraciones prácticas de implementación para este marco de evaluación.
Una crítica a las evaluaciones basadas en benchmarks fijos para agentes de IA y una propuesta de pruebas dinámicas fuera de muestra usando modelos de escenarios.