Aktuelle Bewertungen von KI-Agenten verlassen sich oft auf feste Benchmarks, was zu Overfitting und irreführenden Leistungskennzahlen führt. Dieser Artikel schlägt einen robusteren Ansatz vor: die Verwendung von Szenariomodellen zur Generierung neuer Out-of-Sample-Aufgaben in jeder Bewertungsrunde. Baseline- und Kandidaten-Agenten werden dann anhand dieser neuartigen Aufgaben verglichen, was ein wahreres Maß für die Generalisierung liefert. Diese Methode reduziert das Risiko, dass Agenten den Benchmark 'ausspielen', und fördert die Entwicklung anpassungsfähigerer Systeme. Der Artikel diskutiert auch praktische Implementierungsaspekte für dieses Bewertungsframework.
Eine Kritik an festen Benchmark-Bewertungen für KI-Agenten und ein Vorschlag für dynamische Out-of-Sample-Tests mit Szenariomodellen.