Le battage médiatique autour de l'IA agentique repose souvent sur des démos flashy et des chiffres de benchmark impressionnants, mais ces métriques se traduisent rarement par des performances fiables en production. Cette analyse examine pourquoi les méthodes d'évaluation actuelles sont insuffisantes, des scénarios sélectionnés au surajustement sur des tâches étroites. Elle plaide pour un passage à des tests orientés tâches qui mesurent la robustesse, la récupération d'erreurs et la planification à long terme. Pour les équipes d'ingénierie, cela signifie construire des suites d'évaluation personnalisées qui reflètent les cas d'utilisation réels, plutôt que de s'appuyer sur des classements génériques. Des agents peu fiables peuvent éroder la confiance et augmenter les coûts opérationnels. Alors que les systèmes agentiques passent de la recherche au déploiement, la communauté a besoin de normes partagées pour définir ce qui est 'bon'.
Un regard critique sur l'évaluation de l'IA agentique, arguant que les démos et benchmarks ne capturent pas la fiabilité réelle et proposant un cadre plus pratique.