Un développeur chinois a publié un guide pratique sur la construction d'un système minimal de génération augmentée par récupération (RAG) pour doter les agents AIOps de connaissances sur les incidents historiques. Le problème central est que les grands modèles de langage (LLM) n'ont aucune connaissance inhérente des échecs passés d'une organisation ou des spécificités internes du système. La solution implique le découpage de documents, la récupération par mots-clés, le filtrage Top-K et l'assemblage de prompts pour injecter un contexte historique pertinent dans les réponses du LLM. L'implémentation utilise Python et est conçue pour être légère, la rendant accessible aux équipes sans infrastructure ML étendue. Cette approche est particulièrement précieuse pour les équipes d'ingénierie de fiabilité des sites (SRE) et d'ingénierie de plateforme qui doivent réduire le temps moyen de résolution (MTTR) en fournissant aux opérateurs un accès instantané aux données d'incidents passés. L'article explique également les fondamentaux de la récupération vectorielle et des stratégies de découpage, qui sont essentiels pour un RAG efficace. Pour les développeurs à l'étranger, cela représente un point d'entrée pratique pour appliquer le RAG dans des contextes opérationnels, une tendance qui gagne du terrain dans le domaine de l'AIOps.
Cet article montre comment construire un système minimal de génération augmentée par récupération (RAG) pour permettre à un agent AIOps d'interroger les pannes historiques. Il couvre le découpage de documents, la récupération par mots-clés, le filtrage Top-K et l'assemblage de prompts en Python. L'approche est pratique et répond à un problème courant en exploitation : les LLM manquent de contexte sur les incidents passés.