Dans les systèmes de génération augmentée par récupération (RAG), l'efficacité à trouver des informations pertinentes dans une grande base de connaissances est cruciale. Cet article décompose l'architecture de récupération de base, en se concentrant sur deux composants clés : les modèles d'embedding et les modèles de rerank. Les modèles d'embedding convertissent le texte en vecteurs denses, permettant une recherche rapide par similarité sémantique. Cependant, les résultats initiaux de récupération peuvent être bruités. Les modèles de rerank interviennent pour affiner ces résultats, en utilisant des architectures de cross-encoder plus sophistiquées pour réordonner les candidats et améliorer la précision. L'article explique comment ces deux étapes fonctionnent ensemble : d'abord, un large ensemble de candidats est récupéré à l'aide d'embeddings ; ensuite, un reranker réduit la liste aux éléments les plus pertinents. Cette approche en deux étapes équilibre vitesse et précision, ce qui en fait un modèle standard dans les systèmes RAG de production.
Un guide pratique de la recherche vectorielle dans les systèmes RAG, expliquant les rôles complémentaires de l'embedding et du reranking pour une meilleure précision de recherche.