L'optimisation du préfixe partagé est une technique clé pour réduire les calculs redondants dans l'inférence LLM. Lorsque plusieurs requêtes partagent un préfixe commun, comme un prompt système ou des exemples few-shot, le cache de clés-valeurs (KV) pour ce préfixe peut être calculé une seule fois et réutilisé entre les requêtes. Cet article examine les principes fondamentaux de cette optimisation, en distinguant la réutilisation inter-lots (telle qu'implémentée dans vLLM et SGLang) et les scénarios intra-lot où plusieurs requêtes du même lot partagent un préfixe. L'analyse couvre les compromis algorithmiques, les stratégies de gestion de la mémoire et les défis d'implémentation auxquels les ingénieurs sont confrontés lors de l'intégration de ces optimisations dans des systèmes de production. Comprendre ces techniques est crucial pour les équipes qui construisent des infrastructures de service LLM haute performance, car elles impactent directement la latence, le débit et l'efficacité des coûts. L'article discute également de la manière dont la mise en cache des préfixes interagit avec d'autres optimisations comme le batching continu et l'attention paginée, offrant une vue holistique de la conception moderne des moteurs d'inférence.
Découvrez comment l'optimisation du préfixe partagé accélère l'inférence LLM en réutilisant le cache KV entre les requêtes, avec des informations pour vLLM et SGLang.