Un projet récent d'un développeur chinois présente une bibliothèque d'inférence purement en C++ capable d'exécuter les modèles GPT et Whisper sans dépendre de PyTorch ou CUDA. Cette approche élimine les dépendances lourdes, ce qui la rend idéale pour les appareils périphériques, les systèmes embarqués et les environnements sans accélération GPU. L'implémentation se concentre sur la multiplication matricielle efficace, le pooling mémoire personnalisé et les techniques de quantification pour atteindre des performances compétitives sur du matériel CPU uniquement. En évitant l'écosystème Python, la bibliothèque offre des temps de démarrage plus rapides et une empreinte mémoire réduite, essentiels pour les applications en temps réel. L'auteur discute également des compromis, tels que la flexibilité réduite dans la personnalisation des modèles et la nécessité d'optimiser manuellement les opérations que les frameworks gèrent généralement automatiquement. Pour les équipes d'ingénierie, ce projet sert de référence précieuse pour construire des solutions d'inférence portables et comprendre les mécanismes sous-jacents des modèles de transformeurs.
Un développeur présente une bibliothèque d'inférence en C++ qui exécute GPT et Whisper sans PyTorch ni CUDA, offrant une alternative légère pour le déploiement en périphérie avec optimisation CPU.