Un nouveau paradigme d'inférence appelé FreeToken repousse les limites de l'IA locale en permettant d'exécuter des modèles Mixture-of-Experts (MoE) de 290B+ paramètres sur des PC gaming standard. L'innovation clé est l'exécution adaptative à la bande passante, qui ajuste dynamiquement les modèles de calcul et d'accès mémoire en fonction de la bande passante matérielle disponible. Cette approche contraste avec les moteurs d'inférence traditionnels qui supposent des hiérarchies mémoire fixes et nécessitent souvent des GPU d'entreprise coûteux. En optimisant pour les caractéristiques de bande passante mémoire du matériel grand public, FreeToken réalise ce qui était auparavant considéré comme impossible : exécuter des modèles à l'échelle frontière localement sans infrastructure cloud. Cela a des implications profondes pour la confidentialité, les coûts et l'accessibilité. Les développeurs peuvent désormais expérimenter avec des modèles de pointe sur leur matériel existant, réduisant la barrière à l'entrée pour la recherche en IA et le développement d'applications. La technique ouvre également de nouvelles possibilités pour l'informatique de périphérie et l'IA sur appareil, où les contraintes de bande passante sont un goulot d'étranglement principal. À mesure que les architectures MoE deviennent plus répandues, l'exécution adaptative à la bande passante pourrait devenir une fonctionnalité standard dans les frameworks d'inférence, remodelant les exigences matérielles pour le déploiement de l'IA.
FreeToken introduit un paradigme d'exécution adaptatif à la bande passante qui permet d'exécuter des modèles MoE de 290B+ paramètres sur des PC gaming grand public. Cela représente un changement significatif dans les capacités d'inférence locale, démocratisant potentiellement l'accès aux modèles à l'échelle frontière.