Fast-WAM introduit un changement de paradigme dans les World Action Models (WAM) en déplaçant la tâche coûteuse en calcul de génération de trames vidéo futures de l'inférence à la phase d'entraînement. Les WAM traditionnels nécessitent la génération de séquences vidéo futures pendant l'inférence, ce qui est lent et gourmand en ressources. Fast-WAM apprend plutôt à prédire les états futurs sans génération vidéo explicite au moment de l'exécution, réduisant considérablement la latence. Cela le rend adapté aux applications en temps réel comme la conduite autonome et la robotique, où chaque milliseconde compte. La méthode exploite un nouvel objectif d'entraînement qui force le modèle à internaliser les dynamiques futures, « imaginant » efficacement le futur pendant l'entraînement. Les premiers résultats montrent une précision comparable aux WAM complets mais avec une fraction du coût d'inférence. Pour les développeurs travaillant sur l'IA incarnée ou la prédiction vidéo, Fast-WAM offre une voie pratique vers le déploiement sans sacrifier les performances.
Fast-WAM répond à une inefficacité clé des World Action Models (WAM) en déplaçant « l'imagination du futur » de l'inférence au temps d'entraînement. Cela réduit la surcharge de calcul lors du déploiement, permettant des prédictions vidéo plus rapides et plus pratiques. La méthode est particulièrement pertinente pour la robotique et les systèmes autonomes où la prise de décision en temps réel est critique.