LingBot-VLA 2.0 représente une étape importante dans l'IA incarnée, traitant le contrôle robotique comme un problème de génération conditionnelle. Le modèle prend des images de caméras multi-vues, des instructions en langage naturel et l'état actuel du robot comme entrée, et produit une séquence d'actions continues. Cet article détaille l'architecture, expliquant comment les caractéristiques visuelles sont fusionnées avec les embeddings linguistiques et comment le décodeur d'actions produit des trajectoires fluides et exécutables. Les innovations clés incluent un mécanisme d'attention croisée pour aligner les modalités visuelles et linguistiques, et une tête de génération d'actions basée sur la diffusion qui assure la cohérence temporelle. L'approche est évaluée sur des tâches de manipulation simulées, montrant des taux de réussite améliorés par rapport aux modèles VLA précédents. Ce travail est pertinent pour les chercheurs et ingénieurs travaillant sur les modèles vision-langage-action pour la robotique, car il fournit une méthodologie claire qui peut être adaptée ou développée.
Une analyse technique détaillée de LingBot-VLA 2.0, un modèle vision-langage-action qui génère des actions robotiques continues à partir d'images multi-vues et d'instructions en langage naturel.