SenseTime a publié SenseNova U1.5 Lite, un modèle open-source de 8 milliards de paramètres qui traite nativement plusieurs modalités, notamment le texte, l'image et la vidéo. Le modèle est basé sur une architecture NEO-Unify qui unifie différents encodeurs de modalité dans un cadre unique, réduisant la complexité et améliorant l'efficacité. Une caractéristique remarquable est sa capacité à générer des images en résolution 4K, ce qui est rare pour des modèles de cette taille. La publication comprend des notes techniques détaillées sur trois compromis clés : l'allocation des paramètres entre les modalités, l'équilibrage des données d'entraînement et l'optimisation de l'inférence. Pour les développeurs, ce modèle offre une option pratique pour créer des applications multimodales sans nécessiter de ressources GPU massives. La nature open-source permet la personnalisation et le fine-tuning pour des cas d'utilisation spécifiques, ce qui en fait un ajout précieux à l'écosystème croissant de modèles IA efficaces.
SenseTime a open-sourcé SenseNova U1.5 Lite, un modèle de 8B paramètres avec des capacités multimodales unifiées natives. Le modèle utilise une architecture NEO-Unify et prend en charge la génération d'images 4K, mettant en évidence trois compromis techniques clés. C'est un développement significatif pour l'IA multimodale efficace dans des environnements à ressources limitées.