Ollama, le runtime open-source populaire pour exécuter de grands modèles de langage localement, a publié la version 0.32.9. La fonctionnalité phare est le support de Nemotron 3.5 Lightning, un nouveau modèle basé sur l'architecture Nemotron 3. Cette version apporte également des améliorations significatives à l'analyse des appels d'outils, facilitant l'intégration des appels de fonction dans les applications IA locales. L'inférence en streaming a également été améliorée, ce qui devrait réduire la latence pour les interactions en temps réel. Pour les développeurs et les équipes exécutant des modèles sur leur propre infrastructure, cette mise à jour améliore à la fois les capacités et la convivialité, maintenant Ollama compétitif avec les services LLM cloud.
Ollama v0.32.9 introduit le support de Nemotron 3.5 Lightning, une meilleure analyse des appels d'outils et des améliorations de l'inférence en streaming.