Ollama, el popular runtime de código abierto para ejecutar grandes modelos de lenguaje localmente, ha lanzado la versión 0.32.9. La característica principal es el soporte para Nemotron 3.5 Lightning, un nuevo modelo basado en la arquitectura Nemotron 3. Esta versión también trae mejoras significativas en el análisis de llamadas a herramientas, facilitando a los desarrolladores la integración de llamadas a funciones en sus aplicaciones de IA locales. La inferencia por streaming también se ha mejorado, lo que debería reducir la latencia para interacciones en tiempo real. Para desarrolladores y equipos que ejecutan modelos en su propia infraestructura, esta actualización mejora tanto la capacidad como la usabilidad, manteniendo a Ollama competitivo con los servicios LLM en la nube.
Ollama v0.32.9 introduce soporte para Nemotron 3.5 Lightning, mejor análisis de llamadas a herramientas y mejoras en la inferencia por streaming.