DeepSeek V4 ha pasado oficialmente a disponibilidad general, introduciendo una arquitectura Mixture-of-Experts (MoE) de 1,6 billones de parámetros que combina mecanismos de atención híbridos con soporte para hasta un millón de tokens de contexto. Este lanzamiento posiciona a DeepSeek como un competidor importante en el espacio de los grandes modelos de lenguaje, particularmente para aplicaciones que requieren ventanas de contexto extensas, como el análisis de documentos legales, la comprensión de bases de código y la investigación científica. El diseño MoE permite un escalado eficiente al activar solo un subconjunto de parámetros por token, reduciendo los costos computacionales mientras se mantiene un alto rendimiento. El mecanismo de atención híbrida combina patrones de atención densa y dispersa para manejar secuencias largas de manera efectiva. Para desarrolladores y empresas, esto significa acceso a un modelo potente que puede procesar libros completos o grandes repositorios de código en una sola pasada. El estado GA sugiere preparación para producción, aunque persisten consideraciones prácticas de implementación en torno a la memoria y la latencia. Esta señal es particularmente relevante para equipos que evalúan alternativas a los modelos occidentales por razones de costo o soberanía de datos.
DeepSeek V4 ha alcanzado disponibilidad general con una arquitectura Mixture-of-Experts de 1,6 billones de parámetros, mecanismos de atención híbridos y soporte para hasta un millón de tokens de contexto. Un paso significativo en el desarrollo de modelos de IA chinos.