DeepSeek ha entrado en el ámbito de la IA multimodal con el lanzamiento de DeepSeek-V4-Flash-Vision-Exp, un modelo de visión-lenguaje que puede procesar imágenes junto con texto. El modelo, lanzado silenciosamente el 21 de agosto, representa una expansión importante para la empresa, que se ha centrado principalmente en modelos de lenguaje basados en texto. Este lanzamiento llega en un momento en que las capacidades multimodales son cada vez más importantes para aplicaciones que van desde el análisis de documentos hasta la búsqueda visual. Para los desarrolladores, esto ofrece otra opción en un campo creciente de modelos de visión-lenguaje, potencialmente con precios y rendimiento competitivos. El movimiento también intensifica la competencia con otros laboratorios de IA que ya han establecido ofertas multimodales. A medida que evoluciona el panorama de la IA, la entrada de DeepSeek en la visión podría remodelar las elecciones de los desarrolladores e influir en la dirección del desarrollo de la IA multimodal.
DeepSeek ha lanzado su primer modelo de visión multimodal, DeepSeek-V4-Flash-Vision-Exp, expandiéndose más allá de la IA basada en texto.