DeepSeek est entré dans le domaine de l'IA multimodale avec la sortie de DeepSeek-V4-Flash-Vision-Exp, un modèle vision-langage capable de traiter des images avec du texte. Le modèle, lancé discrètement le 21 août, représente une expansion majeure pour l'entreprise, qui s'est principalement concentrée sur les modèles de langage textuels. Cette sortie intervient à un moment où les capacités multimodales deviennent de plus en plus importantes pour des applications allant de l'analyse de documents à la recherche visuelle. Pour les développeurs, cela offre une option supplémentaire dans un domaine croissant de modèles vision-langage, avec potentiellement des prix et des performances compétitifs. Cette décision intensifie également la concurrence avec d'autres laboratoires d'IA qui ont déjà établi des offres multimodales. Alors que le paysage de l'IA évolue, l'entrée de DeepSeek dans la vision pourrait remodeler les choix des développeurs et influencer la direction du développement de l'IA multimodale.
DeepSeek a lancé son premier modèle de vision multimodale, DeepSeek-V4-Flash-Vision-Exp, élargissant son offre au-delà de l'IA textuelle.