DeepSeek ist mit der Veröffentlichung von DeepSeek-V4-Flash-Vision-Exp, einem Vision-Language-Modell, das Bilder zusammen mit Text verarbeiten kann, in den Bereich der multimodalen KI eingestiegen. Das am 21. August leise gestartete Modell stellt eine bedeutende Erweiterung für das Unternehmen dar, das sich bisher hauptsächlich auf textbasierte Sprachmodelle konzentriert hat. Diese Veröffentlichung erfolgt zu einer Zeit, in der multimodale Fähigkeiten für Anwendungen von der Dokumentenanalyse bis zur visuellen Suche immer wichtiger werden. Für Entwickler bietet dies eine weitere Option in einem wachsenden Bereich von Vision-Language-Modellen, möglicherweise mit wettbewerbsfähigen Preisen und Leistung. Der Schritt verschärft auch den Wettbewerb mit anderen KI-Labors, die bereits multimodale Angebote etabliert haben. Während sich die KI-Landschaft weiterentwickelt, könnte DeepSeeks Einstieg in das Sehen die Entscheidungen der Entwickler neu gestalten und die Richtung der multimodalen KI-Entwicklung beeinflussen.
DeepSeek hat sein erstes multimodales Vision-Modell DeepSeek-V4-Flash-Vision-Exp veröffentlicht und erweitert damit sein Angebot über textbasierte KI hinaus.