DeepSeek est devenu un choix populaire pour les développeurs en raison de son faible coût et de ses performances solides, mais ses modèles texte manquent de capacités de vision. Un nouveau skill open-source vise à combler cette lacune en permettant la compréhension d'images grâce à un ingénierie de prompt astucieuse et une intégration d'outils externes. C'est un développement significatif car de nombreuses applications réelles nécessitent le traitement de texte et d'images. Le skill fonctionne en convertissant le contenu d'image dans un format que les modèles texte peuvent interpréter, donnant effectivement des 'yeux' à DeepSeek sans nécessiter de changement de modèle. Avec la consommation de tokens de DeepSeek atteignant 8 billions, la demande pour de telles améliorations est claire. Pour les développeurs créant des applications IA, ce skill offre un moyen rentable d'ajouter des fonctionnalités multimodales tout en restant dans l'écosystème DeepSeek. Il met également en évidence la tendance plus large de l'innovation communautaire comblant les lacunes des offres d'IA commerciales. Alors que DeepSeek continue de publier de nouvelles versions comme V4-Flash et V4-Pro, de telles extensions pourraient devenir encore plus précieuses.
Un nouveau skill open-source permet aux modèles texte de DeepSeek de traiter des images, répondant à une limitation clé. C'est particulièrement pertinent alors que l'utilisation de tokens de DeepSeek a bondi à 8 billions. Le skill offre une solution pratique pour les développeurs ayant besoin de capacités multimodales sans changer de modèle.