DeepSeek a publié les poids de son modèle multimodal DeepSeek-V4-Flash-Vision-Exp, permettant aux développeurs de télécharger et de déployer le modèle localement pour la première fois. Le modèle est construit sur l’architecture V4-Flash et ajoute des capacités de compréhension d’images, notamment la reconnaissance de captures d’écran et de graphiques, tout en prenant en charge des tâches d’agent lorsqu’il est associé à des outils externes. Les performances du modèle sur des benchmarks d’agent en texte pur, tels que Terminal Bench, seraient globalement du même niveau que celles de V4-Flash. Les poids peuvent désormais être intégrés via des frameworks tels que Transformers, vLLM et SGLang, élargissant l’accès au-delà de la disponibilité précédente du modèle uniquement via API.