DeepSeek опубликовала веса своей мультимодальной модели DeepSeek-V4-Flash-Vision-Exp, впервые позволив разработчикам загружать и развертывать модель локально. Модель построена на архитектуре V4-Flash и дополнена возможностями понимания изображений, включая распознавание скриншотов и диаграмм, а также поддерживает задачи Agent при использовании в связке с внешними инструментами. Сообщается, что производительность модели в текстовых Agent-бенчмарках, таких как Terminal Bench, примерно соответствует уровню V4-Flash. Теперь веса можно интегрировать через такие фреймворки, как Transformers, vLLM и SGLang, что расширяет доступ к модели за пределы ее прежней доступности только через API.