DeepSeek ha publicado los pesos de su modelo multimodal DeepSeek-V4-Flash-Vision-Exp, lo que permite a los desarrolladores descargar e implementar el modelo localmente por primera vez. El modelo está construido sobre la arquitectura V4-Flash y añade capacidades de comprensión de imágenes, incluido el reconocimiento de capturas de pantalla y gráficos, al tiempo que admite tareas de agente cuando se combina con herramientas externas. Se informa que el rendimiento del modelo en pruebas comparativas de agente basadas únicamente en texto, como Terminal Bench, está aproximadamente en línea con V4-Flash. Ahora, los pesos pueden integrarse a través de frameworks como Transformers, vLLM y SGLang, ampliando el acceso más allá de la disponibilidad previa del modelo únicamente mediante API.