A DeepSeek disponibilizou os pesos de seu modelo multimodal DeepSeek-V4-Flash-Vision-Exp, permitindo que desenvolvedores baixem e implementem o modelo localmente pela primeira vez. O modelo é construído sobre a arquitetura V4-Flash e adiciona capacidades de compreensão de imagens, incluindo o reconhecimento de capturas de tela e gráficos, ao mesmo tempo em que oferece suporte a tarefas de Agent quando combinado com ferramentas externas. Segundo relatos, o desempenho do modelo em benchmarks de Agent focados exclusivamente em texto, como o Terminal Bench, está aproximadamente no mesmo nível do V4-Flash. Agora, os pesos podem ser integrados por meio de frameworks como Transformers, vLLM e SGLang, ampliando o acesso para além da disponibilidade anterior do modelo apenas via API.