DeepSeek hat die Gewichte für sein multimodales Modell DeepSeek-V4-Flash-Vision-Exp veröffentlicht und ermöglicht Entwicklern damit erstmals, das Modell herunterzuladen und lokal bereitzustellen. Das Modell basiert auf der V4-Flash-Architektur und erweitert diese um Bildverständnis-Fähigkeiten, darunter die Erkennung von Screenshots und Diagrammen, und unterstützt zudem Agentenaufgaben, wenn es mit externen Tools kombiniert wird. Die Leistung des Modells bei reinen textbasierten Agenten-Benchmarks wie Terminal Bench soll Berichten zufolge in etwa auf dem Niveau von V4-Flash liegen. Die Gewichte können nun über Frameworks wie Transformers, vLLM und SGLang integriert werden, wodurch der Zugang über die bisherige ausschließliche API-Verfügbarkeit des Modells hinaus erweitert wird.