8月31日,深度求索(DeepSeek)在Hugging Face平台上线了V4系列首个多模态模型DeepSeek-V4-Flash-Vision-Exp,采用MIT License开源。公开内容涵盖模型文件、Tokenizer、Prompt Encoding参考实现,以及最小化PyTorch推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections与DSpark等核心模块。
DeepSeek-V4-Flash-Vision-Exp是DeepSeek V4系列首款原生支持图片输入的视觉模型,官方明确标注为“Exp”实验版本,于2026年8月21日上线DeepSeek API平台。该模型支持在文本之外输入图片,可完成图片描述、截图文字识别、图表分析等任务,支持的图片格式包括JPEG、PNG、GIF和WebP。
深度求索官方表示,V4-Flash-Vision-Exp在各类Agent框架内展现出较好的多模态适配能力,能够支持用户借助多样化的Agent工具解锁更多实用工作场景。在Agent、推理、世界知识等纯文本任务上,该模型与V4-Flash正式版表现持平,原有优势完整保留。在需要视觉理解的Agent基准测试中,其性能较V4-Flash大幅提升,多模态Agent能力已接近Opus-4.8。
此次开源采用MIT License,意味着开发者可自由使用、修改和商用该模型,降低了多模态AI应用的门槛。V4-Flash-Vision-Exp的发布延续了DeepSeek在开源大模型领域的布局节奏,其视觉理解能力的加入,有望推动多模态Agent在文档处理、数据分析、自动化运维等企业级场景中的落地。
随着多模态能力的补齐,DeepSeek V4系列在文本与视觉融合任务上的覆盖范围进一步扩大。该实验版本的表现将为后续正式版模型的迭代提供参考,多模态Agent在实际业务中的适配效果仍有待社区和开发者进一步验证。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。