2026年8月21日,DeepSeek上线了DeepSeek V4 Flash Vision Exp,这是一个多模态视觉理解模型。与V4 Flash和V4 Pro不同,该模型未发布技术报告,也未开源,官方仅提供了性能表和若干演示案例。新品发布距离DeepSeek多模态负责人陈小康在X平台预告灰度测试已过去近四个月,期间DeepSeek曾在客户端和网页端上线基于视觉原语机制的Vision模式。
DeepSeek创始人梁文锋此前在多模态问题上曾表示,多模态对C端用户产品很重要,但对智能的上限而言只是一个组件,并非主线本身。他提到V4后续版本将支持原生多模态。从产品定位看,DeepSeek V4 Flash Vision Exp并非如DeepSeek OCR系列那样仅承担文字识别功能的组件型模型,而是更接近主线模型。官方公布的测评基准也体现了这一倾向,包括Terminal Bench 2.1得分83.9、DeepSWE得分59.3,以及Chartography、ApexBench、Agents’ Last Exam等多项Agent基准,而非传统视觉模型常用的MMMU、MathVista、DocVQA等看图答题类测试。
这一测评选择反映出DeepSeek对多模态能力的技术路线判断。该模型的核心并非让用户看图聊天,而是让Agent看懂网页截图、读取图表数据、理解UI布局并完成任务。DeepSeek V4 Flash Vision Exp延续了DeepSeek在5月发布后即删除的技术报告《Thinking with Visual Primitives》中的方案。该论文由DeepSeek、北京大学、清华大学联合完成,提出将点坐标和边界框作为思维的最小单元嵌入推理链,使模型在计数、空间推理、迷宫导航等任务中实现精确锚定,从模糊的自然语言描述转向可指认的坐标式推理。
论文实验基于DeepSeek-V4-Flash作为语言骨干搭建多模态方案,此次发布的V4 Flash Vision Exp同样沿用该基座。从发布节奏看,DeepSeek近期的更新频率明显加快。此前V3.2版本与V4预览版之间相隔四个半月,V3正式版到V4发布用了约一年四个月。此次将实验性质的多模态模型直接开放给公众,显示出DeepSeek在产品策略上的调整。梁文锋曾表示通往AGI要经过产品这个台阶,但不用花太多精力做C端或B端。随着DSH产品走热,DeepSeek在发布后不到一周即更新多模态能力,如今又开放实验模型,其产品化路径正逐步清晰。
多模态在DeepSeek的技术框架中被定位为Agent和推理的入口。DeepSeek V4 Flash Vision Exp所展现的价值观是,多模态并非让人与模型进行看图对话,而是让模型在理解视觉信息后持续推进任务。这一思路与DeepSeek以Agent和推理为主线的技术方向一致,多模态在该体系中扮演的是强化推理能力的插件角色。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。