9月10日,深度求索正式发布DeepSeek V4.1 Flash模型。该模型是其全新模型结构系列中尺寸最小的版本,具备原生多模态视觉理解能力,已同步上线DeepSeek API。据官方介绍,新模型结构的设计目标为能力上限更高、推理速度更快、吞吐更大,并可扩展至更大参数规模的模型。
DeepSeek V4.1 Flash为552B参数的MoE模型,采用全新的Causal-Encoder-Decoder结构,输入与输出不对称:输入激活仅8B,输出激活16B,成本显著低于已知的同尺寸模型。同时,该模型采用新的预训练方式,并经过更大规模的强化学习后训练。在基准测试中,V4.1 Flash成功超越了包括DeepSeek V4 Pro在内的一众旗舰模型的智能水平。
在推理效率方面,新一代模型大幅减少了KV Cache缓存的大小。与上一代模型相比,对HBM的需求减少至四分之一,对SSD的需求减少至八分之一。相对于初代模型,KV Cache已压缩至原来的1/437。在Agent使用场景中,缓存命中的费用往往占比较高,对KV Cache的压缩可大幅降低Agent类任务的使用成本。
API层面,用户将模型名称更改为deepseek-flash即可调用最新的V4.1 Flash模型。旧版本模型V4 Flash与V4 Flash Vision Exp现已下线,出于兼容考虑,模型名deepseek-v4-flash与deepseek-v4-flash-vision-exp将被暂时路由至V4.1 Flash。经多方测试,V4.1 Flash在性能、费用、速度、总用时等各项指标上已全面超越V4 Pro,因此官方计划有序下线V4 Pro模型。北京时间2026年9月14日12:00之后,至未来V4.1 Pro上线之前,用户访问deepseek-v4-pro的请求将全部路由至V4.1 Flash,并按V4.1 Flash单价计费。
生态合作方面,腾讯(WorkBuddy、CodeBuddy)和OpenCode作为官方合作伙伴,现已全量接入DeepSeek V4.1 Flash。得益于模型架构的创新,V4.1 Flash能够以更低成本服务更多用户,官方相应下调了该模型的API定价。同时,为更合理地调配资源,V4.1 Flash仍采用峰谷定价机制,闲时价格为高峰时段价格的一半,鼓励用户根据实际使用情况调整任务时间。新价格于2026年9月10日12:00开始生效。
从行业视角看,DeepSeek此次通过架构创新在较小激活参数下实现了对旗舰模型的性能超越,同时大幅压缩KV Cache以降低Agent场景的推理成本,这一路径反映出大模型竞争正从单纯参数规模比拼转向推理效率与单位成本优化的方向。V4 Pro的逐步下线也意味着DeepSeek正在加速其模型矩阵的迭代与收敛。模型权重与技术报告已在Hugging Face平台开源发布。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。