DeepSeek于近日开启V4.1 Flash中间版本deepseek-v4.1-flash-expires-on-0910的内测,测试期至9月10日。据官方介绍,该版本采用新的模型结构,原生支持多模态,能力、速度与成本控制均有显著优化。此次内测未附带技术报告或完整性能参数表,但据社区多位技术博主的实测反馈,该中间版本在推理速度与多模态理解能力上表现突出。
V4.1 Flash是DeepSeek首款原生多模态模型。与此前V4 Flash Vision-Exp通过外接视觉编码器和对齐器实现多模态支持不同,V4.1 Flash在模型架构层面即实现图文一体化输入输出。从V4正式版到V4.1版本发布仅相隔40天,新结构在提升性能的同时降低成本,这一迭代节奏引发社区关注。实测数据显示,在对话场景中,模型思考时间缩短至0.3秒,生成速率达每秒159.3个token,端到端耗时0.8秒;在重度长文本推理场景下,生成速度可达每秒420个token,端到端吞吐达409.5 token/秒。与V4 Flash Vision-Exp相比,新模型在49k超长上下文检索场景下处理速度快5.2倍,SVG代码生成快6.0倍,Manacher回文算法题解答快4.6倍,大型SQL查询生成与优化快5.0倍,asyncio异步架构重构任务快3.9倍。在价格方面,V4.1 Flash的调用价格与V4 Flash保持一致。
在V4.1 Flash内测前一天,DeepSeek宣布释放150人招聘名额,面向2至10年经验的资深工程师,同时兼顾应届生,方向涵盖服务端开发与Agent弹性计算研发。DeepSeek Harness负责人崔添翼在社交平台解释称,此次扩招源于“量的激增引发了复杂度的指数级爆炸”,数据、机器、训练任务、Agent环境、用户及请求等各维度规模急剧增加,原有后端系统已难以满足新的负载需求,需要扩充团队以升级、维护和重写各类后端系统。
此次扩招及新模型发布标志着DeepSeek正从算法驱动的实验室模式向工程化企业运营转型。随着大模型从静态预训练走向动态环境交互,模型训练需要在毫秒级内与大量动态沙盒环境实时交互,这对推理调度、弹性计算和基础设施提出更高要求。V4.1 Flash的高吞吐能力依赖更强的GPU批处理调度、请求混排及资源自动伸缩能力,而新模型结构也意味着DeepSeek需要在推理框架、CUDA算子及模型压缩量化等底层环节投入更多工程资源。这150名新增工程师将成为支撑其从实验室走向规模化企业服务的关键力量。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。