DeepSeek开启V4.1 Flash内测,下调API价格并探索智能密度优化

对开发者来说,最终要比较的,是同样一项工作能否做好,以及做完之后的总账单。

DeepSeek于昨日开启V4.1 Flash中间版本内测,该版本采用新的模型结构并原生支持多模态。在配套的用户反馈问卷中,DeepSeek直接询问用户该模型能否全面替换线上V4 Pro,这一动作表明公司正在测试Flash型号在效果上超越Pro型号的可能性,并探索以更低的成本支撑大规模调用的方案。

Pro与Flash之间存在明确的价格梯度。目前高峰时段每百万输出token,Flash收费9元,Pro收费27元。与此同时,DeepSeek在开放平台宣布,自9月10日中午起下调Flash系列价格:空闲时段每百万token的缓存命中输入降至0.02元,未命中输入降至1元,输出降至4元,高峰价格为空闲时段的两倍。三项降幅分别为60%、约33%和约11%。Flash系列的使用门槛在新版本测试期间进一步降低。

DeepSeek对模型能力的迭代路径呈现出从追求深度到追求效率的转变。2025年5月更新R1时,公司将“思考更深”作为核心改进,在AIME 2025测试中,新版R1平均每题使用约2.3万个token,较旧版的1.2万个接近翻倍,准确率从70%提升至87.5%。但在2025年12月发布的V3.2报告中,DeepSeek提出了提高推理链“智能密度”(intelligence density)的目标,原因在于为达到Gemini 3.0 Pro等模型的输出质量,模型需要生成更长的推理过程,输出等待时间和单次调用费用已成为实际约束。

这一问题在大小模型分工中更为突出。V4早期模型卡显示,Flash在获得更多思考预算后能接近Pro的推理表现,但在知识和复杂Agent工作流上仍然落后。小模型单步计算成本更低,但可能需要更多步骤才能达到大模型的结果,开发者看到的单价优势最终取决于任务完成方式。DeepSeek团队已在生成速度方面进行改造,7月公开的DSpark论文报告显示,在V4-Flash线上用户流量下,相比MTP-1基线并保持相同吞吐水平时,单用户生成速度提升60%至85%。该方法通过处理推测解码中的验证浪费,让用户更快获得输出,同时维持整体服务容量。

内测当天,有LINUX DO用户在编程工具中接入新Flash执行停机维护页面任务。模型读取了项目规范中一条已弃用的决策记录,并列出文档维护、代码提交和审查安排,最终该任务花费15.5元。这一案例反映出Agent与普通聊天的成本差异:用户只交代一项工作,模型可能在后台运行多轮调用,每轮都可能产生输入和输出费用。模型的单价低并不代表整项工作一定便宜,减少不必要的调用同样关键。

DeepSeek开源的Harness框架旨在参与执行流程的编排。官网用“Agent = Model + Harness”解释两者关系,模型负责判断,Harness提供工具、管理会话和运行环境。其中的PTC模式允许模型一次写出一段程序,将多步工具操作串联执行,例如批量读取文件并筛选后仅返回相关结果,从而减少模型反复参与和上下文占用。对于已经明确处理规则的材料,程序可执行完整流程,模型再针对留存信息作判断。智能密度的检验标准最终落在原先需要昂贵模型和长时间计算的任务能否转化为普通调用,以及Agent任务的总账单是否可控。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
算力之后存储成AI落地新瓶颈 推理需求重构存储架构
上一篇 2小时前
OpenAI CFO称自研AI辅助芯片设计提速,企业业务收入占比提前达半
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部