DeepSeek正在对其自身定价体系发起压力测试。该公司近日开放了一个名为V4.1 Flash的中间版本检查点的限量内部测试,并在随附的反馈表中询问参与者,新模型能否全面替代当前在线的V4 Pro。
测试版本以9月10日到期的模型名称提供访问,据称采用了新结构,新增原生多模态支持,并在能力、速度和成本方面相较此前Flash版本有所提升。测试期间,该版本按现有V4 Flash相同的费率计费,每个账户并发请求限制为20次。早期开发者反馈显示,该模型在编码和检索任务上的生成速度显著提高。
几乎在同一时间,DeepSeek宣布Flash系列价格将于北京时间9月10日中午下调。非高峰时段缓存命中输入降至每百万token 0.02元,缓存未命中输入为1元,输出为4元;高峰时段费率仍为非高峰时段的两倍。其中缓存命中输入降幅最大,达到60%。此次调价同时适用于主力Flash模型及视觉实验版本。
Flash与Pro之间的价差历来显著。在之前的峰值费率下,Flash输出定价为每百万token 9元,而Pro则远高于此。开发者长期以来接受为更复杂的任务支付数倍费用。悬而未决的问题是,一个更快、更强的Flash能否承接足够多的日常及中等复杂度负载,使Pro层级仅保留给真正困难的工作。
这一问题与DeepSeek自身强调的”智能密度”概念相呼应。此前的推理导向版本已证明,更长的思维链可以提高难题的准确率。后续技术讨论则转向能否用更少的token和更短的耗时获得同等质量。一个能以更快速度和更少中间计算得出有用答案的模型,既能改善用户体验,也能优化单位经济性。
智能体工作负载使经济性问题更加突出。单个用户请求可能触发多次模型调用,系统需要读取文件、调用工具、检查中间结果并继续执行。如果步骤数量成倍增加,低单价并不自动意味着低任务成本。因此,允许模型发出更长的工具使用程序、跨步骤保留相关推理并避免重复处理已检视材料的框架,其重要性不亚于模型权重本身。DeepSeek开源的Harness工作即处于这一层面:模型负责决策,Harness提供工具、会话状态和执行环境。
类似的重新校准也出现在其他前沿实验室。当一款中档模型的实用性能接近此前旗舰产品而成本仅为零头时,高端层级必须依靠用户愿意等待并付费的更长周期、更高风险任务来证明自身价值。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。