大语言模型API市场的竞争焦点正在从统一的折扣价格转向差异化的token计费机制。8月17日,DeepSeek正式实施新的分时段定价方案,在一天内设置高峰和低谷两个费率窗口,成为这一转变的最新标志性事件。
根据新方案,DeepSeek在北京时间9:00-12:00和14:00-18:00的高峰时段执行标准费率,其余时间费率减半。以V4 Pro模型为例,高峰时段缓存未命中输入价格为每百万token 9元,输出价格为27元,缓存命中输入价格为0.3元。而数日前公布的该模型公开价格分别为缓存未命中输入3元、输出6元、缓存命中输入低至0.025元。相比之下,高峰时段缓存命中的输入价格涨幅最大。更轻量的V4 Flash模型也采用了类似调整,高峰费率分别为3元、9元和0.1元。
具体数字本身的重要性不及它们所引入的定价结构。分时段差异定价将非紧急工作负载引导至空闲时段,提升固定推理容量的利用率。缓存感知定价奖励重用上下文的系统,而非重复处理。旗舰模型与轻量模型的分离费率,使高吞吐、简单任务以更低成本运行,而复杂推理仍保持溢价。国内外其他供应商也在测试类似方案,包括预付费套餐、基础费加用量组合,以及少数尝试将费用与可量化业务结果挂钩的商业协议。
多重因素正推动这一市场层面的变化。当模型嵌入智能体工作流后,token消耗量显著上升。单个用户请求可能触发长链的中间步骤、工具调用和修订,服务这些链条需要持续的算力、内存带宽和能源支出,单条token的边际成本已不再可忽略。与此同时,头部开源权重系统与闭源产品之间的性能差距正在收窄。全球使用量追踪数据显示,中国模型在公开可观测的API流量中占比持续提升。当质量相近的替代品以不同价格点存在时,目录价格和总拥有成本对许多买家而言成为决定性因素。
高定价的海外供应商则对特定模型和层级进行选择性降价以应对竞争。整体市场因此呈现价格双向变动:此前主要依靠成本竞争的提供商上调价格,而面临份额压力的现有玩家下调价格。此前全行业普遍的超低价阶段正在结束,取而代之的是更精细、更多维度的定价体系,这一趋势预计将持续重塑大模型API市场的竞争格局。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。