大模型Token均价三个月腰斩,厂商竞相推出Flash模型与缓存降价争夺用户

AI模型能力在通胀,Token价格在通缩。

据Silicon Data的LLM Token支出指数显示,8月市场每百万大语言模型Token的平均支付价格单月下跌29%,降至0.97美元,首次跌破1美元关口。而今年5月,该指数尚在2美元以上。短短三个月内,大模型Token的平均支付价格经历了一次腰斩。

这一价格走势与过去三个月大模型行业的密集发布形成鲜明对比。9月第一周,OpenAI、Anthropic、谷歌先后发布Claude Fable 5.1、Gemini Flash 3.8、GPT-6 Astra。国内厂商同样动作频繁,智谱发布GLM-5.3-Flash,阿里推出Qwen3.8-Flash,DeepSeek下架V4 Pro并发布V4.1 Flash接棒,月之暗面则交出Kimi K2.8 Preview。各家模型能力持续攀升,但定价却呈现相反走势。

对于Token平均支付价格的快速下跌,存在两种解释:全行业普遍降价,或调用结构集体向低价模型迁移。从各家大模型API平台用户量与Token消耗量持续增长的背景来看,两者正在同时发生。高盛One-Delta部门负责人Rich Privorotsky指出,AI大模型已经进入下半场,竞争焦点正由技术是否可行转向成本是否可承受。

价格下探的路径呈现多元化。最直接的方式是官方降价。OpenAI于7月30日宣布GPT-5.6 Luna永久降价80%,同系列Terra降价20%;不到一个月后,又将旗舰模型GPT-5.6 Sol的输入价格下调20%,输出价格下调三分之一。国内方面,DeepSeek曾于5月将DeepSeek V4 Pro价格永久下调75%,调整后输入(缓存命中)为0.025元/百万tokens,输出为6元/百万Tokens,尽管8月因成本压力宣布涨价,但这一轮调价直接推动了5至6月Token支出价格的快速回落。

另一种方式更为隐蔽,即将API接入自家编程或办公产品,以限时折扣或免费额度变相降价,名义价格未动,实际降低了用户的使用门槛。

更具根本性的策略是对模型本身进行优化。大模型厂商开始在旗舰系列之外发布Flash版本,以接近旗舰的性能和远低于旗舰的定价,承接用户日常任务。Qwen3.8-Flash通过新模型架构降低训练与推理成本,官方披露其训练开销约为Qwen3.7-Plus的九分之一,并将优势集中在编码和办公场景所需的代码、Agent等能力上。Kimi K2.8 Preview则被官方描述为接近K3性能、效率更高的模型。Flash模型的定位并非全能优等生,而是面向大多数日常任务的性价比选择。

旗舰模型同样未能避开成本优化。Anthropic在9月发布的Claude Fable 5.1中,将缓存读取价格从1美元降至0.25美元每百万Token,降幅达75%。从推理成本结构看,大模型推理的主要开销集中在Prefill阶段,即对输入内容进行Token化并生成KV Cache存入显存。而缓存读取时,相同上下文的边际成本几乎为零。随着Agent场景逐渐成熟,同一长上下文可能被反复读取数十上百次,降低缓存价格相当于直接补贴增长最快的应用场景。DeepSeek V4.1 Flash则通过架构、注意力机制、缓存精度三个维度压缩KV缓存空间,从源头降低存储成本。OpenAI的思路是压缩输出Token长度,使相同任务消耗的Token更少,形成单价上涨但单次任务总价下降的效果。

从降价、折扣、Flash模型到缓存优化与输出压缩,大模型厂商的策略各有侧重,但目标一致:在模型能力持续提升的同时,让用户的使用成本维持在可接受范围内。当价格成为用户选择模型的关键变量,如何在成本曲线与增长叙事之间取得平衡,将是大模型厂商下一阶段的核心命题。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
World Labs发布多模态世界模型Atlas,以少量图像实现3D重建并瞄准具身智能训练
上一篇 21小时前
OpenAI联合创始人布罗克曼:AI研发放缓应仅限前沿大模型领?
下一篇 21小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部