算力行业从堆卡转向系统工程,Token调用量两年增长超千倍

衡量算力基础设施的真正标准,已经从“拥有多少张卡”转向“能否让十万张卡稳定、持续、无瓶颈地协同完成一项真实的大模型任务”。

2026年,中国算力基础设施建设正经历一场从硬件堆叠向系统工程的深层转变。DeepSeek在内蒙古乌兰察布布局1GW级智算基地,曙光8000宣布全国产10万卡超集群接入国家超算互联网,阿里云将AIDC交付周期压缩至100天。与以往侧重展示硬件张数和理论算力峰值不同,行业焦点已转向大规模集群的实际协同效率。

这一转变的直接驱动力来自下游需求的爆发式增长。国家数据局披露,2026年3月中国日均Token调用量超过140万亿,较2024年初的1000亿增长逾千倍。OpenRouter平台数据显示,2026年2月9日至15日,中国模型调用量为4.12万亿Token,高于同期美国模型的2.94万亿Token。需求结构的变化是根本原因:Agent任务需要模型自主规划、调用工具并验证结果,单个任务的Token消耗远高于传统对话场景。

AI Coding成为最典型的Token消耗场景。一项基于SWE-bench Verified的研究显示,Agentic Coding平均Token消耗约为单轮代码推理的3500倍,输入输出Token比平均达154:1。OpenRouter与a16z发布的《2025 AI使用报告》显示,编程任务Token占比已从2025年初的11%升至50%以上,成为平台最大单一使用品类。

需求爆发直接反映在厂商收入上。智谱GLM Coding Plan全球付费开发者突破24.2万,Token调用量半年上涨15倍,2026年一季度API价格累计上调约83%的同时调用量仍增长约400%,其模型API的ARR在3月达到17亿元,7月整体ARR冲上10亿美元。月之暗面K3发布48小时内用户请求量逼近集群承载极限,MiniMax M2.5上线七天调用量突破3.07万亿Token。火山引擎豆包大模型日均Token调用量从2024年底的2万亿增长至2026年6月的180万亿,两年增长超1500倍。阿里云2026财年第四季度AI相关收入达89.71亿元,占外部商业化收入比重首次超过30%。

然而,调用量增长并未同步带来商业模式的成熟。月之暗面K3发布后因算力不足暂停C端新订阅入口,智谱GLM部分套餐改为限量销售,阿里云百炼Coding Plan Lite套餐停止新购。多家云厂商和模型公司已从包月制转向Token精细计费。根本原因在于,Agent场景下单个用户的算力消耗差异可达数十倍甚至上百倍,固定订阅模式无法覆盖不确定的算力成本。

衡量算力基础设施的真正标准,已经从“拥有多少张卡”转向“能否让十万张卡稳定、持续、无瓶颈地协同完成一项真实的大模型任务”。行业正从单纯追求规模扩张,进入以有效产出和单位经济性为核心的竞争阶段。这一转变将决定哪些厂商能在Agent时代建立可持续的商业模式。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
金山办公2026年上半年归母净利润25.18亿元,同比增长236.94%
上一篇 1小时前
字节跳动关停付费小说应用红烛故事 运营不足一年
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部