企服科学:堆卡不再称王,算力的胜负系于每度电能产出多少Token

当Token成为新的度量衡,算力的胜负就不再写在机柜的参数表上,而写在每一度电、每一行代码所能兑现的智能里。

9月17日,在2026 ITValue Summit数字价值年会上,超聚变算力领域副总裁王梁栋抛出一个判断:AI已经进入以推理为主的“干活”时代。这句话真正的分量,不在它对趋势的描摹,而在它给一条旧路径下了判决书——单纯堆叠服务器、扩张硬件规模的粗放式扩张,边际效用正在持续减弱。一个行业的竞争逻辑一旦换了标尺,过去几年被奉为圭臬的玩法,会在一夜之间从“常识”变成“包袱”。

问题随之而来:这场从“训”到“推”的迁移,究竟是一次周期性的供需波动,还是一次不可逆的范式更替?当中国的Token调用量出现连续超越,这背后是算力实力的此消彼长,还是应用密度的另一种信号?而最要紧的一问是:如果评价算力的标尺从单卡参数换成整套系统稳定生产Token的效率,中国的云厂商、算力服务商,以及所有把AI嵌进业务的企服公司,究竟该重新校准什么?

先看第一个问题。训练与推理,看似只是同一枚硬币的两面,实则是两种截然不同的生意。训练是一次性的重投入,赛道比拼的是模型规模与参数上限,客户选型时盯的是GPU显存和单卡峰值算力,买之前就把账算清了。推理却是7×24小时不间断运转的流水作业,大模型嵌进各类业务系统之后,要日复一日承接真实用户的每一次请求。这意味着衡量的标尺必须换:集群单位时间能稳定输出多少Token、单个Token背上的电力与硬件折旧成本能否落在业务可承受的区间、大规模集群能否长期跑满负载而不掉链子。训练是阶段性的开支,推理则每新增一个Token都产生实打实的成本。一个是资本开支的账,一个是运营成本的账,算法完全不同。

数据的量级足以说明这不是小修小补。据中国发展高层论坛2026年年会披露,今年3月中国日均Token调用量突破140万亿,相比2024年初的1000亿,两年增长超过千倍;同月,中国AI大模型周Token调用量连续三周超越美国。全球最大AI模型API聚合平台OpenRouter的数据显示,3月16日至22日,全球AI大模型总Token调用量为20.4万亿,中国达7.359万亿,占全球36%。预测端同样陡峭:摩根大通预计中国AI推理Token消耗量将从2025年的约10千万亿增长到2030年的约3900千万亿,五年增长约370倍;IDC则判断全球年度Token消耗量将从2025年的0.0005 Peta Token攀升至2030年的15万Peta Token,年复合增长率高达3418%,并预计到2031年全球活跃智能体将达3.5亿个,单个智能体的Token消耗量可达传统对话应用的百倍乃至千倍级。

把镜头拉远,这是一次典型的度量衡更替。工业时代,电力普及初期,人们比拼的是“有没有电”“发电量多大”;等到电力变成生产的血液,真正的胜负手就转移到了“每度电多少钱”“每度电能产出多少价值”。算力正在经历同一种迁移:过去的荣誉属于机柜里的参数表,未来的胜负写在每一度电产出的Token里。当Token从技术术语变成计价单位,算力也就完成了从“资源”到“商品”的身份跃迁。

再看中美对照这个更敏感的问题。中国周Token调用量连续三周超越美国,OpenRouter口径下中国占到全球36%,这组数字容易被读成“赢”。但调用量终究不等于算力实力,它反映的是需求的密度、应用的渗透与工程化的落地速度。需要清醒的是,不同机构的统计口径本就存在差异。更准确的解读或许是:在训练端的军备竞赛上,竞争依然胶着;而在推理端——也就是真正把AI变成生产力的那一端——中国的场景密度、成本敏感度与落地速度,正在成为一种结构性的相对优势。这不是胜负已分,而是赛道重心的位移,恰好落在了一个更看重“用好”而非“造大”的区间。

于是第三个问题,也就是新旧逻辑的对照,变得具体起来。过去几年,AI数据中心的标准单元是8卡服务器:8张GPU集成在一个机箱里接入网络,再批量堆出数百上千台,拼成万卡集群。这套架构在百亿、千亿参数时代游刃有余,可一旦模型走向万亿参数、百万路并发推理请求持续涌入,卡与卡之间、服务器与服务器之间的数据搬运,就成了掐住性能咽喉的瓶颈。中国信通院在《AI计算节点发展研究报告(2026年)》中给出了一个新答案:超节点——通过在单节点或高密度机柜内大规模部署NVLink等卡间直连技术,把数十至上百张加速卡整合成内存统一寻址、算力无缝调用的“超级计算单元”,让卡间通信带宽显著提升、延迟明显降低。这不是某一家厂商的独家创意:华为在全联接大会2026上发布昇腾960超节点,单节点4096卡规模、提供8E FP8算力;联想在WAIC 2026展出万全异构智算平台V5.0超节点方案;超聚变则把FusionPoD for AI整机柜推到台前。行业共识正在收敛——中大型AI数据中心的选型重心,正从零散采购独立服务器,向整机柜与系统级一体化方案倾斜。

但要说8卡服务器会迅速退场,也是误读。在小规模研发测试、轻量化模型、边缘推理等场景里,8卡单机依然保有它的灵活性。真正在变的是边际效益的曲线:当业务对Token吞吐、集群稳定性和单位Token成本提出更高诉求,单纯堆叠8卡的方案,单位投入换回的产出会越来越薄。超节点的兴起,与其说是替代,不如说是行业为突破架构天花板所做的一次集体突围。

回到中国企服的坐标系。当算力的评价尺度从“买了多少卡”转向“稳定生产了多少Token”,整个价值链的商业语言都要重写。云厂商和算力服务商要做的不再是卖硬件、卖资源,而是卖单位Token的成本与稳定性承诺——计费模式会从“按资源计费”缓慢转向“按产出计费”,客户要的是一份能写进业务模型的SLA。软件与SaaS厂商则必须把推理成本前置到产品设计里:一个智能化功能值不值得做,不看它多酷,而看它规模化之后,每Token的成本能否被用户价值覆盖。服务的护城河,正从功能清单,转移到单位经济模型。

更长远的影响,藏在产业链的每一个环节里。从服务器架构到液冷方案,从集群组网到整机柜供应链,都在被推理时代的持续负载反向重塑。这场由需求端发起的迁移,正在重新分配整条链条上的价值与话语权。谁能把“稳定、低廉、大批量地产出Token”变成可交付的工程能力,谁就握住了下一个五年算力生意的定价权。

当Token成为新的度量衡,算力的胜负就不再写在机柜的参数表上,而写在每一度电、每一行代码所能兑现的智能里。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
企服科学:通义千问要堆到10万亿参数,一边做大还要一边把成本做小
上一篇 1小时前
企服科学:Spotify杀进企业软件,卖的从来不是技术而是一整套交付
下一篇 35分钟前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部