超聚变王梁栋:AI进入推理主导时代,算力竞争从堆硬件转向Token产出效率

训练比拼的是算力“爆发力”,推理考验的是长期稳定输出的能力与单位Token成本。

9月17日,在2026 ITValue Summit数字价值年会上,超聚变算力领域副总裁王梁栋指出,伴随大模型能力加速演进,AI已进入以推理为主的“干活”时代,全球Token消耗将持续爆发,推动AI基础设施同步进化。算力行业的竞争逻辑正在迭代,单纯依靠堆叠服务器和扩张硬件规模的粗放式路径,效用持续减弱。

Token调用数据正在揭示AI产业底层逻辑的转向。据中国发展高层论坛2026年年会披露,今年3月中国日均Token调用量突破140万亿,相比2024年初的1000亿,两年增长超千倍。同月,中国AI大模型周Token调用量连续三周超越美国。全球最大AI模型API聚合平台OpenRouter的数据显示,3月16日至22日,全球AI大模型总Token调用量为20.4万亿,中国达7.359万亿,占全球36%。

多家机构给出了更具冲击力的预测。摩根大通预计,中国AI推理Token消耗量将从2025年的约10千万亿增长至2030年的约3900千万亿,五年增长约370倍。IDC判断,全球年度Token消耗量将从2025年的0.0005 Peta Token增长至2030年的15万Peta Token,年复合增长率达3418%;到2031年,全球活跃智能体数量将达3.5亿个,单智能体Token消耗量可达传统对话应用的百倍乃至千倍级。不同机构统计口径存在差异,但产业方向高度一致:AI算力重心正从一次性训练向持续性推理迁移。

训练属于一次性重投入,赛道比拼模型规模与参数上限,客户选型通常优先考量GPU显存和单卡峰值算力。推理则是7×24小时持续运转的流水作业,大模型嵌入各类业务系统,不间断承接用户请求。客户衡量算力方案的标尺随之调整:集群单位时间能稳定输出多少Token、单个Token的电力与硬件折旧成本能否控制在业务可承受范围、大规模集群长期运行能否稳定跑满负载。训练是阶段性投入,推理每新增一个Token都会产生实打实的成本。

这一变化正从需求端反向重塑AI算力产业链。服务器架构、液冷方案、集群组网均迎来迭代压力,厂商竞争的评价维度从单卡硬件参数向整套系统持续生产Token的效率延伸。

过去几年,AI数据中心的主流标准单元是8卡服务器,将8张GPU集成在单机箱内接入网络,再批量部署数百上千台组成万卡集群。这套架构在模型参数维持百亿、千亿级阶段尚能胜任,但当模型走向万亿参数、百万路并发推理请求持续涌入,卡与卡之间、服务器与服务器之间的数据搬运成为制约性能的核心瓶颈。中国信通院在《AI计算节点发展研究报告(2026年)》中指出,超节点通过在单节点或高密度机柜内大规模部署NVLink等卡间直连技术,将数十至上百张加速卡整合为内存统一寻址、算力无缝调用的“超级计算单元”,卡间通信带宽显著提升、延迟明显降低。

架构迭代思路并非单一厂商的独家创新。华为在全联接大会2026上发布昇腾960超节点,单节点4096卡规模、提供8E FP8算力;联想在WAIC 2026展出万全异构智算平台V5.0超节点方案;超聚变则将FusionPoD for AI整机柜方案推到台前。行业共识正在收敛:中大型AI数据中心的选型重心,正从零散采购独立服务器向整机柜和系统级一体化方案倾斜。

这并不意味着8卡服务器会快速退出市场。在小规模研发测试、轻量化模型、边缘推理等场景下,8卡单机仍保有灵活性。但随着业务对Token吞吐、集群稳定性和单位Token成本提出更高诉求,单纯堆叠8卡服务器的方案边际效益或将逐步走低,超节点方案的兴起可视为行业突破这一架构局限的尝试。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
微软发布LiteBox首个版本v0.1,基于Rust的沙箱库操作系统面向机密计算场景
上一篇 4小时前
ICANN新一轮顶级域名申请公布:OpenAI申请.gpt、Anthropic申请.claude,AI相关域名成热点
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部