2026年,超节点赛道骤然升温。华为、浪潮信息、阿里云、百度等主流算力厂商均在各自发布会上将超节点产品推向核心位置。在厂商密集布局的背后,一个基础问题被反复追问:什么算超节点,以及什么样的客户愿意为此买单。
《超节点定义与实践白皮书》指出,超节点必须具备三个技术特征:超大带宽、超低时延、内存语义与统一内存编址。其核心任务不再是简单叠加更多xPU,而是围绕xPU间通信、HBM容量、机柜功率密度、散热效率和可维护性等系统瓶颈进行协同优化。浪潮信息首席AI战略官刘军给出的判断更为直接:超节点的核心特征是“显存统一寻址”,这是它与传统节点集群的最大区别。但打通统一寻址只是基础,超节点还需实现对称直连,让芯片间数据直接传输,减少中间调度开销,同时针对超节点架构优化算子,将原本分散的计算与通信融合起来。
用户对超节点的需求,最终要转化为大模型推理响应速度,尤其是Token生成速度。浪潮信息此次发布的元脑SD200 Ultra超节点AI服务器,运行2.8万亿参数Kimi K3时,Token生成时延低至5.85毫秒,单用户输出速度达到170 Tokens/s,成为国内首个达到国际一线方案同一数量级的产品。在此基础上,浪潮信息还实现了对称直连,使GPU能够像访问本地显存一样直接访问远端GPU显存数据,Allreduce通信时间降低3.5倍。
超节点之所以能够实现远端显存本地化访问,底层依赖的是芯片间互联方式的根本性改变。传统Scale-out互联集群通过增加节点数量扩展算力,但节点间通信在万卡集群时代的模型训练中已存在明显瓶颈。引入面向Scale-up的互联技术,将单节点内部芯片之间的带宽和时延做到极致,撑起单节点算力峰值,是当下算力厂商构建十万卡集群互联协议的共识。
在超节点的规模之争上,各家路线存在分歧。一部分厂商认为,随着大模型参数、上下文长度和推理并发量持续增加,单个计算域需要容纳更多芯片和更大的内存空间,业界已有厂商推出从几百卡到几千卡的超节点服务器。另一批厂商并不认同规模越大越好。阿里云灵骏真武M890以64卡为一个Scale-up单元,再通过Scale-out网络扩展。浪潮信息去年8月推出64卡超节点,今年升级到128卡基于本土AI芯片的超节点。
刘军对此回应称,超节点不是越大就越好,核心是要让数据和计算离得越近越好。如果数据传输耗时过长,整个通信和调度成本可能会远远超过所获得的收益,同时可靠性成本也会迅速上升。这实际上点出了超节点规模之争的本质:它不是单纯的工程能力比拼,而是一道经济学题。更大的Scale-up域意味着更大的内存池和更低的跨节点通信开销,但也意味着更高的故障域风险和更复杂的调度成本。真正的平衡点取决于客户在跑什么任务、能承受什么成本。
刘军透露,现在很多客户都想用Kimi K3,但如何让客户用得上,算力方面仍存在较大瓶颈。从需求侧看,对于大模型厂商而言,此前多按调用量和API次数售卖Token,如今商业模式正在发生转变:从卖算力变成抽佣,即按照模型产生的下游收入与全球云厂商展开分成结算。这意味着市场并不会减少对算力的总需求,反而可能从结构和质量上提出更高要求,进一步推高算力消耗总量。
刘军观察到,首先用上先进算力的客户基本不需要厂商去教育,其共同特征集中在两点:一是需要能力很强的模型,二是希望Agent更多、更快、更便宜。他进一步指出,当前阶段的客户需求并不能按行业进行划分,传统按行业划分客户、按场景定义产品的思路,在Agent时代可能正在失效。真正驱动客户采购的,不是“你是哪个行业”,而是“你要跑多强的模型、要多少Agent、能承受多低的成本”。浪潮信息此次提出的Capability和Capacity双主线正是对这种需求的回应:SD200 Ultra面向前沿模型和复杂Agent,突破智能上限;HC2000面向持续、大规模推理需求,实现智能充分供给。
2026年9月,工信部明确提出“有序部署万卡、十万卡或更大规模的智能算力集群”,并强调适配国产算力芯片。这意味着十万卡集群正在从企业行为上升为产业政策方向。2026上半年,浪潮信息等国产算力厂商业绩增长明显,头部云厂商已开始建设基于国产GPU的十万卡级集群,标志着国产算力从备用选型向首选方案转变。
但当前国产算力落地存在一个现实问题:客户不缺模型,缺的是能把模型跑起来的系统能力。国产算力真正进入大规模应用,面临的挑战已经从“有没有芯片”转向“能不能把芯片用起来”,产出Token。芯片适配、软件栈、算子优化、集群调度等系统能力,正在成为影响国产算力实际使用效率的重要因素。刘军坦言,从提供算力到生产智能,厂商不仅仅交付一台AI服务器,还要负责客户把Token生产出来,把平台调度起来。这一思路转变也直接体现在产品设计上:过去更多围绕多元芯片的兼容展开,而现在是在同一个业务单元里,多元芯片协同工作,产业伙伴从零和博弈变为共同做大产业蛋糕。
从全球来看,谷歌A5X实例单站点集群最多支持8万个Rubin GPU,借助Virgo平台跨多站点聚合后可支持多达96万个GPU。微软在Fairwater数据中心采用单一扁平网络,集成了数十万块英伟达GB200。未来的竞争并不是谁有更多芯片,而是谁能让更多芯片像一台机器一样工作。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。