超节点成为AI算力新焦点,推理需求驱动系统架构竞争

这波热度的本质是基础设施竞争的计量单位从FLOPS变成每元、每毫秒能稳定产出多少有效Token。

2026年,超节点成为国产算力领域最受关注的技术方向。这一概念的核心逻辑在于:当单颗GPU无法承载AI算力需求时,将多颗GPU所在的服务器融合为一台超级计算机,从而将高速互连域从传统的8卡扩展到几十卡甚至上百卡,使卡间通信从网络传输转变为接近内存访问级别的低延迟操作。

超节点从概念走向产业共识,直接驱动力来自推理市场的爆发。大模型正从训练为主转向推理为主,用户对算力厂商的提问已从“能提供多少卡”转变为“每秒能稳定产出多少有效Token、成本是多少”。MoE架构的普及使前沿模型参数量快速突破万亿,DeepSeek R1拥有671B参数和256个路由专家,Kimi K2.5则达到1T参数和384个路由专家。每生成一个Token,模型内部需触发数十甚至上百次跨卡通信,传统服务器集群难以承受这一通信量级。

中科曙光高级副总裁李斌指出,行业衡量算力的标准已发生变化,过去主要看单颗芯片的峰值性能,现在更关注一套系统能持续输出多少有效算力。Agent的兴起进一步放大了这一需求,一次用户请求可能触发多轮模型调用、工具调用和并发任务,智能体推理需要生成比传统模型多近百倍的数据词元。

效率提升的幅度可从英伟达NVL72的对照实验中窥见。海外研究机构SemiAnalysis的开源推理基准InferenceX显示,在DeepSeek R1推理中,GB200 NVL72凭借72卡NVLink全互连,单卡吞吐最高达到HGX B200的4.4倍,峰值为每卡4130 Token/秒,而B200仅为941 Token/秒。两者使用同一代Blackwell GPU,唯一差异是系统架构。效率提升的主要来源并非单卡变快,而是互连域和系统架构对通信开销的压缩。

超节点落地需突破通信墙、功耗与散热墙、存储墙、复杂度墙四重瓶颈,考验的是计算、互连、供电、散热、存储、软件的系统级整合能力。中科曙光采用超节点内部高速互连与超节点之间scaleFabric高速网络的分层架构,浸没式相变液冷将PUE降至1.04,ParaStor系统围绕大规模并发访问和检查点读写进行优化。联想则将“海神液冷”品牌从通用服务器扩展至全部AI服务器,支持45度温水进水,其整机柜液冷产品单柜承重超过3吨、耗电达数百千瓦,工厂为此进行了承重加固和十兆瓦级供电改造。

在互连域规模上,各厂商路线存在分歧。联想问天超节点选择单节点40张GPU,认为40卡既能获得较高通信效率,又可避免超大规模互连在可靠性、运维上的挑战。曙光则同时提供十万卡AI超集群曙光8000和40卡scaleX40箱式超节点,对应不同客户需求。尽管路线各异,行业共识正在浮现:规模是手段而非目的,真正需要优化的一定规模约束下的系统效率。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
Databricks未来三年向新加坡投资超3.5亿美元 团队规模翻倍
上一篇 3小时前
百望股份CTO王志伟:行业模型不是通用模型缩小版,财税大模型需跨过三道门槛
下一篇 3小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部