超节点成国产算力新赛道,大模型推理需求倒逼系统级创新

一旦系统级效率成了新标准,单卡性能差距就没那么要命了。

Kimi K3发布技术报告时,在官方部署文档中明确建议在64卡及以上超节点配置中部署。这是超节点第一次被写进大模型的部署要求,且作为硬性门槛出现。Kimi K3拥有2.8万亿参数、896个专家,MoE架构下的通信量庞大,跨节点通信一旦受阻,推理效率将大幅下降。随后,阿里云真武M890超节点实例上线,Kimi K3和通义千问3.8 Max均已在该平台上运行。

供给端与需求端的相互拉动,正在推动行业集体转向超节点方案。这一转向的背景是,传统算力扩展路径正面临瓶颈。据SemiAnalysis估算,单颗国产AI芯片的性能约为英伟达Blackwell的三分之一,先进制程的限制短期内难以突破。与此同时,大模型参数规模向数万亿级迈进,MoE架构下每生成一个词元,成千上万颗GPU需要同步参数、交换数据。传统8卡服务器在扩展过程中,通信等待时间不断拉长,算力利用率反而下降。

算力每两年增长三倍,内存带宽仅增长1.6倍,互连带宽增长1.4倍。芯片计算速度的提升,受制于数据供给和传输效率。超节点的思路是通过高速互联将成百上千颗芯片整合为一个逻辑统一的算力集群,使数据交换不再依赖传统的外部通信路径。华为内部测算显示,单颗昇腾芯片性能不及英伟达,但昇腾950超节点的整体性能达到GB200 NVL72的1.7倍。

英伟达的护城河在于CUDA生态,十余年积累数百万开发者,单卡性能对比相当于在对方主场竞争。超节点方案的竞争焦点在于集群调度、互联效率和系统稳定性,即上万颗芯片持续稳定运行的工程能力。这一系统工程领域,英伟达并不具备数十年的先发优势,双方的起跑线差距并不悬殊。

在今年的WAIC展会上,各家厂商展示了不同的超节点技术路线。第一条路线是扩大规模。华为昇腾950超节点支持1024卡配置,满配可扩展至8192卡,为目前业内最大规模。中科曙光的曙光8000十万卡集群已在郑州国家超算互联网核心节点落地并满载运行。该集群采用”原生超智融合”设计,同一套系统可覆盖FP64科学计算精度到INT8推理精度,既能训练大模型,也能支撑气象预报、基因测序等科学计算任务。中科曙光高级副总裁李斌表示,从万卡到十万卡,规模扩大本身不难,难的是性能能否同步提升,任何环节的短板都会导致性能折损。

第二条路线是底层传输介质的革新。壁仞科技推出NPO光互连方案,以光信号替代铜线传输,单个超节点可扩展至1024卡。铜缆电信号在超过3米后衰减严重,现有方案最多支持128张GPU,英伟达同样面临这一限制,其2026年GTC上宣布计划通过光互连将系统从NVL72扩展至NVL576。壁仞的方案还将GPU节点与交换机节点物理分离,通过光纤灵活互连,改变了传统一体式机柜形态。

第三条路线是降低部署门槛。中兴OEX采用开放解耦设计,兼容多家芯片,客户可自行搭配。中科曙光推出scaleX40,为全球首个无线缆箱式超节点,采用40卡标准19英寸箱式设计,部署时间从小时级压缩至分钟级,可适配现有数据中心机房。40卡配置覆盖了大多数企业的性能与成本平衡点,中科曙光同时布局十万卡集群与40卡入门方案,采取两端覆盖策略。

英伟达的路径是先迭代GPU架构,再升级NVLink互联,最终以NVL72形态整合为超节点。国产算力产业则先构建超节点系统级方案,再反向推动芯片设计优化。在制程工艺受限的情况下,系统层面的效率竞争正在成为新的标准。这一竞争格局下,单卡性能差距的相对重要性正在下降,系统级算力供给方式的重构成为国产算力产业的主要突破方向。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
莫言谈AI写作:可胜任格律诗词却难出传世名篇
上一篇 2小时前
联想AI服务器在手订单达540亿美元,基础设施业务能否复制Oracle云转型路径
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部