华为发布Peerium计算架构与昇腾960超节点,灵衢互联技术成AI算力布局关键

买到了多少峰值算力,与最终能用上多少有效算力,中间隔着整个系统。

在2026年全联接大会期间,华为轮值董事长徐直军与华为半导体首席科学家廖恒对外披露了华为在AI算力领域的最新进展:正式发布Peerium计算架构,并推出全球首个采用NPO(近封装光学)技术的超节点——昇腾960超节点。与此同时,华为确认昇腾950芯片已上市,Atlas 950超节点开始交付,基于该超节点构建的25.6万卡集群正在部署中,下一代Atlas 960系统已进入测试阶段。

徐直军在大会上回顾称,一年前华为公布昇腾芯片路线图时,外界关注焦点几乎全部集中在芯片本身,而同期发布的互联协议灵衢(UnifiedBus,UB)未获得同等关注。他表示,灵衢是华为AI算力布局中的关键环节,其价值在于解决大规模处理器集群协同工作的效率问题。随着芯片数量从单颗扩展到数千、数万乃至更大规模,如何让这些芯片像一台计算机一样工作,成为比芯片制造本身更复杂的系统性挑战。

大模型训练需要大量处理器频繁交换数据、同步结果。单颗芯片算力再高,也必须等待其他芯片完成工作后才能进入下一阶段。一条链路的短暂异常,可能影响一个运行了很久的训练任务。徐直军指出,企业购买的芯片数量持续增加,并不意味着等待时间会自行消失,处理器增加带来的收益,绝大部分被通信和协议转换的开销抵消。峰值算力与实际可用有效算力之间,隔着整个系统的协同效率。

为应对这一挑战,华为提出Peerium计算架构。按照华为的定义,该架构通过嵌套并行、统一内存寻址和平等互联,可支撑百万级处理器像一台计算机一样协作。软件侧采用Nested BSP的组织方式,将任务分成不同层级的并行工作;硬件侧则从芯片、板卡、机柜一直延伸到超节点和更大集群,通过灵衢互联层层折叠时间,与软件侧结构对应。

灵衢是实现Peerium架构的关键互联技术。徐直军介绍,传统计算体系中,总线负责近处设备互联,网络负责远距离通信,两者各自发展出不同技术体系。AI将更多处理器拉入同一任务后,不同通信机制之间的衔接成本被显著放大。华为的解决方案是将更大范围的设备纳入同一套互联规则,使柜内、柜间、数据中心之间乃至一个数据中心区域内部都能运行同一协议,同时保持高速传输。

这一决策的背后是华为在连接技术领域的长期积累。2019年之前,华为团队已历经多处理器互联、PCIe、RDMA以及存储和内存接口等多种技术的研发与交付。2019年,互联被确立为计算系统架构的战略方向;2020年7月,Unified Bus技术项目正式立项。自立项至2023年,UB经历了技术规范定义、协议版本冻结,进入NPU、CPU和交换芯片的设计与投片阶段,随后完成套片测试和系统验证。徐直军透露,昇腾910C超节点采用UB 1.0,昇腾950超节点采用UB 2.0,昇腾960超节点将采用UB 2.1,灵衢的演进已与华为计算产品节奏深度绑定。

在传输介质层面,华为选择了NPO路线而非CPO。徐直军介绍,Hi-ONE模组与昇腾芯片之间保留约五厘米的板上铜连接,其余相关互联转向光连接。基于NPO,华为构建了全光超节点,铜缆被取消,铜仅存在于PCB板上。徐直军表示,选择NPO而非CPO时,华为内部没有过争论。目前博通、英伟达等厂商正在推进CPO产品,两种路线追求更高效的光互联,也需要分别处理封装、散热、成本和维护问题。

徐直军总结称,物理距离不会因协议统一而消失,不同位置的带宽和时延仍有差别,但华为希望尽量减小跨越这些边界时的性能损失。灵衢的价值在于,它能够做到柜间、柜内以及数据中心之间,甚至在一个数据中心区域里面都使用一个协议,并且保持高速。总线原本是人们理解一台计算机内部连接的方式,华为希望把它的能力延伸到更大的空间,让CPU、NPU、内存、存储等资源可以更直接地交互,减少部分通信必须经过CPU协调和不同协议转换的环节。

从芯片路线图到计算架构,华为在AI算力领域的布局正在从单点产品向系统能力延伸。芯片能否做出来,仍然重要;但芯片之间如何连接、如何协同,正在成为决定AI算力实际效率的另一个关键变量。灵衢和Peerium能否在更大规模部署中验证其设计目标,将影响华为在AI基础设施竞争中的位置。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
东风人形机器人10月进厂,年底启动小批量试制
上一篇 3小时前
英特尔关停漏洞赏金计划,转用无现金奖励披露机制
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部