9月17日,华为在上海发布面向AI时代的全新计算架构Peerium。华为方面表示,该架构可实现百万级处理器作为一台计算机协同工作,以应对持续增长的AI算力需求。这是华为在超节点与集群层面提出的一套系统性计算架构方案。
根据华为公布的信息,Peerium计算架构基于嵌套并行、统一内存寻址和平等互联三项核心设计,目标是在百万级处理器规模下实现强扩展能力。华为称,该架构突破了传统图灵范式,提出Nested BSP模型,同时突破了冯·诺依曼单机架构的限制,改变了长期以来计算系统中主从架构的既有模式。
在互联层面,灵衢被定义为实现Peerium计算架构的关键技术。灵衢是一套基于开放协议的高速总线,可无限扩展地联接CPU、NPU、内存、SSD、网卡和交换机。华为表示,借助灵衢,计算、存储和网络之间可实现平等互联,而非传统架构中的层级式连接。这一设计旨在解决大规模异构算力集群中数据传输与资源调度效率的问题。
产品落地方面,Atlas 950超节点是Peerium计算架构的首代产品。华为透露,25.6万卡规模的Atlas 950超节点集群已经在部署中,基于NPO的Atlas 960系统正在测试阶段。这意味着Peerium架构已从架构定义进入实际工程部署与验证环节。
华为轮值董事长徐直军表示:“AI时代,华为基于开创的Peerium计算架构,持续打造满足客户训练和推理需求的超节点和集群,让算力无处不在,让智能无所不及。”这一表述延续了华为近年来在AI基础设施领域的一贯策略,即通过系统级架构创新而非单一芯片性能提升来应对大模型训练和推理的算力需求。
从行业背景看,随着大模型参数规模持续扩大,AI训练与推理对集群规模、互联带宽和内存访问效率提出了更高要求。传统以CPU为中心的主从架构在扩展到数万乃至数十万处理器时,普遍面临通信瓶颈、内存墙和调度效率下降等问题。华为此次提出的Peerium架构,核心思路是通过嵌套并行和平等互联,在保持开放协议的基础上实现更大规模的处理器协同,这为超大规模AI算力集群的构建提供了一种新的架构路径。
值得注意的是,华为将灵衢定位为开放协议,而非私有互联标准。在AI算力基础设施领域,互联技术的开放程度直接影响产业链上下游的参与意愿和生态构建速度。若灵衢能够获得更广泛的硬件与软件生态支持,其在大规模集群部署中的适用性将进一步提升。
目前,Atlas 950超节点集群已进入部署阶段,Atlas 960系统处于测试中。后续Peerium架构在实际AI训练和推理场景中的性能表现、扩展效率以及生态适配进展,将是观察该架构能否兑现百万级处理器“一台计算机”目标的关键指标。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。