AI集群网络瓶颈凸显,端到端负载均衡与无损网络技术加速落地

一块昂贵的GPU,大部分时间不是在“算”,而是在“等”,等数据从隔壁的GPU传过来。

当大模型训练集群从千卡迈向万卡甚至十万卡规模,算力竞赛的底层逻辑正在被改写。是德科技网络与数据中心副总裁Joachim Peerlings在Keysight World大会上公布的数据显示,在计算机视觉模型训练中,GPU有超过60%的时间花费在数据移动和通信上,真正用于计算的时间仅占20%左右。在资源最密集的大语言模型训练任务中,因网络问题导致的训练失败率高达21%。网络已成为制约AI集群发展的核心因素。

中科曙光高级副总裁李斌指出,传统CPU计算节点一台机器配一张网卡即可,而以GPU为中心的计算节点需要配置八张甚至更多网卡,相比原有数据中心高速网络用量提升了10到20倍。当前AI大模型训练集群单端口流量已逼近400G,但传统网络的负载均衡算法仍停留在“逐流ECMP”时代,流量像潮水般涌来时哈希算法来不及反应,导致部分端口满载、部分端口闲置的资源错配。新的端到端负载均衡方法可将网络带宽利用率提升最高38%,模型训练任务时长缩短超过3%。

面对瓶颈,行业正从单纯堆硬件转向通过协议和软件优化数据流。是德科技网络应用安全部门技术经理杨益锋表示,带宽翻倍的速度远远追不上模型规模翻倍的速度,且带宽翻倍带来的成本、功耗和散热压力呈指数级增长。一位互联网大厂基础设施负责人曾透露,设备采购花费数亿元,实际运行时三分之一的算力损耗在网络等待上,相当于每三台GPU就有一台在空转。AI网络的性能瓶颈往往不在设备标称规格,而在于流量调度机制的精细度。

在此背景下,LLR与CBFC两项技术开始受到AIDC运营方关注。LLR将重传机制下沉到链路层,让交换机自行发现丢包并重传,把恢复时间从毫秒压到微秒级;CBFC则相当于“网络红绿灯”系统,发送端在发数据前先确认接收端有足够缓存空间,避免数据丢弃。今年3月,是德科技与Broadcom在OFC 2026上完成了业界首个基于超以太网联盟规范、在800GE线速下实现LLR和CBFC的公开互操作性演示,标志着这两项技术从实验室协议走向真实互联互通。

网络验证环节同样不容忽视。杨益锋从Scale-Up、Scale-Out和Scale-Across三个维度指出,最容易被企业忽视的是Scale-Up环节——机柜内部短距离连接承载着最密集、最频繁的数据交换,GPU之间的参数同步和梯度聚合都依赖于此,而LLR和CBFC的关键应用场景恰在这个维度。Scale-Out涉及大量交换机互联,传统验证方式无法验证真实负载下的性能;Scale-Across则面对长距离传输的延迟和可靠性问题。从协议到大规模现网部署仍有长路要走,不同厂商设备、不同网络拓扑和不同工作负载都需要精细化参数调优,才能让新技术真正发挥威力。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
鸿蒙智行智界RX方向盘曝光L3冗余按键 8月20日开启预订
上一篇 1小时前
70天10款模型,美国越封,中国AI越疯?
下一篇 3天前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部