浪潮信息发布元脑SD200 Ultra超节点,单机承载2.8万亿参数Kimi K3,Token时延降至5.85毫秒

浪潮表示,SD200 Ultra的Token生成时延首次降至5.85毫秒以内,相当于单用户速度170 Tokens/s,达到业界平均水平的5倍。

在2026人工智能计算大会(AICC2026)上,浪潮信息宣布推出元脑SD200 Ultra超节点AI服务器与元脑HC2000多元算力机组。其中,SD200 Ultra基于国产AI芯片打造,单机可承载运行2.8万亿参数的Kimi K3大模型,Token生成时延首次降至5.85毫秒以内,对应单用户生成速度170 Tokens/s,官方称达到业界平均水平的5倍。该机型同时支持10万亿参数规模前沿模型的单机运行。

Token生成时延指大模型每输出一个词元所需的平均时间,是衡量推理响应速度的核心指标之一。在大模型参数规模持续膨胀的背景下,这一指标的优化直接关系到高并发场景下的服务可用性与用户体验。浪潮信息将SD200 Ultra的定位指向前沿模型的单机推理部署,试图在超大规模参数与低时延响应之间建立新的平衡点。

从架构层面看,SD200 Ultra采用3D Hyper Mesh架构,紧耦合128颗本土AI芯片,提供8TB统一编址显存和64TB内存。系统采用原生内存语义通信,通信时延低至0.69微秒。通过全局统一编址、虚拟影子设备映射、跨域地址翻译与路由,该超节点实现了GPU跨主机域的统一寻址访问,构建百纳秒级低时延内存语义互连域。

浪潮信息称,借助对称内存技术,SD200 Ultra首次在基于本土AI芯片的超节点上实现GPU显存直连,使GPU可直接访问远端GPU显存,AllReduce通信时间降低3.5倍。这一设计针对的是大规模并行推理中显存墙与通信墙的双重瓶颈,通过内存语义互连减少数据搬运开销。

针对Kimi K3的推理优化,SD200 Ultra使用Kimi K3构建超级算子智能体,实现通算融合、Tile级流水的超级算子,将KDA、Gated MLA、MoE中的基础算子进行融合。官方数据显示,算子数量降低10倍,推理性能提升3倍以上。算子融合是当前大模型推理优化的重要方向,其核心逻辑在于减少Kernel启动开销与中间结果落盘,从而压缩端到端时延。

同日发布的元脑HC2000多元算力机组采用DirectCom 2.0极速架构,基于高密液冷AI整机柜,搭配MCIS推理软件栈,可动态匹配计算负载。浪潮信息称,在同等投资下,该机组的Token产能提升10倍。这一产品面向的是容量型智算场景,与SD200 Ultra形成能力型与容量型的双线布局。

浪潮信息将Agent时代的AI计算划分为两个方向:Capability AI Compute能力型智算,支撑突破智能上限;Capacity AI Compute容量型智算,实现智能充分供给。这一分类的背后是模型规模与Agent形态的同步演进。浪潮信息指出,前沿模型参数规模已从DeepSeek R1的6710亿增长到Kimi K3的2.8万亿,并走向10万亿级;上下文从128K扩展到1M以上;Agent从单体走向成百上千个协同。模型权重、KV Cache和并发任务规模同步增长,对显存容量、高速互连和并行扩展效率提出更高要求。

Agent任务的时延敏感性正在成为基础设施设计的新约束。复杂Agent任务包含大量“推理—工具调用—反馈—重新规划”循环,每轮时延都会累积。浪潮信息称,时延已不只是体验指标,可能影响任务能否及时完成。此外,复杂Agent任务需连续运行数小时甚至数天,期间经历大量模型调用、工具调用和数据交互,任何计算、通信或软件故障都可能中断任务,这对系统的可靠性设计提出了更高要求。

从行业视角看,超节点已成为国产AI算力突破单机性能边界的主要路径。通过紧耦合更多本土AI芯片、构建统一内存编址域、优化通信协议栈,厂商试图在单机架内实现此前需要多机集群才能承载的模型规模。浪潮信息此次发布的SD200 Ultra与HC2000,分别对应前沿模型推理与规模化Token供给两类需求,其实际部署效果与生态适配进度,将影响国产算力在Agent时代的竞争力。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
华为发布新一代公共频谱点对多点微波方案RTN 5100,传输容量与站点接入数量均提升一倍
上一篇 1小时前
蚂蚁集团外滩大会披露AI商业基础设施进展,国内大模型日均Token调用量突破140万亿
下一篇 2026年9月12日 下午12:41

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部