9月16日,英伟达在官方博客公布 Vera Rubin NVL72 首次 MLPerf Inference v6.1 预览提交成绩:在 Qwen3-VL 上,其吞吐最高达上一代 GB300 NVL72 的 3.7 倍,DeepSeek-R1 达到 2.5 倍。GB300 NVL72 则由单机架 72 卡扩展至 4 机架 288 卡,实现 99% 的扩展效率。(来源:NVIDIA Blog)
本期提交的另一组数据说明软件侧仍在持续释放性能:v6.1 的软件优化相较 v6.0 最高带来 1.6 倍提升,共有 19 家合作伙伴同步提交结果,其中 8 家为多节点 Blackwell NVL72 配置。同日,CoreWeave 宣布在 CoreWeave Cloud 上线多机架 Vera Rubin NVL72,以 Spectrum-X 把数百颗 Rubin GPU 组成单一扩展集群,每颗 GPU 配 2 颗 ConnectX-9 SuperNIC、提供 1.6Tb/s 横向扩展带宽,其 AI 对象存储 LOTA 将读取时延降低 8 倍;AMD 也提交了覆盖面最广的一轮 MLPerf Inference 6.1 成绩,合作方 Crusoe 以 512 卡创下 575 万 tokens/秒的 MLPerf 历史最高聚合吞吐。(来源:NVIDIA Blog/CoreWeave 投资者关系/AMD Blogs)
MLPerf 的意义向来不在绝对分数,而在它把“代际差”变成可比较的公开数字。3.7 倍的推理吞吐差距,直接指向超大规模客户在同等电力与机架预算下能交付的 token 量级;而当云厂商在同一天完成 Vera Rubin 集群上线,“新硬件首发即可租用”的节奏,正在把模型迭代所需的算力供给周期压缩到季度级别。这也解释了为什么本轮的竞争话题从“谁有更多 GPU”转向“谁能更早把新一代集群变成可计费的推理产出”。(来源:NVIDIA Blog/CoreWeave 投资者关系)
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。