9月1日,分析师郭明錤披露最新产业调查显示,英伟达已重启人工智能推理预填充加速GPU“Rubin CPX”项目,但设计较此前版本有大幅调整,预计2027年第一季度开始生产。该芯片定位为面向AI推理场景中预填充(Pre-fill)环节的专用加速器。
在芯片规格层面,新版Rubin CPX在算力上接近标准Rubin GPU,预填充性能进一步提升,单体最高功耗同为2300W,配备168GB HBM4内存。相比旧版Rubin CPX的128GB GDDR7配置,新方案在内存容量和带宽上均有显著升级,168GB容量或指向7×24GB的HBM4堆叠设计。
在系统集成层面,8颗Rubin CPX组成一个计算托盘,8个计算托盘构成一个机架模组,内部采用Spectrum-6全铜以太网进行横向扩展(Scale-out)。新Rubin CPX采用独立的MGX ETL机架,每个机架包含1至4组机架模组,机架模组间的横向扩展则采用Spectrum-6加OSFP光学方案。系统层面,英伟达建议Rubin CPX与标准Rubin按1:1比例配对部署,Rubin CPX ETL机架与Vera Rubin NVL72机架之间采用基于以太网的RDMA连接。
郭明錤指出,目前AI推理工作量中超过50%来自处理输入并建立相应的KV Cache。新Rubin CPX能以更具弹性的部署方式与更低成本承接预填充负载。单个新Rubin CPX计算托盘具备1.34TB HBM内存,足以满足大多数长上下文预填充与KV Cache建立需求。
这一产品策略显示英伟达正将推理负载拆分为预填充和解码两个阶段,通过专用芯片优化不同环节的算力与内存配比,以降低整体推理成本。Rubin CPX的回归也意味着英伟达在下一代架构中更重视推理工作负载的细分优化,而非仅追求单一GPU的峰值算力。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。