8月16日消息,华为官方宣布,昇腾Atlas 800 A3、Atlas 900 A3 SuperPoD超节点已完成小红书dots3-note preview开源大模型的全量适配,并基于vLLM Ascend开源推理引擎提供完整的部署与推理能力。该模型于8月14日由小红书正式发布,华为在其发布当天即完成0 Day推理部署适配与性能优化。
dots3-note preview是dots3系列的首个版本,以280B总参数量、16B激活参数量构建能力底座,同时具备文本、视觉、语音全模态感知理解能力。官方表示,该模型在推理、Agent及多模态感知等能力上进行了全面优化,在多项任务上取得了比肩国内外更大尺寸优秀模型的效果。华为方面称,昇腾在完整保留模型文本、视觉、语音一体化全模态理解能力的前提下,实现了稳定运行与生成效率提升,为长程复杂任务场景智能落地提供算力支撑。
此次适配的核心工作集中在三个层面。首先是全模态端到端适配,基于vLLM Ascend推理框架,完成dots3-note preview文本、图片、音频全模态能力的端到端适配,打通视觉编码器、音频特征提取与LLM主干推理的全链路,完整保留模型原生多模态理解与交互能力,支持图文、音文、视频等多模态输入场景的稳定推理。
其次是框架深度特性优化。在通信层面,针对AllReduce后RMSNorm、Dynamic Quant、MLA QKV降维等列向无关算子的冗余计算问题,通过数学等价变换将AllReduce拆解为ReduceScatter+AllGather,把列向独立算子前移至两阶段通信之间执行,消除多卡间的重复计算,有效降低推理时延。在计算层面,启用MoE层dispatch_ffn_combine融合算子,将原本“dispatch、gmm1、swiglu、gmm2、combine”等通信的多段独立Kernel合并为单一大算子,通过减少Kernel Launch次数、通信与计算深度流水、中间张量不落盘等手段,显著提升MoE推理吞吐。
第三是MTP投机推理的原生支持。针对增量推理阶段TPOT(单Token生成耗时)这一吞吐核心瓶颈,昇腾在vLLM Ascend中原生适配dots3-note preview的MTP投机解码能力,通过单次前向并行生成多Token候选并校验复用,大幅减少解码前向次数,有效降低TPOT、提升整体生成效率,以满足高并发在线业务的低时延诉求。
此次0 Day适配意味着模型发布与推理基础设施的对接周期被压缩至最短。对于采用该开源模型的企业用户而言,昇腾平台提供的部署指导与优化方案降低了从模型权重到生产级推理服务的迁移成本。小红书dots3-note preview模型权重已发布于Hugging Face平台,昇腾部署指导文档同步上线vLLM Ascend官方文档站点。
昇腾与小红书在AI基础设施层面的这一合作,反映出开源大模型与国产算力平台之间适配节奏正在加快。随着更多开源模型选择在发布当日即完成主流推理框架的适配,企业用户在模型选型与算力部署上的灵活性有望进一步提升。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。