DeepSeek开源昇腾算力平台基础设施组件,TileLang工具链完成跨平台移植

这不是一次适配,这是一次搬家。

国庆假期前一天,DeepSeek宣布正式开源面向华为昇腾算力平台的基础设施组件,涵盖TileLang高级语言编译工具、高性能计算库与分布式通信库,所有组件与此前面向英伟达平台的开源组件一一对应。这意味着DeepSeek在英伟达平台上打磨成熟的整套工具链,已几乎完整地、成体系地迁移至昇腾平台,关键测试中的计算与通信性能接近硬件上限。

此次迁移的技术基础在于DeepSeek自训练V3模型起便采用自研TileLang高级语言编写算子,而非直接调用CUDA。TileLang通过编译器优化实现接近硬件性能上限的执行效率,在模型训练逻辑与芯片底层指令之间构建了一层抽象。当这层抽象被移植到昇腾平台时,对昇腾Ascend C底层指令进行封装,开发者代码逻辑几乎无需重写。目前DeepSeek V4系列模型训练中大部分算子已基于TileLang实现。

DeepSeek创始人梁文锋此前在闭门投资者会议上透露,公司目前运营约2万块英伟达H系列同等算力芯片,但无法采购足够硬件训练最大规模前沿模型。他估算训练顶级大模型可能需要约5万颗英伟达GB300芯片,若采用华为昇腾950则需约20万颗。成本方面,华为昇腾新款推理芯片采购价格仅为英伟达的四分之一,单卡算力却比英伟达对华特供版提升2.87倍。据彭博社报道,DeepSeek已向华为订购16万颗昇腾950DT芯片,用于其位于内蒙古的1GW数据中心。

华为方面将本次联合创新成果在CANN社区开源,覆盖大EP低延时推理部署、单卡/单机部署、大规模训练、超长文本KVcache池化与Agentic RL,开发者可直接获取实践方案。华为向DeepSeek提供的昇腾超节点SuperPoD Flex和UBL128组网方案,可实现128卡3.2Tbps单层交换的Scale-up网络和256K卡两层交换的Scale-out网络,兼顾超低时延推理与前沿基座模型的大规模训练需求。DeepSeek团队开发的DeepEP通信库实测互联带宽达到Dispatch 375 GB/s、Combine 347 GB/s。

DeepSeek的决策并非孤立事件。智谱AI今年1月联合华为开源了首个完全基于国产芯片和昇思MindSpore框架完成全流程训练的SOTA多模态模型GLM-Image;2月,智谱完全使用华为昇腾910C芯片训练的7440亿参数GLM-5模型在“人类最后的考试”基准测试中登顶。阿里通义千问、字节豆包、百川智能等头部玩家均在同步推进国产算力适配。彭博行业研究调查显示,中国企业计划在未来12个月内将46%的AI加速芯片预算用于采购国内芯片,远高于目前的30%。深圳已投运基于昇腾910C的1万卡AI算力集群,预约率达92%。

从行业影响看,DeepSeek此次动作的核心意义在于从编译工具到通信库层面构建了一套完整的国产芯片基础设施,而非仅实现模型在国产芯片上的可运行。当TileLang在昇腾上跑通,所有使用TileLang的开发者理论上均可在昇腾上构建模型,无需重新学习编程范式。软件工具链的可移植性,正在成为国产算力生态建设的关键变量。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
谷歌DeepMind发布Gemini 4首款旗舰模型Argon,输出Token上限提升至100万
上一篇 1小时前
谷歌Gemini被曝入侵其他公司系统,谷歌称其行为适当
下一篇 2026年9月20日 上午1:30

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部