DeepSeek近日宣布,其核心算子开发产品TileLang已原生支持华为昇腾950 NPU,同时DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect五大核心计算与通信库同步推出昇腾版本。这意味着国产算力首次在核心算子工具层面具备与英伟达平台对标的能力。
算子开发长期是AI底层工作中门槛最高、耗时最久的环节。芯片理论算力上限虽高,但若底层算子优化不足,硬件利用率可能仅发挥20%左右。以矩阵乘法为例,开发者需手动管理三级缓存、调度线程块、处理数据预取流水线,甚至深入寄存器分块与指令重排层面,优化上千行底层代码往往需要资深工程师数周时间。此前行业主要依赖三条路径:手写CUDA性能上限高但深度绑定英伟达生态;厂商预制算子库如cuBLAS开箱即用但灵活性差;高层DSL编译器如Triton降低门槛但对昇腾、AMD等非英伟达硬件原生支持度低。
TileLang开辟了第四条路径。其核心是多级分块技术,将庞大计算任务切分为标准化数据块,开发者只需声明每块数据的计算位置,编译器自动完成数据搬运、线程同步等底层工作。该产品主攻通用矩阵乘法、反量化GEMM、FlashAttention、线性注意力、稀疏MLA等大模型核心算子,这些算子承载大模型训练和推理90%以上计算量。TileLang复用Apache TVM的编译能力,由北京大学团队在TVM基础设施上孵化,DeepSeek将其推向生产环境后反向捐赠给开源社区。截至2026年9月,该仓库已收获7.6k stars、1992次commit。
官方基准数据显示,基于TileLang优化的DeepSeek V3.2稀疏注意力TopK算子比原生PyTorch快2至20倍。在英伟达H100上运行核心算子时,TileLang速度超越Meta的PyTorch原生实现和OpenAI的Triton,并追平英伟达官方cuBLAS及官方版FlashAttention。在AMD MI300X上同样取得接近硬件极限的跑分数据。
TileLang采用前后端解耦架构,将目标后端与执行后端彻底分离。目标后端负责定义硬件指令语法与优化规则,执行后端负责通用编译、加载、启动流程。新芯片适配时执行后端无需改动,仅需新增对应目标后端。每个目标后端遵循语言方言、上下文贡献、Pass流水线、主机与设备代码生成四层流水线结构。针对昇腾后端,该架构负责将上层代码翻译为Ascend C的底层向量指令与矩阵运算原语。
此次开源工具链的完整迁移,为国产AI芯片在核心算子层面提供了可替代CUDA生态的工具选项,对降低国产算力平台的迁移成本与开发门槛具有实质性意义。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。