DeepSeek 把为英伟达 GPU 编写代码的全套工具链,原样搬到了华为昇腾 950 NPU 上。其中最核心的算子开发产品 TileLang 官宣原生支持昇腾,同时 DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect 五大核心计算与通信库也同步推出昇腾版本,直接对标英伟达平台的全套工具链。这是国产算力第一次在核心算子工具层面,做到与英伟达生态的能力对标。
要理解这件事的分量,得先看「写算子」在 AI 底层开发中的位置。一张芯片的理论算力上限很高,但如果底层算子写得不够好,芯片内部的计算单元会有大量时间在等数据流转,几万块钱的芯片可能只发挥出 20% 的性能。写算子的目的,就是把这个利用率推到 95% 以上。以最常见的矩阵乘法(GEMM)为例,要榨干一张 AI 芯片的算力,开发者需要手动管理三级缓存、调度线程块、搭建数据预取流水线,甚至深入到寄存器分块和指令重排层面,资深工程师打磨上千行底层代码花上好几周是常态。
由此产生一个行业核心矛盾:模型算法迭代太快,芯片厂商的官方算子库永远跟不上。过去行业有三条路,各有局限。自己手写 CUDA 性能天花板最高,但开发效率极低,且深度绑定英伟达生态、无法跨平台移植;使用厂商预制算子库(如英伟达 cuBLAS)开箱即用、性能拉满,但灵活性极差,无法修改内部逻辑或做算子融合;使用高层 DSL 编译器(如 OpenAI 的 Triton)大幅降低了门槛,但性能上限受限于编译器自身的优化策略,对昇腾、AMD 等非英伟达硬件原生支持度低,异构适配成本很高。
TileLang 走的是第四条路。它的核心是多级分块(Tiling),把庞大计算任务切分成标准化的数据块,开发者只需声明「每块数据在哪里计算」,编译器自动完成数据搬运、线程同步等底层工作,性能直逼手写 CUDA 的硬件上限。它主攻大模型核心算子:通用矩阵乘法、反量化 GEMM、FlashAttention、线性注意力、稀疏 MLA——这些算子承载大模型训练和推理 90% 以上的计算量,直接决定 AI 芯片的算力利用率。
技术上,TileLang 没有从零写一套完整编译器,而是复用了 Apache TVM 现成的编译能力。TVM 由华盛顿大学陈天奇团队开发,现为 Apache 顶级项目,在 AI 界的地位相当于 LLVM 在编程语言界的地位。TileLang 在 TVM 之上包装了一层简洁语法,专门处理大模型里最重要的分块计算。它最早由北京大学团队在 TVM 基础上孵化,DeepSeek 接手推到生产,再反向捐赠给开源社区。截至 2026 年 9 月,仓库收获 7.6k stars、1,992 次 commit。
官方基准数据显示,基于 TileLang 优化的 DeepSeek V3.2 稀疏注意力 TopK 算子,比原生 PyTorch 快 2–20 倍;其推理中最核心的 MLA、FlashAttention、LinearAttention 等算子也已提供可直接商用的优化实现。同样在英伟达 H100 上运行核心算子,TileLang 的速度大幅超越 Meta 的 PyTorch 原生实现,也击败了 OpenAI 的主力加速工具 Triton,甚至追平英伟达官方调校的 cuBLAS 与官方版 FlashAttention。值得注意的是,英伟达官方工具只支持自家芯片,而 TileLang 具备跨平台能力,在 AMD 顶级芯片 MI300X 上同样拿到接近硬件极限的跑分。
TileLang 能用同一套编译器灵活切换芯片,关键在于「前后端解耦、目标与执行分离」的架构。传统编译器把「为哪款芯片生成指令」和「怎么编译加载运行」两件事深度绑定,换一款芯片整套逻辑都要推倒重来。TileLang 把两者拆开:目标后端只定义该硬件的指令语法与优化规则,执行后端只负责通用的编译、加载、启动流程。新芯片适配时,执行后端完全不用改动,只需新增一个目标后端。每个目标后端遵循统一的四层流水线:语言方言层把代码翻译成各家芯片能听懂的指令,上下文层感知当前芯片并把不同硬件规格统一成标准格式,Pass 流水线层做最核心的翻译优化,主机/设备代码生成层把代码拆成 CPU 调度与加速器计算两份。
目前 TileLang 覆盖主流 AI 算力平台:英伟达 CUDA 是核心主力,功能与优化最完整;AMD ROCm、苹果 Metal、华为昇腾 950 为官方支持级;LLVM CPU、WebGPU、CuTe DSL 等处于实验阶段;沐曦、摩尔线程、海光等国产芯片通过生态项目适配。开发者用接近 Python 的语法,就能对存储控制、线程调度、并行节奏三个底层维度做显式控制,把传统 CUDA 通常需要 500 行以上的通用矩阵乘法代码压缩到 30 多行 Python 代码。
这背后是 DeepSeek 在算力路线上的重注。9 月 21 日,据《The Information》报道,在投资人闭门会上,梁文锋将「使用华为或其他国产芯片训练模型」描述为公司当前「最大的赌注之一」,并明确表示此役「必须成功」。据彭博社此前报道,DeepSeek 已投入 25.6 亿美元的订单,采购至少 16 万颗华为昇腾 950DT 加速器,用于部署在内蒙古乌兰察布在建的吉瓦级数据中心,这笔订单最快 2026 年 Q4 开始交付。这批昇腾 950DT 主要面向推理侧,训练环节目前仍主要依赖英伟达。
转向昇腾至少有三道难关。其一是训练软件栈全部重写:DeepSeek-V3、V4 的训练代码最早是为英伟达 Tensor Core / Hopper 架构的 WGMMA 指令写的,要在昇腾上跑,必须把每一处 cuBLAS / NCCL 调用替换成 Ascend C / HCCL,FlashMLA、DeepEP、DeepGEMM 等自研核心算子也要逐一在昇腾 950 上验证性能。其二是通信原语底层替换:英伟达生态的 NCCL 与昇腾体系的 HCCL 在 API 设计、性能曲线、容错模型上完全不同,任何一个集合通信操作的适配偏差都可能导致整轮训练静默失效。其三是芯片产能押注:推动 DeepSeek 转向国产芯片的动因是美国出口管制,而同一管制政策也制约着华为扩大 Ascend 950 产能的能力,DeepSeek 押注 16 万颗昇腾的隐含前提是华为的 Q4 交付不能掉链子。
模型规模还在放大。DeepSeek 正在训练一款 2 万亿参数的大模型,参数规模超过现有旗舰 V4 的 1.6 万亿;梁文锋同时透露公司已规划 8 万亿参数的更大模型。据其此前估算,训练一款与 OpenAI 同级别的大模型大约需要 5 万颗英伟达 GB300 处理器,对应需要 20 万颗华为昇腾 950 芯片。但现实是华为当前芯片供货仍有缺口,知情人士透露,受先进内存等核心元器件短缺影响,华为正面临生产瓶颈,DeepSeek 短期内仍无法完全摆脱对英伟达硬件的依赖。
未来 12 个月里,至少有四个变量会决定这场赌局的走向:华为 Ascend 950 的 Q4 交付率决定训练时间表;TileLang 昇腾后端能否在 6 个月内追平 CUDA 后端决定开发效率;字节、腾讯、阿里是否跟随押注昇腾决定生态规模;美国出口管制是否再次升级决定这条路的下限。这些问题目前都还没有定论。
对比 CUDA 与 TileLang,两者代表两种生态路线:CUDA 是闭源、全栈、硬件绑定的厂商主导生态,积累深厚但迁移成本极高;TileLang 是开源、聚焦、跨硬件的社区化工具,专注解决大模型最核心的算子开发问题,灵活度高、移植成本低。TileLang 的意义不在于替代 CUDA,而是补上当下最紧迫的短板,让国产芯片不必从零搭建完整软件生态,就能快速拥有大模型训练所需的顶级算子能力。当越来越多的大模型厂商基于 TileLang 开发算子,国产芯片的适配成本会指数级下降,整个生态的迭代速度也会加快。在大模型竞争进入算力成本与供应链安全的深水区时,「用软件定义算力」正在从口号变成底层工具层面的实际动作。