DeepSeek 把為輝達 GPU 編寫程式碼的全套工具鏈,原樣搬到了華為昇騰 950 NPU 上。其中最核心的運算元開發產品 TileLang 官宣原生支援昇騰,同時 DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect 五大核心計算與通訊庫也同步推出昇騰版本,直接對標輝達平台的全套工具鏈。這是國產算力第一次在核心運算元工具層面,做到與輝達生態的能力對標。

要理解這件事的分量,得先看「寫運算元」在 AI 底層開發中的位置。一張晶片的理論算力上限很高,但如果底層運算元寫得不夠好,晶片內部的計算單元會有大量時間在等資料流轉,幾萬塊錢的晶片可能只發揮出 20% 的效能。寫運算元的目的,就是把這個利用率推到 95% 以上。以最常見的矩陣乘法(GEMM)為例,要榨乾一張 AI 晶片的算力,開發者需要手動管理三級快取、排程執行緒塊、搭建資料預取流水線,甚至深入到暫存器分塊和指令重排層面,資深工程師打磨上千行底層程式碼花上好幾周是常態。

由此產生一個行業核心矛盾:模型演算法迭代太快,晶片廠商的官方運算元庫永遠跟不上。過去行業有三條路,各有侷限。自己手寫 CUDA 效能天花板最高,但開發效率極低,且深度繫結輝達生態、無法跨平台移植;使用廠商預製運算元庫(如輝達 cuBLAS)開箱即用、效能拉滿,但靈活性極差,無法修改內部邏輯或做運算元融合;使用高層 DSL 編譯器(如 OpenAI 的 Triton)大幅降低了門檻,但效能上限受限於編譯器自身的最佳化策略,對昇騰、AMD 等非輝達硬體原生支援度低,異構適配成本很高。

TileLang 走的是第四條路。它的核心是多級分塊(Tiling),把龐大計算任務切分成標準化的資料塊,開發者只需宣告「每塊資料在哪裡計算」,編譯器自動完成資料搬運、執行緒同步等底層工作,效能直逼手寫 CUDA 的硬體上限。它主攻大模型核心運算元:通用矩陣乘法、反量化 GEMM、FlashAttention、線性注意力、稀疏 MLA——這些運算元承載大模型訓練和推理 90% 以上的計算量,直接決定 AI 晶片的算力利用率。

技術上,TileLang 沒有從零寫一套完整編譯器,而是複用了 Apache TVM 現成的編譯能力。TVM 由華盛頓大學陳天奇團隊開發,現為 Apache 頂級專案,在 AI 界的地位相當於 LLVM 在程式語言界的地位。TileLang 在 TVM 之上包裝了一層簡潔語法,專門處理大模型裡最重要的分塊計算。它最早由北京大學團隊在 TVM 基礎上孵化,DeepSeek 接手推到生產,再反向捐贈給開源社群。截至 2026 年 9 月,倉庫收穫 7.6k stars、1,992 次 commit。

官方基準資料顯示,基於 TileLang 最佳化的 DeepSeek V3.2 稀疏注意力 TopK 運算元,比原生 PyTorch 快 2–20 倍;其推理中最核心的 MLA、FlashAttention、LinearAttention 等運算元也已提供可直接商用的最佳化實現。同樣在輝達 H100 上執行核心運算元,TileLang 的速度大幅超越 Meta 的 PyTorch 原生實現,也擊敗了 OpenAI 的主力加速工具 Triton,甚至追平輝達官方調校的 cuBLAS 與官方版 FlashAttention。值得注意的是,輝達官方工具只支援自家晶片,而 TileLang 具備跨平台能力,在 AMD 頂級晶片 MI300X 上同樣拿到接近硬體極限的跑分。

TileLang 能用同一套編譯器靈活切換晶片,關鍵在於「前後端解耦、目標與執行分離」的架構。傳統編譯器把「為哪款晶片生成指令」和「怎麼編譯載入執行」兩件事深度繫結,換一款晶片整套邏輯都要推倒重來。TileLang 把兩者拆開:目標後端只定義該硬體的指令語法與最佳化規則,執行後端只負責通用的編譯、載入、啟動流程。新晶片適配時,執行後端完全不用改動,只需新增一個目標後端。每個目標後端遵循統一的四層流水線:語言方言層把程式碼翻譯成各家晶片能聽懂的指令,上下文層感知當前晶片並把不同硬體規格統一成標準格式,Pass 流水線層做最核心的翻譯最佳化,主機/裝置程式碼生成層把程式碼拆成 CPU 排程與加速器計算兩份。

目前 TileLang 覆蓋主流 AI 算力平台:輝達 CUDA 是核心主力,功能與最佳化最完整;AMD ROCm、蘋果 Metal、華為昇騰 950 為官方支援級;LLVM CPU、WebGPU、CuTe DSL 等處於實驗階段;沐曦、摩爾線程、海光等國產晶片通過生態專案適配。開發者用接近 Python 的語法,就能對儲存控制、執行緒排程、並行節奏三個底層維度做顯式控制,把傳統 CUDA 通常需要 500 行以上的通用矩陣乘法程式碼壓縮到 30 多行 Python 程式碼。

這背後是 DeepSeek 在算力路線上的重注。9 月 21 日,據《The Information》報道,在投資人閉門會上,梁文鋒將「使用華為或其他國產晶片訓練模型」描述為公司當前「最大的賭注之一」,並明確表示此役「必須成功」。據彭博社此前報道,DeepSeek 已投入 25.6 億美元的訂單,採購至少 16 萬顆華為昇騰 950DT 加速器,用於部署在內蒙古烏蘭察布在建的吉瓦級資料中心,這筆訂單最快 2026 年 Q4 開始交付。這批昇騰 950DT 主要面向推理側,訓練環節目前仍主要依賴輝達。

轉向昇騰至少有三道難關。其一是訓練軟體棧全部重寫:DeepSeek-V3、V4 的訓練程式碼最早是為輝達 Tensor Core / Hopper 架構的 WGMMA 指令寫的,要在昇騰上跑,必須把每一處 cuBLAS / NCCL 呼叫替換成 Ascend C / HCCL,FlashMLA、DeepEP、DeepGEMM 等自研核心運算元也要逐一在昇騰 950 上驗證效能。其二是通訊原語底層替換:輝達生態的 NCCL 與昇騰體系的 HCCL 在 API 設計、效能曲線、容錯模型上完全不同,任何一個集合通訊操作的適配偏差都可能導致整輪訓練靜默失效。其三是晶片產能押注:推動 DeepSeek 轉向國產晶片的動因是美國出口管制,而同一管制政策也制約著華為擴大 Ascend 950 產能的能力,DeepSeek 押注 16 萬顆昇騰的隱含前提是華為的 Q4 交付不能掉鏈子。

模型規模還在放大。DeepSeek 正在訓練一款 2 萬億引數的大模型,引數規模超過現有旗艦 V4 的 1.6 萬億;梁文鋒同時透露公司已規劃 8 萬億引數的更大模型。據其此前估算,訓練一款與 OpenAI 同級別的大模型大約需要 5 萬顆輝達 GB300 處理器,對應需要 20 萬顆華為昇騰 950 晶片。但現實是華為當前晶片供貨仍有缺口,知情人士透露,受先進記憶體等核心元器件短缺影響,華為正面臨生產瓶頸,DeepSeek 短期內仍無法完全擺脫對輝達硬體的依賴。

未來 12 個月裡,至少有四個變數會決定這場賭局的走向:華為 Ascend 950 的 Q4 交付率決定訓練時間表;TileLang 昇騰後端能否在 6 個月內追平 CUDA 後端決定開發效率;位元組、騰訊、阿里是否跟隨押注昇騰決定生態規模;美國出口管制是否再次升級決定這條路的下限。這些問題目前都還沒有定論。

對比 CUDA 與 TileLang,兩者代表兩種生態路線:CUDA 是閉源、全棧、硬體繫結的廠商主導生態,積累深厚但遷移成本極高;TileLang 是開源、聚焦、跨硬體的社群化工具,專注解決大模型最核心的運算元開發問題,靈活度高、移植成本低。TileLang 的意義不在於替代 CUDA,而是補上當下最緊迫的短板,讓國產晶片不必從零搭建完整軟體生態,就能快速擁有大模型訓練所需的頂級運算元能力。當越來越多的大模型廠商基於 TileLang 開發運算元,國產晶片的適配成本會指數級下降,整個生態的迭代速度也會加快。在大模型競爭進入算力成本與供應鏈安全的深水區時,「用軟體定義算力」正在從口號變成底層工具層面的實際動作。