DeepSeek 於 9 月 19 日在 arXiv 更新了一篇長達 31 頁的新論文《DSec:面向大規模智慧體訓練的高效沙箱基礎設施》,首次對外展示其自動化沙箱系統 DSec(DeepSeek Elastic Compute)。該系統定位為 DeepSeek 內部超大規模智慧體(Agent)強化學習與評測體系的生產級底座,可為每一次訓練任務在秒級建立獨立的虛擬環境。
論文披露的工程指標頗為可觀:DSec 每日可自動執行 300 萬個沙箱環境,單生產單元橫跨 160 個 CPU 節點。在許可權隔離方面,系統採用嚴苛的隔離機制,一方面防止 AI 在訓練中作弊,另一方面可對智慧體在沙箱內每一步環境反饋進行精準復現。
值得注意的是,這篇論文的通訊作者欄出現了 梁文鋒的名字。據雷鋒網梳理,過去三年梁文鋒極少以第一作者或通訊作者身份出現在 DeepSeek 旗艦模型的整體報告中,而是把署名集中在 MLA 注意力、MoE 路由機制、mHC 拓撲流形、DSpark 推理運算元、DSec 智慧體沙盒等底層原子技術論文上,累計 11 篇。
從時間線看,這 11 篇論文大致勾勒出 DeepSeek 的三段技術推進路徑。2024 年初,面對行業以萬卡叢集和數億美元投入為門檻的算力軍備競賽,DeepSeek 選擇效率路線:《DeepSeek LLM》提出在算力固定前提下提升資料質量與密度配比優於盲目擴大引數;《DeepSeekMoE》與《DeepSeek-V2》則通過細粒度專家動態路由與共享專家隔離、以及 MLA 多頭潛在注意力機制,重構傳統 Transformer 架構,據論文資料將訓練開銷降低 42.5%、KV Cache 體積壓縮 93.3%,並把千 token 推理成本大幅拉低,引發國內大模型 API 價格戰。
2024 年至 2025 年進入能力擊穿階段。《DeepSeek-Coder-V2》向閉源模型優勢最深的程式碼領域發起衝擊,將支援程式語言從 86 種擴充至 338 種、上下文視窗拉滿至 128K,並在多個主流程式碼基準上首次全面超越當時的閉源頂級模型,同時把每百萬 Token 輸入價格壓到 0.14 美元、輸出 0.28 美元。隨後《DeepSeek-V3》以 2048 塊 H800 顯示卡、不到兩個月時間訓出 671B 引數模型,總成本 560 萬美元,成為行業討論訓練成本時的標誌性數字。2025 年春節期間釋出的《DeepSeek-R1》則提出組相對策略最佳化(GRPO)演算法,證明無需大規模監督微調、僅靠純強化學習即可讓模型自主湧現鏈式思考能力,其強化學習階段耗資 29.4 萬美元,該成果後來登上《Nature》雜誌封面。
同期,DeepSeek 把最佳化觸角伸向硬體層。《Native Sparse Attention(NSA)》用 Triton 語言重寫底層硬體計算運算元,設計分層動態稀疏策略以對齊 NVIDIA GPU Tensor Core 的微觀結構,據論文資料使模型前向傳播速度提升 9 倍、長序列解碼速度提升 11.6 倍,該論文獲 ACL 2025 最佳論文獎。發表於 ISCA 的《Insights into DeepSeek-V3》則從計算機體系結構視角拆解大規模 MoE 訓練的記憶體牆與通訊牆瓶頸,並給出下一代 AI 加速晶片的設計建議。
回到此次的 DSec,其背景是智慧體能力快速提升後帶來的訓練與安全雙重需求。當智慧體在複雜任務中頻繁出現失控傾向,沙箱的角色已從附屬的安全配件,轉變為既是 AI 進化的訓練場、也是約束其破壞力的關鍵防線。DSec 所強調的秒級環境建立、大規模並行與精準復現能力,正是為這一場景提供工程支撐。
從行業視角看,DeepSeek 此次披露的並非模型能力本身,而是支撐智慧體強化學習的基礎設施。這類工作通常不直接面向終端使用者,卻決定了智慧體訓練能否規模化、可復現、可審計。對關注 AI 安全與訓練效率的讀者而言,DSec 提供了一個觀察頭部團隊如何把安全約束嵌入訓練流程的樣本。