DeepSeek 于 9 月 19 日在 arXiv 更新了一篇长达 31 页的新论文《DSec:面向大规模智能体训练的高效沙箱基础设施》,首次对外展示其自动化沙箱系统 DSec(DeepSeek Elastic Compute)。该系统定位为 DeepSeek 内部超大规模智能体(Agent)强化学习与评测体系的生产级底座,可为每一次训练任务在秒级创建独立的虚拟环境。

论文披露的工程指标颇为可观:DSec 每日可自动运行 300 万个沙箱环境,单生产单元横跨 160 个 CPU 节点。在权限隔离方面,系统采用严苛的隔离机制,一方面防止 AI 在训练中作弊,另一方面可对智能体在沙箱内每一步环境反馈进行精准复现。

值得注意的是,这篇论文的通讯作者栏出现了 梁文锋的名字。据雷锋网梳理,过去三年梁文锋极少以第一作者或通讯作者身份出现在 DeepSeek 旗舰模型的整体报告中,而是把署名集中在 MLA 注意力、MoE 路由机制、mHC 拓扑流形、DSpark 推理算子、DSec 智能体沙盒等底层原子技术论文上,累计 11 篇。

从时间线看,这 11 篇论文大致勾勒出 DeepSeek 的三段技术推进路径。2024 年初,面对行业以万卡集群和数亿美元投入为门槛的算力军备竞赛,DeepSeek 选择效率路线:《DeepSeek LLM》提出在算力固定前提下提升数据质量与密度配比优于盲目扩大参数;《DeepSeekMoE》与《DeepSeek-V2》则通过细粒度专家动态路由与共享专家隔离、以及 MLA 多头潜在注意力机制,重构传统 Transformer 架构,据论文数据将训练开销降低 42.5%、KV Cache 体积压缩 93.3%,并把千 token 推理成本大幅拉低,引发国内大模型 API 价格战。

2024 年至 2025 年进入能力击穿阶段。《DeepSeek-Coder-V2》向闭源模型优势最深的代码领域发起冲击,将支持编程语言从 86 种扩充至 338 种、上下文窗口拉满至 128K,并在多个主流代码基准上首次全面超越当时的闭源顶级模型,同时把每百万 Token 输入价格压到 0.14 美元、输出 0.28 美元。随后《DeepSeek-V3》以 2048 块 H800 显卡、不到两个月时间训出 671B 参数模型,总成本 560 万美元,成为行业讨论训练成本时的标志性数字。2025 年春节期间发布的《DeepSeek-R1》则提出组相对策略优化(GRPO)算法,证明无需大规模监督微调、仅靠纯强化学习即可让模型自主涌现链式思考能力,其强化学习阶段耗资 29.4 万美元,该成果后来登上《Nature》杂志封面。

同期,DeepSeek 把优化触角伸向硬件层。《Native Sparse Attention(NSA)》用 Triton 语言重写底层硬件计算算子,设计分层动态稀疏策略以对齐 NVIDIA GPU Tensor Core 的微观结构,据论文数据使模型前向传播速度提升 9 倍、长序列解码速度提升 11.6 倍,该论文获 ACL 2025 最佳论文奖。发表于 ISCA 的《Insights into DeepSeek-V3》则从计算机体系结构视角拆解大规模 MoE 训练的内存墙与通信墙瓶颈,并给出下一代 AI 加速芯片的设计建议。

回到此次的 DSec,其背景是智能体能力快速提升后带来的训练与安全双重需求。当智能体在复杂任务中频繁出现失控倾向,沙箱的角色已从附属的安全配件,转变为既是 AI 进化的训练场、也是约束其破坏力的关键防线。DSec 所强调的秒级环境创建、大规模并行与精准复现能力,正是为这一场景提供工程支撑。

从行业视角看,DeepSeek 此次披露的并非模型能力本身,而是支撑智能体强化学习的基础设施。这类工作通常不直接面向终端用户,却决定了智能体训练能否规模化、可复现、可审计。对关注 AI 安全与训练效率的读者而言,DSec 提供了一个观察头部团队如何把安全约束嵌入训练流程的样本。