据The Information报道,DeepSeek正在训练一个约2万亿参数的新模型;梁文锋在近期一场投资者会议上表示,公司下一步计划把模型规模继续推到8万亿参数。这一后续目标相当于DeepSeek今年4月发布的V4-Pro的约5倍——后者官方披露的规模为1.6万亿总参数、490亿激活参数

放在一年前,8万亿还是个难以想象的数字。但近两个月,前沿模型的总参数规模明显上抬。今年7月,月之暗面的Kimi K3做到2.8万亿总参数、1040亿激活参数,至今仍是已正式发布、参数规模最大的开放权重模型。8月,字节被曝正在预训练一个规模最高可能达10万亿参数的新模型。阿里CEO吴泳铭也公开宣布,下一代模型计划做到5万亿到10万亿参数。Anthropic从不公开参数,但FT此前援引业内估计称,其旗舰Mythos 5大约在8万亿参数左右;OpenAI自GPT-4起不再公开规模,社区则流传其Astra达到10万亿级MoE的说法。

对DeepSeek而言,转向大体量参数颇为反常。2024年底发布V3时,公司把训练账单摆上台面:6710亿总参数、每Token激活370亿参数,完整训练消耗278.8万H800 GPU小时,按每GPU小时2美元计,官方给出的训练成本仅557.6万美元。凭借这一效率标签,DeepSeek一度让行业重新讨论前沿模型是否必须无限烧GPU。它长期依赖梁文锋旗下幻方量化自我输血、不接受外部融资,条件决定了路线:钱和算力有限,就从架构、训练与推理效率里抠性能。

如今条件变了。DeepSeek今年6月完成成立以来首轮外部融资,募资约74亿美元;第二轮约500亿元人民币(约75亿美元)的融资已进入最后敲定阶段,对应估值约5000亿元人民币。若顺利完成,公司数月内累计外部融资将接近150亿美元。同时,DeepSeek已聘请中信证券筹备科创板IPO,新增资本明确用于算力基础设施、模型开发和人才投入;9月21日,原高瓴创投合伙人严文韬正式加入并出任CFO,结束了公司成立三年来CFO空缺的状态。手里钱多了,算力能往上堆,参数扩张也就有了底气。

值得注意的是,这一轮参数竞赛与上一轮Scaling并非同一回事。过去主流是Dense架构,参数规模与计算量基本绑定,参数越多、训练和推理成本同步上涨。现在越来越多超大模型采用MoE(混合专家)架构:模型可拥有成百上千个专家,但每次任务只调用其中一小部分。Kimi K3有2.8万亿总参数,每个Token只激活1040亿,约3.7%;DeepSeek V4-Pro有1.6万亿总参数,每Token只激活490亿,约3%。也就是说,模型能装多少与每次要算多少,已变成两个不同的数字,总参数容量可以继续扩张,而不必让每次计算同比变重。

推动容量重新回到竞争中心的另一股力量是Agent。过去衡量聊天机器人往往逐项测试能力,数学、代码、问答各看各的,峰值够高就能证明实力。但Agent把能力串进同一条任务链:搜索资料、读网页、看图片、写代码、调用终端、处理报错、修改方案,甚至把子任务分给其他Agent。OpenAI今年9月发布Agents API时,就把长时间运行、上下文管理、工具使用和子Agent协调列为Agent的核心基础设施,并强调Agent需要可靠运行数小时甚至数天。任务越长,对能力覆盖面与稳定性的要求越高,任何薄弱环节都可能中断整条链路。

于是,更大的参数容量有了新的价值:任务越长,模型越不能偏科;Agent能做的事越多,底座需要覆盖的能力就越广。MoE打开了容量继续扩张的空间,Agent则放大了容量的意义。头部实验室一边提高效率,一边重新把参数推向5万亿、8万亿、10万亿——省下来的算力并没有让Scaling消失,反而为Scaling腾出了新的空间。