據The Information報道,DeepSeek正在訓練一個約2萬億引數的新模型;梁文鋒在近期一場投資者會議上表示,公司下一步計劃把模型規模繼續推到8萬億引數。這一後續目標相當於DeepSeek今年4月釋出的V4-Pro的約5倍——後者官方披露的規模為1.6萬億總引數、490億啟用引數。
放在一年前,8萬億還是個難以想象的數字。但近兩個月,前沿模型的總引數規模明顯上抬。今年7月,月之暗面的Kimi K3做到2.8萬億總引數、1040億啟用引數,至今仍是已正式釋出、引數規模最大的開放權重模型。8月,位元組被曝正在預訓練一個規模最高可能達10萬億引數的新模型。阿里CEO吳泳銘也公開宣佈,下一代模型計劃做到5萬億到10萬億引數。Anthropic從不公開引數,但FT此前援引業內估計稱,其旗艦Mythos 5大約在8萬億引數左右;OpenAI自GPT-4起不再公開規模,社群則流傳其Astra達到10萬億級MoE的說法。
對DeepSeek而言,轉向大體量引數頗為反常。2024年底釋出V3時,公司把訓練賬單擺上台面:6710億總引數、每Token啟用370億引數,完整訓練消耗278.8萬H800 GPU小時,按每GPU小時2美元計,官方給出的訓練成本僅557.6萬美元。憑藉這一效率標籤,DeepSeek一度讓行業重新討論前沿模型是否必須無限燒GPU。它長期依賴梁文鋒旗下幻方量化自我輸血、不接受外部融資,條件決定了路線:錢和算力有限,就從架構、訓練與推理效率裡摳效能。
如今條件變了。DeepSeek今年6月完成成立以來首輪外部融資,募資約74億美元;第二輪約500億元人民幣(約75億美元)的融資已進入最後敲定階段,對應估值約5000億元人民幣。若順利完成,公司數月內累計外部融資將接近150億美元。同時,DeepSeek已聘請中信證券籌備科創板IPO,新增資本明確用於算力基礎設施、模型開發和人才投入;9月21日,原高瓴創投合夥人嚴文韜正式加入並出任CFO,結束了公司成立三年來CFO空缺的狀態。手裡錢多了,算力能往上堆,引數擴張也就有了底氣。
值得注意的是,這一輪引數競賽與上一輪Scaling並非同一回事。過去主流是Dense架構,引數規模與計算量基本繫結,引數越多、訓練和推理成本同步上漲。現在越來越多超大模型採用MoE(混合專家)架構:模型可擁有成百上千個專家,但每次任務只調用其中一小部分。Kimi K3有2.8萬億總引數,每個Token只啟用1040億,約3.7%;DeepSeek V4-Pro有1.6萬億總引數,每Token只啟用490億,約3%。也就是說,模型能裝多少與每次要算多少,已變成兩個不同的數字,總引數容量可以繼續擴張,而不必讓每次計算同比變重。
推動容量重新回到競爭中心的另一股力量是Agent。過去衡量聊天機器人往往逐項測試能力,數學、程式碼、問答各看各的,峰值夠高就能證明實力。但Agent把能力串進同一條任務鏈:搜尋資料、讀網頁、看圖片、寫程式碼、呼叫終端、處理報錯、修改方案,甚至把子任務分給其他Agent。OpenAI今年9月釋出Agents API時,就把長時間執行、上下文管理、工具使用和子Agent協調列為Agent的核心基礎設施,並強調Agent需要可靠執行數小時甚至數天。任務越長,對能力覆蓋面與穩定性的要求越高,任何薄弱環節都可能中斷整條鏈路。
於是,更大的引數容量有了新的價值:任務越長,模型越不能偏科;Agent能做的事越多,底座需要覆蓋的能力就越廣。MoE打開了容量繼續擴張的空間,Agent則放大了容量的意義。頭部實驗室一邊提高效率,一邊重新把引數推向5萬億、8萬億、10萬億——省下來的算力並沒有讓Scaling消失,反而為Scaling騰出了新的空間。