馬斯克 9 月 11 日在 X 上回復網友時透露,下一代旗艦模型 Grok 4.7 還需要「再煮幾天」才能端上桌。他把延遲的原因歸結為強化學習(RL)環節的取捨問題:訓練中可能對回答長度懲罰過重,導致模型在它其實有能力解決的難題上過早放棄,同時在檢查自己答案方面還不夠嚴謹。

這一表態的具體之處在於,它給出的時間尺度是「天」而不是「季度」。也就是說,Grok 4.7 已經近到可以公開討論釋出節奏,但團隊仍在調整兩件事:模型願意在一個問題上停留多久,以及它複核自身輸出的認真程度。馬斯克把剩下的差距框定為強化學習訓練中的權衡,而不是功能清單缺項或硬體瓶頸——這與此前外界對算力或晶片供應的關注點有所不同。

要理解這條訊息的分量,需要放到 Grok 的產品節奏裡看。馬斯克點名的 4.7 是一個尚未替換現有版本的基礎模型,而圍繞它的應用層更新這段時間並未停步。同一周內,Grok 生態還出現了面向銷售團隊的聯結器(對接 Salesforce、HubSpot、Gong 等工具)、計劃在舊金山舉辦的 Grok Bot Galaxy 線下活動,以及此前的行內起草與用量升級。這種「基礎模型慢一點、上層功能照常發」的組合,說明 SpaceXAI(原 xAI)在等待新模型就緒的同時,仍在用代理與工作流類功能維持產品推進。

從技術角度看,馬斯克提到的現象在強化學習訓練中並不罕見。當獎勵機制對輸出長度施加懲罰時,模型可能學會用更短的回答「速戰速決」,代價是在需要多步推理的題目上提前收手;而「檢查自己的工作」屬於另一類能力,通常需要額外的訓練訊號或推理流程來強化。馬斯克沒有給出具體的技術細節或修復方案,只表示需要更多時間。

對關注者而言,這條訊息的價值在於它提供了一個可驗證的時間錨點:Grok 4.7 的釋出視窗被描述為「數日內」,而非模糊的「即將」。同時它也暴露出訓練側的具體短板——不是缺功能,而是模型行為層面的調校。接下來值得觀察的是,SpaceXAI 是否會在釋出時說明這些 RL 取捨如何解決,以及新模型在難題上的表現是否與馬斯克描述的問題相對應。

需要說明的是,馬斯克並未披露 Grok 4.7 的具體引數、基準成績或確切釋出日期,上述內容均以其公開表態和同期產品動態為依據。