马斯克 9 月 11 日在 X 上回复网友时透露,下一代旗舰模型 Grok 4.7 还需要「再煮几天」才能端上桌。他把延迟的原因归结为强化学习(RL)环节的取舍问题:训练中可能对回答长度惩罚过重,导致模型在它其实有能力解决的难题上过早放弃,同时在检查自己答案方面还不够严谨。

这一表态的具体之处在于,它给出的时间尺度是「天」而不是「季度」。也就是说,Grok 4.7 已经近到可以公开讨论发布节奏,但团队仍在调整两件事:模型愿意在一个问题上停留多久,以及它复核自身输出的认真程度。马斯克把剩下的差距框定为强化学习训练中的权衡,而不是功能清单缺项或硬件瓶颈——这与此前外界对算力或芯片供应的关注点有所不同。

要理解这条消息的分量,需要放到 Grok 的产品节奏里看。马斯克点名的 4.7 是一个尚未替换现有版本的基础模型,而围绕它的应用层更新这段时间并未停步。同一周内,Grok 生态还出现了面向销售团队的连接器(对接 Salesforce、HubSpot、Gong 等工具)、计划在旧金山举办的 Grok Bot Galaxy 线下活动,以及此前的行内起草与用量升级。这种「基础模型慢一点、上层功能照常发」的组合,说明 SpaceXAI(原 xAI)在等待新模型就绪的同时,仍在用代理与工作流类功能维持产品推进。

从技术角度看,马斯克提到的现象在强化学习训练中并不罕见。当奖励机制对输出长度施加惩罚时,模型可能学会用更短的回答「速战速决」,代价是在需要多步推理的题目上提前收手;而「检查自己的工作」属于另一类能力,通常需要额外的训练信号或推理流程来强化。马斯克没有给出具体的技术细节或修复方案,只表示需要更多时间。

对关注者而言,这条消息的价值在于它提供了一个可验证的时间锚点:Grok 4.7 的发布窗口被描述为「数日内」,而非模糊的「即将」。同时它也暴露出训练侧的具体短板——不是缺功能,而是模型行为层面的调校。接下来值得观察的是,SpaceXAI 是否会在发布时说明这些 RL 取舍如何解决,以及新模型在难题上的表现是否与马斯克描述的问题相对应。

需要说明的是,马斯克并未披露 Grok 4.7 的具体参数、基准成绩或确切发布日期,上述内容均以其公开表态和同期产品动态为依据。