Anthropic 负责 Claude 微调的工程师 Jackson Kernion 近日公开解释了一个令不少用户困惑的现象:为什么 Claude 模型在数学、代码和推理上越来越强,写作质量却停滞甚至变差。他的核心观点是,问题出在训练目标的偏移上。
Kernion 指出,新版 Claude 模型被大量优化用于数学、代码和推理任务,同时被训练去生成面向其他 AI 模型的技术解释,而非面向人类读者。他把这种训练方式描述为让模型「适应了 LLM 心理学」——模型学会了为 AI 模型写作,而不是为人写作。
他打了一个类比:这就像只与其他自闭症人群交流的人,会发展出一种在特定群体内有效、但外人难以理解的表达风格。由于大语言模型的工作记忆远超人类,能捕捉到更细微的细节,训练过程中便逐渐形成了一种对 AI 模型友好、但人类读者读起来像「过度密集的信息堆砌」的写作风格。
Kernion 将根源归结为强化学习中的奖励结构。部分奖励优化的是 AI 模型的理解能力,另一部分则优化人类的理解能力。训练中数学和代码的比重越大,就越需要主动通过奖励「人类读者能跟上的简单解释」来加以平衡。
他提到,Anthropic 在 Opus 5.5 上找到了更好的平衡,并表示自 Opus 4.6 以来,他很久没有对一款模型的写作感到如此满意。但这并不意味着 Opus 5.5 超越了旧版。Kernion 强调,这是一个很难解决的问题,团队会继续改进。
这一解释为外界理解大模型能力取舍提供了一个内部视角:当厂商竞相在基准测试中比拼数学与代码能力时,自然语言写作这类难以量化的能力容易被边缘化。对依赖 Claude 进行写作的用户而言,模型「变聪明」与「变好读」之间并不总是同步。