Anthropic 負責 Claude 微調的工程師 Jackson Kernion 近日公開解釋了一個令不少使用者困惑的現象:為什麼 Claude 模型在數學、程式碼和推理上越來越強,寫作質量卻停滯甚至變差。他的核心觀點是,問題出在訓練目標的偏移上。
Kernion 指出,新版 Claude 模型被大量最佳化用於數學、程式碼和推理任務,同時被訓練去生成面向其他 AI 模型的技術解釋,而非面向人類讀者。他把這種訓練方式描述為讓模型「適應了 LLM 心理學」——模型學會了為 AI 模型寫作,而不是為人寫作。
他打了一個類比:這就像只與其他自閉症人群交流的人,會發展出一種在特定群體內有效、但外人難以理解的表達風格。由於大語言模型的工作記憶遠超人類,能捕捉到更細微的細節,訓練過程中便逐漸形成了一種對 AI 模型友好、但人類讀者讀起來像「過度密集的資訊堆砌」的寫作風格。
Kernion 將根源歸結為強化學習中的獎勵結構。部分獎勵最佳化的是 AI 模型的理解能力,另一部分則最佳化人類的理解能力。訓練中數學和程式碼的比重越大,就越需要主動通過獎勵「人類讀者能跟上的簡單解釋」來加以平衡。
他提到,Anthropic 在 Opus 5.5 上找到了更好的平衡,並表示自 Opus 4.6 以來,他很久沒有對一款模型的寫作感到如此滿意。但這並不意味著 Opus 5.5 超越了舊版。Kernion 強調,這是一個很難解決的問題,團隊會繼續改進。
這一解釋為外界理解大模型能力取捨提供了一個內部視角:當廠商競相在基準測試中比拼數學與程式碼能力時,自然語言寫作這類難以量化的能力容易被邊緣化。對依賴 Claude 進行寫作的使用者而言,模型「變聰明」與「變好讀」之間並不總是同步。