Claude 写作退化真相:训练写给 AI 看,Opus 5.5 找回平衡

如果你最近觉得 Claude 写的东西越来越难读,那不是错觉。Anthropic 负责 Claude 微调的工程师杰克逊·克尼恩(Jackson Kernion)在 9 月 23 日公开回应了这件事。Opus 4.6 之后,模型的训练重心挪到了数学和代码上,还喂进大量写给其他 AI 看的技术解释与代码注释。模型因此长出一套内部沟通高效、人类读者却觉得堆砌晦涩的表达方式,社区管它叫 Claude 腔。

Claude 腔到底长什么样

对应的英文词是 Claudeish,最初是社区用户拿来吐槽的。典型表现是信息密度过高,一句话里塞进三层限定,读者得反复回看才能确定它在讲什么。它读起来不像人在说话,也不像人写给人的文字,更像给另一个模型准备的结构化输入。

克尼恩给的类比挺形象。他说这类似于只与同类人群长期交流的人,会逐渐形成一套内部极其顺畅、外人完全跟不上的表达习惯。LLM 的工作记忆远超人类,能捕捉的细节也更多,训练久了,模型自然会长出适配自己的写法。

这一点我自己的体感能对上。让它写技术方案或者代码注释,这两年输出质量是明显上升的。但让它写一段给同事看的说明文字,读起来总要多花力气,还得手动删掉一堆修饰。

训练数据往哪偏,输出就往哪偏

按克尼恩的说法,后续版本的优化重点明显向数学推理和编程倾斜。为了让模型在复杂工程任务上拿分,训练过程中大量引入了面向其他 AI 模型撰写技术解释和代码注释的语料。模型在这类语料上反复被强化,就学会了优先讨好模型读者。

麻烦在于,模型读者和人类读者的偏好并不一致。AI 处理得了长链条、高密度的表达,人类读者需要叙事节奏和留白。当优化目标只盯着前者,后者的体验会被牺牲,而且这种牺牲在常规评测分数上几乎看不出来。

根子在奖励函数上

克尼恩把原因归结到强化学习的奖励设计。有些奖励着力提升模型之间的理解效率,有些奖励着力让人类更容易读懂。数学和代码训练做得越多,前者的权重就越高,训练时就越需要主动去抵消写给 AI 看的倾向,对简洁、易读的解释给出更多奖励。

换句话说,模型能力没有退化,是优化目标换了方向之后,没人及时把天平拨回来。至少从他的表述看,团队先前对这个副作用并没有充分预期,等用户反馈积累到一定程度才定位到原因。

三个阶段的取舍差异

阶段 训练侧重 写作表现
Opus 4.6 综合能力,写作权重较高 社区公认写作表现最好的一代
Opus 4.6 之后的各版本 数学推理与编程为主 出现 Claude 腔,表达密度过高
Opus 5.5 重新加入易读性奖励 工程师称自 4.6 以来最满意,但未超越 4.6

上表按克尼恩的公开说法整理。Anthropic 没有公布任何量化的写作评分,社区此前的判断也大多基于主观体验,所以这张表只能当作方向性参考,别当成基准数据用。

Opus 5.5 找回了多少

克尼恩表示团队在 Opus 5.5 上找到了更好的平衡,原话是自 Opus 4.6 以来,他还没有对一款模型的写作表现这么满意过。但他同时承认,这不代表 Opus 5.5 已经超过 Opus 4.6,并把这称作一个很难解决的问题,团队仍在继续改进。

这个措辞值得留意。满意不等于回归,更不等于超越。如果你是因为写作体验留在 Opus 4.6 的重度用户,短期内我不建议急着迁移,先拿同一批任务在两边各跑一遍再决定。Opus 5.5 的完整参数和定价我们单独整理过,可以看这篇 Claude Opus 5.5 发布解析

有意思的是,写作这一侧的退步并没有妨碍 Claude 在其他任务上继续推进。同一个月里,它还在科研场景里跑出了自主发现酶系统的结果,参看 Claude 自主发现新型酶 ART。能力重心的迁移本来就是取舍,而不是单纯的好坏。

常见问题

Claude 腔能靠提示词解决吗

能缓解一部分。明确指定读者对象、约束段落长度、要求去掉多余的限定词,输出通常会清爽很多。但这是外部约束,模型本身的默认倾向没变,换个会话往往就打回原形。

只有 Claude 有这个问题吗

不是。任何把数学、代码指标当作主要优化目标的模型都要面对同样的取舍,区别只在于有没有人愿意公开讲清楚。就这点来说,Anthropic 的做法算坦诚。

写作能力和推理能力注定冲突吗

我看未必。克尼恩也说了 Opus 5.5 找到了更好的平衡,说明两者能共存,代价是训练时要额外投入易读性奖励。真正的问题是这部分投入值不值得,取决于厂商怎么判断用户结构。

Opus 4.6 还能用多久

这个我没有确切信息。按 Anthropic 过往的惯例,老版本会在新一代稳定之后逐步退场,具体时间点以官方公告为准。顺带说一句,模型版本的演进脉络在 Claude 3.7 Sonnet 混合推理 这篇里也梳理过一段。

小结

整件事其实不复杂。训练目标偏向数学和代码,模型就长出一套写给 AI 看的表达;奖励函数没有及时纠正,副作用积累到 Opus 4.6 之后集中爆发;Opus 5.5 补上了易读性奖励,但离 4.6 的水平还有距离。对普通用户来说,短期内最实用的做法是在提示词里明确读者对象,别指望模型自己切换语体。

相关阅读