Anthropic 正式发布 Claude Sonnet 5.5,这是其 Claude 5.5 家族的第二款模型。官方称该模型输出生成速度提升超过 30%,通过更高效的 token 使用方式,单任务成本最多可降低 30%,同时在多项知识工作基准上几乎追平旗舰级的 Opus 5.5。模型即日起在 亚马逊云科技(AWS)、谷歌云 和 微软 Azure 三大平台上线。

从定位看,Opus 5.5 面向需要审慎判断的复杂任务,而 Sonnet 5.5 瞄准的是定义清晰的日常工作,例如修复缺陷、撰写文档、制作演示文稿和电子表格。Anthropic 同时预告,主打高吞吐、低成本场景的 Claude Haiku 5.5 将在未来数周内推出。

编程能力是这一代提升最明显的部分。在面向智能体编程的 Terminal-Bench 4.0 测试中,Sonnet 5.5 得分 70.6%,而上一代 Sonnet 5 仅为 10.3%。在还原 Cursor 编辑器真实编程会话的 CursorBench 4.0 上,Sonnet 5.5 拿到 55.5%,高于 Sonnet 5 的 34.1%,仅比 Opus 5.5 的 57.8% 低两个百分点。Anthropic 还称,在 FrontierCode 1.1 的 High 设置下,Sonnet 5.5 比 Sonnet 5 高出十分,而单任务成本约为后者的十五分之一。早期测试者则提到,该模型理解代码库的速度更快,且比前代更频繁地批量调用工具,从而减少所需步骤。

推理强度设置上出现一个值得注意的现象:在最高档 Max 下,Sonnet 5.5 在 FrontierCode 上的得分反而低于 Xhigh 档。Anthropic 解释称,在最大努力档位下,模型更频繁触发代码审查功能,把工作拆分给多个子智能体,有时会导致超时或超出任务范围的改动,而这两者都会被 FrontierCode 扣分。

知识工作方面,在 OpenAI 开发、覆盖 44 个职业和 9 个行业的 GDPval-AA 基准上,Sonnet 5.5 得分 1,844,几乎与 Opus 5.5 的 1,846 持平,比 Sonnet 5 的 1,449 高出约 400 分。按 Anthropic 给出的数据,OpenAI 的 GPT-6 Sol 为 1,487。在图表识别测试 Chartography 上,Sonnet 5.5 从 15.6% 提升到 61.6%。

价格策略上,Sonnet 5.5 每百万 token 定价与 Sonnet 5 持平:输入 2 美元、输出 10 美元、缓存读取 0.20 美元。由于单任务消耗的 token 更少,实际成本最多下降 30%。Anthropic 表示,在低或中等努力档位下,Sonnet 5.5 已能在多项基准上超过 Sonnet 5 的最佳成绩,而单任务成本仅约十分之一。不过,为每个任务找到合适的努力档位,目前仍更像一门艺术而非科学。这些性能与成本声明仍有待独立测试验证。

竞争格局方面,Anthropic 已用 Fable、Opus、Sonnet 三条产品线对应 OpenAI 的 GPT-6 Astra、Sol、Luna。大致而言,Opus 略高于 Sol,Sonnet 高于 Luna,Fable 高于 Astra,但 Anthropic 整体定价更高。由于同档位模型之间的性能差距已经很小,成本可能成为决定性因素,Haiku 的推出有望帮助 Anthropic 缩小这一差距。

安全层面,Anthropic 为这款能力更强的模型增加了针对网络安全风险和蒸馏攻击的新防护措施。此外,公司称 Sonnet 5.5 是首个仅凭截图就能玩通《宝可梦 红》的 Sonnet 模型。这类任务在几年前还被视为难题、往往需要定制算法,如今连产品家族中的中端模型也能胜任。