Anthropic 正式釋出 Claude Sonnet 5.5,這是其 Claude 5.5 家族的第二款模型。官方稱該模型輸出生成速度提升超過 30%,通過更高效的 token 使用方式,單任務成本最多可降低 30%,同時在多項知識工作基準上幾乎追平旗艦級的 Opus 5.5。模型即日起在 亞馬遜雲科技(AWS)、谷歌雲 和 微軟 Azure 三大平台上線。

從定位看,Opus 5.5 面向需要審慎判斷的複雜任務,而 Sonnet 5.5 瞄準的是定義清晰的日常工作,例如修復缺陷、撰寫文件、製作簡報和電子表格。Anthropic 同時預告,主打高吞吐、低成本場景的 Claude Haiku 5.5 將在未來數週內推出。

程式設計能力是這一代提升最明顯的部分。在面向智慧體程式設計的 Terminal-Bench 4.0 測試中,Sonnet 5.5 得分 70.6%,而上一代 Sonnet 5 僅為 10.3%。在還原 Cursor 編輯器真實程式設計會話的 CursorBench 4.0 上,Sonnet 5.5 拿到 55.5%,高於 Sonnet 5 的 34.1%,僅比 Opus 5.5 的 57.8% 低兩個百分點。Anthropic 還稱,在 FrontierCode 1.1 的 High 設定下,Sonnet 5.5 比 Sonnet 5 高出十分,而單任務成本約為後者的十五分之一。早期測試者則提到,該模型理解程式碼庫的速度更快,且比前代更頻繁地批次呼叫工具,從而減少所需步驟。

推理強度設定上出現一個值得注意的現象:在最高檔 Max 下,Sonnet 5.5 在 FrontierCode 上的得分反而低於 Xhigh 檔。Anthropic 解釋稱,在最大努力檔位下,模型更頻繁觸發程式碼審查功能,把工作拆分給多個子智慧體,有時會導致超時或超出任務範圍的改動,而這兩者都會被 FrontierCode 扣分。

知識工作方面,在 OpenAI 開發、覆蓋 44 個職業和 9 個行業的 GDPval-AA 基準上,Sonnet 5.5 得分 1,844,幾乎與 Opus 5.5 的 1,846 持平,比 Sonnet 5 的 1,449 高出約 400 分。按 Anthropic 給出的資料,OpenAI 的 GPT-6 Sol 為 1,487。在圖表識別測試 Chartography 上,Sonnet 5.5 從 15.6% 提升到 61.6%。

價格策略上,Sonnet 5.5 每百萬 token 定價與 Sonnet 5 持平:輸入 2 美元、輸出 10 美元、快取讀取 0.20 美元。由於單任務消耗的 token 更少,實際成本最多下降 30%。Anthropic 表示,在低或中等努力檔位下,Sonnet 5.5 已能在多項基準上超過 Sonnet 5 的最佳成績,而單任務成本僅約十分之一。不過,為每個任務找到合適的努力檔位,目前仍更像一門藝術而非科學。這些效能與成本宣告仍有待獨立測試驗證。

競爭格局方面,Anthropic 已用 Fable、Opus、Sonnet 三條產品線對應 OpenAI 的 GPT-6 Astra、Sol、Luna。大致而言,Opus 略高於 Sol,Sonnet 高於 Luna,Fable 高於 Astra,但 Anthropic 整體定價更高。由於同檔位模型之間的效能差距已經很小,成本可能成為決定性因素,Haiku 的推出有望幫助 Anthropic 縮小這一差距。

安全層面,Anthropic 為這款能力更強的模型增加了針對網路安全風險和蒸餾攻擊的新防護措施。此外,公司稱 Sonnet 5.5 是首個僅憑截圖就能玩通《寶可夢 紅》的 Sonnet 模型。這類任務在幾年前還被視為難題、往往需要定製演算法,如今連產品家族中的中端模型也能勝任。