美西时间9月22日,Anthropic与OpenAI在同一天发布新款AI模型,双方在性能与定价上正面交锋,AI模型价格战进一步升级。Anthropic推出Claude Opus 5.5,OpenAI则发布GPT-6 Sol与GPT-6 Luna两款新模型。

Anthropic表示,Opus 5.5在大多数任务上的表现与其最强模型Fable 5.1相当,在默认设置下典型工作负载的成本比Opus 5低40%。定价方面,Opus 5.5为每百万输入token 4美元、每百万输出token 20美元,单价较Opus 5下调20%。公司还称,Opus 5.5的输出速度比Opus 5快30%以上,文字表达也更清晰。

在编程基准测试CursorBench中,Anthropic称Opus 5.5得分比OpenAI的GPT-5.6 Sol高11分,运行成本仅为后者约三分之一。Anthropic表示,Opus 5.5是其“5.5系列”的首款产品,该系列将比以往各代更具成本效益,Claude Sonnet 5.5与Claude Haiku 5.5将于未来几周推出。

OpenAI方面,GPT-6 Sol定价为每百万输入token 2美元、每百万输出token 10美元,较GPT-5.6 Sol的促销价下调50%。GPT-6 Luna的定价更低,仅为每百万输入token 0.10美元、每百万输出token 0.50美元。两款新模型面向专业工作、编程、自动化和计算机操作等场景,是本月早些时候发布的旗舰模型GPT-6 Astra的低成本选择。

OpenAI表示,缓存与推理效率的提升降低了服务成本,公司将节省的成本直接让利给用户。性能上,OpenAI称GPT-6 Sol的出错率约为前代的一半;GPT-6 Luna在较高推理强度下可达到GPT-5.6 Sol的水平,成本仅约其百分之一。GPT-5.6 Sol与Luna于今年7月发布,距此次更新不足三个月。

OpenAI也将新模型与Anthropic的上一代产品作了对比。在AutomationBench专业工作测试中,GPT-6 Sol得分比Claude Opus 5高6.3%,单任务成本仅为后者的9%。此外,OpenAI改进了GPT-6系列的提示词缓存功能,称调用已缓存提示词的成本最多可比未缓存时低90%,这对需要长时间运行、反复处理相同指令的AI智能体尤为有利。

安全性方面,Opus 5.5是Anthropic首席执行官达里奥·阿莫代伊本月早些时候呼吁业界放缓前沿能力发布节奏后,公司推出的首款模型。发布前,该模型接受了大规模对齐测试,以及AI安全研究机构METR和Frontier Design的外部评估。Anthropic称,Opus 5.5配备了此前仅用于最强系统的安全防护,以限制网络安全和生物等高风险领域的滥用,同时正扩大专门的准入计划,让更多经审核的网络安全和生命科学研究人员获得更充分的使用权限。内部测试显示,Opus 5.5试图突破“隔离边界”的概率比Opus 5或Mythos 5.1低约85%

OpenAI表示,Sol与Luna采用了与旗舰模型Astra类似的训练方法,在推理、事实可靠性及对齐等方面均有改进。测试数据显示,GPT-6 Sol试图绕过限制的比例从前代的68%降至64%,Luna则从77%降至42%。在模拟留言板测试中,若模型发现留言板,GPT-6 Sol执行未经授权指令的比例由前代的52%降至11%

两家公司同日出牌,且均以大幅降价作为核心卖点,反映出大模型市场竞争正从单纯的能力比拼转向性价比与安全性的综合较量。投资者此前猜测,新模型发布或将成为Anthropic公布招股书的催化剂,市场正关注其能否在竞争加剧、客户对价格日益敏感的背景下延续高速增长。