在推出旗舰级模型Claude Opus 5.5仅一周后,Anthropic又带来了Claude 5.5家族的第二款产品。
当地时间9月28日,Anthropic正式发布Claude Sonnet 5.5。作为面向日常办公、软件开发等场景的主力模型,Sonnet 5.5在保持API名义价格不变的情况下,进一步提高了生成速度和任务执行效率。
官方数据显示,Sonnet 5.5的输出生成速度提升超过30%。更具实际意义的是,在一些需要持续调用工具、反复执行步骤的任务中,新模型通过减少冗余推理和工具调用,将单项任务的综合成本最高降低30%。
性能上的变化同样明显。在多项软件工程、知识工作和计算机操作基准测试中,Sonnet 5.5已经逼近甚至超过Opus 5.5部分测试配置的成绩。
01 编程能力大幅提升,部分测试超过Opus 5.5

Anthropi官方基准测试对比图
从Anthropic公布的官方测试结果来看,Sonnet 5.5与上一代Sonnet 5之间的差距,在编程任务中最为明显。
在自主智能体编程测试Terminal-Bench 4.0中,Sonnet 5.5得分达到70.6%,上一代Sonnet 5仅为10.3%。这一表现甚至压过了一周前发布的Opus 5.5在高算力档位(Xhigh)下的66.4%。

Terminal-Bench 4.0 基准测试:模型准确率与调用成本关系图
在真实编辑器场景测试CursorBench 4.0中,Sonnet 5.5取得55.5%的成绩,较Sonnet 5的34.1%明显提升,与Opus 5.5的57.8%仅相差2.3个百分点。
在高强度编程测试FrontierCode 1.1中,Sonnet 5.5在High努力等级下的成绩比上一代高出10个百分点,同时单任务运行成本约为Sonnet 5的十五分之一。
知识工作领域的表现同样接近旗舰模型。
在覆盖44种职业真实工作场景的GDPval-AA v2.1测试中,Sonnet 5.5获得1844分,高于Sonnet 5的1449分和OpenAI GPT-6 Sol的1487分,与Opus 5.5的1846分几乎持平。
在跨学科推理测试Humanity's Last Exam的工具模式下,Sonnet 5.5取得64.5%的成绩,高于Sonnet 5的54.9%,距离Opus 5.5的67.7%也只有3.2个百分点。

Artificial Analysis 智能指数排名:Claude Sonnet 5.5 得分达 56 分
第三方评测也显示出类似趋势。大模型评测平台Artificial Analysis的数据显示,Sonnet 5.5在其“智能指数”(Artificial Analysis Intelligence Index)中获得56分,仅比Opus 5.5低2分;在最高推理努力模式下,其得分较上一代Sonnet 5提高18分。
计算机操作能力同样出现明显提升。在OSWorld 2.1部分评估中,Sonnet 5.5准确率达到80.1%,较Sonnet 5的57.0%大幅提升,与Opus 5.5的81.8%相差不大。
视觉理解方面,Sonnet 5.5在Chartography无工具模式下的准确率从上一代的15.6%提升至61.6%,超过GPT-6 Sol的53.6%,接近Opus 5.5的64.4%。
不过,推理投入并非越高越好。
在FrontierCode测试中,Sonnet 5.5在最高算力档位(Max模式)下的得分为46.2%,反而低于次高档位(Xhigh模式)下的52.1%。
Anthropic解释称,Max模式赋予了模型最高的推理自由度,但这更容易触发频繁的代码审查以及子任务拆分;在部分场景中,过度思考反而导致任务超时或产生了超出范围的代码修改,最终影响了测试成绩。
这一结果也说明,在智能体任务中,额外增加推理和执行步骤并不一定带来更高的任务完成度,如何控制计算量和执行路径,同样是模型优化的一部分。
02 用更少Token干更多活

Claude Sonnet 5.5 与 Claude Opus 5.5 的 API 官方定价对比
相比性能提升,Sonnet 5.5此次更值得关注的变化,是成本结构。
Sonnet 5.5的输入、输出和缓存写入价格均为Opus 5.5的一半。
其输入价格为每百万Token 2美元,输出价格为每百万Token 10美元,与GPT-6 Sol处于同一水平。
相比之下,旗舰级Claude Opus 5.5的输入价格为每百万Token 4美元,输出20美元;轻量级GPT-6 Luna的价格则进一步降至输入每百万Token 0.1美元、输出0.5美元。
因此,Anthropic这次强调的并不只是“每百万Token多少钱”,而是完成一项任务究竟需要消耗多少Token、调用多少次工具,以及花费多少时间。

智能指数与单任务成本关系图:Sonnet 5.5 在保持高智能得分的同时大幅降低了单任务成本
Artificial Analysis发布的“智能指数与单任务成本关系图”也显示,Sonnet 5.5虽然单任务输出Token数量较高,但凭借较高的任务完成效率,其单任务成本仍处于较低水平。这意味着,对于Agent任务而言,单纯比较每百万Token价格,已经很难完整反映实际使用成本。
在保持基础价格不变的情况下,Anthropic强调,Sonnet 5.5可以通过减少任务执行步骤和冗余推理,降低实际任务成本。更频繁地批处理工具调用,也有助于减少Agent执行过程中的额外开销。
Anthropic研究产品经理Theo Chu在接受CNBC采访时表示,Sonnet主要面向对成本比较敏感、但并不需要顶级智能水平的客户。对于大量日常、重复性的任务而言,用户并不一定需要Opus级别的深度判断能力。
这也让Sonnet 5.5与Opus 5.5之间的产品分工更加清晰:前者重点解决大量任务的效率和成本问题,后者则承担对复杂性和判断能力要求更高的工作。
在此基础上,提示词缓存也进一步降低了重复任务的成本。Anthropic提供最高90%的提示词缓存折扣,对于需要反复处理相同上下文或长文档的开发者而言,实际支出还可能进一步下降。
一些早期测试反馈显示,Sonnet 5.5在用户界面重构、按照既定模板生成演示文稿等任务中表现较好,生成结果所需要的人工修改较少。
03 安全机制也升级了
随着模型代码能力和智能体执行能力提升,安全问题也成为Sonnet 5.5此次升级的重要组成部分。
Anthropic表示,由于Sonnet 5.5在网络安全和渗透测试方面的能力出现明显提升,该模型成为首款在发布时即采用与Opus 5及Fable 5.1同等级别网络安全防护机制的Sonnet模型。
其中一项机制是高风险请求重定向。当系统识别到高风险的网络攻击或渗透请求时,会将相关任务转交给Sonnet 5处理,同时尽量避免影响正常的软件开发和漏洞修复工作。
第二项是针对模型蒸馏的数据提取防护分类器。Anthropic希望借此减少竞争对手或恶意团队通过大规模API查询,系统性复制和提取模型内部能力的风险。
此外,Anthropic还强调了合规与隐私能力。Sonnet 5.5符合欧盟AI法案相关水印要求,并继续在AWS、Google Cloud、Microsoft Azure以及Anthropic官方API等渠道提供零数据保留选项。
对于Anthropic而言,模型能力提升的同时,安全控制也需要同步升级。
04 Haiku 5.5随后登场
随着Sonnet 5.5发布,Anthropic的Claude 5.5产品线已呈现出较为清晰的分工。
Opus 5.5负责复杂推理、深度判断和高难度任务;Sonnet 5.5则承担软件开发、办公自动化以及大量需要智能体持续执行的日常任务;Haiku 5.5则将进一步覆盖高吞吐、低成本的轻量级任务。
Anthropic在官方公告中确认,Haiku 5.5将在未来几周内推出。
从这套产品布局来看,Anthropic正在把模型之间的差异从单纯的能力比拼,进一步扩展到任务类型、执行效率和使用成本。
Sonnet 5.5的出现,也让Claude 5.5系列的产品分工更加清晰:Opus继续承担高难度任务,Sonnet负责更大规模的日常工作,Haiku则覆盖对速度和成本更加敏感的场景。
对Anthropic而言,接下来的竞争也将从单一模型的能力比拼,转向模型性能、执行效率和使用成本之间的综合较量。Sonnet 5.5能否凭借这一思路进一步扩大企业用户规模,还要看其进入真实生产环境后的表现。
本文来自微信公众号“腾讯科技”,作者:值得关注的,36氪经授权发布。