【TechWeb】9月23日消息,在Claude Opus 5发布不到两个月后,Anthropic正式推出了升级模型Claude Opus 5.5。
官方称,该模型在大多数工作任务中已达到其旗舰模型Claude Fable 5.1的水平,但运行成本较上一代Opus 5降低了40%。
值得一提的是,这也是Anthropic CEO达里奥·阿莫代伊提出“放缓前沿AI发展”计划后,公司发布的首款模型。
性能比肩Fable 5.1
Opus 5.5专为长时间运行的智能体编码和知识工作构建,拥有100万token的上下文窗口和128K的最大输出token数。
Anthropic公布的数据显示,在智能体编码、知识工作、计算机使用、视觉图表识别和多学科推理等基准测试中,Opus 5.5均超过了Fable 5.1。在Terminal-Bench 4.0上,Opus 5.5跑出了66.4%的成绩,领先GPT-6 Astra的57.9%。独立评估平台Artificial Analysis的智能指数中,Opus 5.5以58分位居榜首,在十项评估中领先六项。
实际应用场景中,Anthropic分享的一个早期测试案例显示,有测试者使用Opus 5.5在不到一天的时间里完成了68万行代码的迁移,而同样工作原本需要一个工程团队花费数周。
另一个测试中,Opus 5.5在不到三小时内审计并修复了一个20万行的代码库,而Opus 5完成同样任务用了20多个小时,消耗的token量也是Opus 5.5的2.5倍。
定价较上代下降20%
定价与效率是此次发布的核心亮点。 Opus 5.5的输入和输出token定价分别为每百万4美元和20美元,较Opus 5的5美元和25美元下降了20%。缓存读取价格降至每百万0.20美元,降幅达60%,这对智能体和编码工作负载的成本结构影响显著。
Anthropic表示,默认设置下Opus 5.5在典型工作负载上的成本比Opus 5低约40%,同时输出生成速度提升超过30%。此外,Claude API上还提供了Fast模式的研究预览,速度可达标准模式的2.5倍,定价为每百万输入8美元、输出40美元。
安全机制升级
安全防护是此次发布的另一重点。Anthropic 称 Opus 5.5 在其最全面的自动化行为审计中取得了迄今最强成绩,该审计覆盖近 2000 个模拟场景。与 Opus 5 相比,新模型试图绕过边界限制的频率降低了约 85%,且所有尝试均为低严重度并已自我报告。
一项值得关注的结构性变化是模型间安全路由机制的引入。当系统识别出网络安全相关请求存在较高风险时,会将其转交给能力较弱的 Opus 4.8 处理;涉及生物学领域且触发防护的请求则转交 Opus 5。Anthropic 认为,这种分流机制可以在保留新模型核心能力的同时,对可能被滥用的高风险能力加以限制。
Opus 5.5 在发布前接受了外部机构 Frontier Design 和 METR 的独立测试。据悉,Anthropic 还计划在未来几周内推出 Claude Sonnet 5.5 和 Haiku 5.5。
目前,Claude Opus 5.5已经全面登陆各平台,包括Claude API、亚马逊云科技(Bedrock)、谷歌云(Vertex AI)以及微软Azure云平台。
伴随此次发布,Anthropic将Pro、Max、Team及基于席位的Enterprise计划的五小时使用限额上调了20%,订阅用户还获得了一次可在10月22日前任意时间使用的速率限制重置机会。
