首页 > 开源 > Claude Sonnet 5.5 落地:速度快 3 成、Agent 编程评测从 10% 跳到 70%

Claude Sonnet 5.5 落地:速度快 3 成、Agent 编程评测从 10% 跳到 70%

OSChina资讯 2026-09-29 12:14 6 阅读 查看原文

Claude 5.5 家族的第二个成员今天落地:Sonnet 5.5。Anthropic 把它定位成 Opus 5.5 的「快而省」互补款——专攻范围明确的高频日常任务、修 bug、做文档和表格,还强调它有敏锐的设计眼光。官方口径一句话:比 Sonnet 5 清晰升级,速度快 30% 以上,多数任务成本低 30%。

性能数据的跳跃有点夸张。Sonnet 5.5 在 agentic 编程评测 Terminal-Bench 4.0 上拿到 70.6%,对比 Sonnet 5 的 10.3%;在衡量真实职业场景工作的 GDPval-AA 上只比 Opus 5.5 低两分。它还是第一个仅凭截图就打穿《宝可梦 红》的 Sonnet 模型。几个评测里 Sonnet 5.5 在 Max effort 下甚至能看齐 Opus 5.5——不过 Anthropic 自己也澄清:复杂开放式工作仍是 Opus 5.5 更强。

价格没涨,但实际花费降了。输入每百万 token 2 美元、输出 10 美元、缓存读取 0.2 美元——和 Sonnet 5 完全同价,官方强调它干同样的活通常要不了那么多 token,按任务算最多能省三成。想要更省还有 Haiku 5.5,面向高并发成本敏感场景,官方说几周内加入家族。

安全是这一代真正的重头戏。因为 Sonnet 5.5 的网络攻防能力接近 Opus 5 级别,它是第一代自带网络安防兜底的 Sonnet 型号:高危网络安全任务会明显降级回退到 Sonnet 5,日常开发找 bug 不受影响;生物安全护栏则与 Sonnet 5 保持一致。它还第一次配备了防止推理蒸馏的安全分类器,并扩展了 preserved thinking——攻击者用海量假账号「蒸馏」模型能力的路子被堵上了。

来源: