首页 > 开源 > Claude Opus 5.5 的 Intelligence Index 反超 GPT-6 Astra 整整 5 分

Claude Opus 5.5 的 Intelligence Index 反超 GPT-6 Astra 整整 5 分

OSChina资讯 2026-09-23 11:38 4 阅读 查看原文

Claude Opus 5.5 发布后,第三方独立评测机构 Artificial Analysis 也更新了它的 Intelligence Index(v4.3.2)数据。它把 Claude Opus 5.5 (max with fallback) 评到了 57.62 分——这是官方口径之外的另一个参照物,用来回答"Anthropic 说强,到底有多强"这个问题。

AI 横评看三个维度最有用。定量来看,AAII 57.62 分把 Claude Fable 5.1 (53.35)、GPT-6 Astra (52.67)、GPT-5.6 Sol (46.97) 都甩在身后——分别领先 4.3、5.0 和 10.6 分。跟 GPT-6 Astra 相比,这个幅度不小:Astra 两周前刚被 OpenAPI 定义为"全球最强",现在第三方榜单上被 Opus 5.5 反超了 5 分。

这个指数不是单一跑分,是 10 个评测的综合:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。覆盖了 agentic 知识工作、真实世界操作、SaaS 流程、编码终端使用、专业文档推理、医学长上下文推理这些子项——比单纯比代码题更能反映实际干活能力。

定价上,AA 记录的和 Anthropic 官方一致:输入 $4、输出 $20、缓存读取 $0.20。对比 GPT-6 Astra 的输入 $10/输出 $50 和 Claude Fable 5.1 的输入 $10/输出 $50,价格优势明显。上下文窗口 100 万 token。

值得注意的一个细节:AA 列的是 (max with fallback)——也就是 Opus 5.5 max 档位配置,且开了 fallback 到旧模型。这说明评测的就是用户实际能买到的主力配置,不是特殊调优版。

当然,第三方的数字同样要谨慎看。AAII 高度倾斜实用的 agentic 任务,且样本、轮次、评估版本都在变。但"Claude Opus 5.5 在第三方综合榜上反超 GPT-6 Astra"这个信号是成立的——两周内两次发布,横评名次已经易主。

来源: