AI智能体能力排行榜

智能体 · agent · 6 项细分指标

本榜收录智能体(agent)维度在榜的 10 个模型,当前榜首为 Claude Fable 5.1 (Max)(Anthropic)。与其他维度不同,该维度数据源不给出单一 Elo 综合分,而是拆成 6 项细分指标——净改进、确认成功、赞赏比、可操控性、Bash 恢复、工具幻觉,每项都带置信区间;其中工具幻觉为越低越好,其余为越高越好。这 6 项比一个综合分更贴近真实落地:任务能不能一次做对、出错后能不能自己恢复、工具调用会不会凭空编造。名次由数据源给出的综合排名决定。

数据同步时间: 4 小时同步一次 本榜 10 个模型 11 个能力维度 排序依据:数据源综合排名
文本对话 编程开发 视觉理解 文生图 图像编辑 文生视频 图生视频 文档理解 联网搜索 智能体 视频编辑

智能体 · 完整榜单(10 个模型)

按数据源综合排名
本维度不提供单一 Elo 综合分,改为 6 项细分指标: 净改进高好确认成功高好赞赏比高好可操控性高好Bash 恢复高好工具幻觉低好 。指标条按该项组内最高分归一化(组内第一为满格),因此只适合同一指标纵向比较。
1 Claude Fable 5.1 (Max) Anthropic · 美国美国
净改进高好 13.71±1.72
确认成功高好 19.83±2.75
赞赏比高好 31.83±6.86
可操控性高好 3.88±3.61
Bash 恢复高好 12.62±0.76
工具幻觉低好 0.37±0.03
2 GPT 6 Astra (Max) OpenAI · 美国美国
净改进高好 11.54±2.1
确认成功高好 17.7±3.26
赞赏比高好 32.79±8.37
可操控性高好 0.47±4.67
Bash 恢复高好 7.28±1.11
工具幻觉低好 0.37±0.03
3 Claude Opus 5 (High) Anthropic · 美国美国
净改进高好 10.25±1.41
确认成功高好 9.24±2.94
赞赏比高好 18.66±5.22
可操控性高好 11.04±2.75
Bash 恢复高好 11.98±0.77
工具幻觉低好 0.33±0.04
4 Claude Opus 5 (Max) Anthropic · 美国美国
净改进高好 10.16±1.55
确认成功高好 12.41±3.04
赞赏比高好 18.15±5.77
可操控性高好 6.83±3.05
Bash 恢复高好 13.08±0.77
工具幻觉低好 0.35±0.04
5 Claude Fable 5 (High) Anthropic · 美国美国
净改进高好 8.81±1.25
确认成功高好 5.97±2.66
赞赏比高好 18.07±4.46
可操控性高好 10.6±2.28
Bash 恢复高好 9.06±1.28
工具幻觉低好 0.37±0.03
6 Claude Opus 4.8 (High) Anthropic · 美国美国
净改进高好 8.19±1.27
确认成功高好 6.28±2.47
赞赏比高好 16.23±4.59
可操控性高好 11.06±2.22
Bash 恢复高好 7.49±1.51
工具幻觉低好 0.12±0.31
7 GPT 5.6 Sol (xHigh) OpenAI · 美国美国
净改进高好 7.1±1.28
确认成功高好 3.74±2.61
赞赏比高好 20.48±4.62
可操控性高好 6.62±2.41
Bash 恢复高好 4.3±0.93
工具幻觉低好 0.37±0.03
8 Kimi K3 (Max) Moonshot · 中国中国
净改进高好 6.22±0.62
确认成功高好 11.91±1.28
赞赏比高好 11.79±2.18
可操控性高好 1.99±1.28
Bash 恢复高好 5.03±0.52
工具幻觉低好 0.37±0.03
9 Claude Sonnet 5 (High) Anthropic · 美国美国
净改进高好 5.97±1.62
确认成功高好 2.88±3.34
赞赏比高好 11.03±5.77
可操控性高好 8.39±3.38
Bash 恢复高好 7.36±1.06
工具幻觉低好 0.18±0.1
10 GPT 5.5 (xHigh) OpenAI · 美国美国
净改进高好 5.03±0.92
确认成功高好 0.61±2.02
赞赏比高好 9.14±3.18
可操控性高好 6.61±1.77
Bash 恢复高好 9.63±1.25
工具幻觉低好 0.37±0.03
高好 为数值越大越好,低好 为数值越小越好; ± 后为该指标的置信区间,区间越宽说明样本越少,判断越需谨慎。 厂商 logo 与国旗依据数据源给出的厂商标识匹配,未收录 logo 的厂商显示首字母占位。

本榜国家与厂商分布

智能体维度:10 个模型,来自 3 家厂商

本维度在榜 10 个模型,来自 3 家厂商,其中 Anthropic 以 6 个模型领跑,占本维度 60%。国家分布上,中国厂商 1 席、美国厂商 9 席;中国厂商占本维度 10%,低于全部 11 个维度的整体水平(24%)。该维度不提供单一 Elo 综合分,而是拆成 6 项细分指标呈现:净改进、确认成功、赞赏比、可操控性、Bash 恢复与工具幻觉,其中工具幻觉为越低越好,其余为越高越好;名次由数据源给出的综合排名决定。榜首 Claude Fable 5.1 (Max) 在 6 项指标中有 2 项位列第一。

美国美国
9 席
中国中国
1 席
Anthropic
6 个模型
OpenAI
3 个模型
Moonshot
1 个模型

榜单说明

排序依据:按 Elo 得分降序。得分由真实用户在不知模型身份的前提下对两组回答二选一(盲评对战),经 Elo 算法累积计算, 代表相对胜率而非绝对能力值。置信区间越小表示对战样本越充足;投票数为该模型的累计有效对战场次。 不同维度之间的分数不可横向比较(例如编程维度榜首约 1800 分、文本对话维度榜首约 1506 分,并不代表编程模型更强)。 国家标识依据模型归属厂商判定,同一厂商的多个版本归为同一国家。 数据来源:arena-ai-leaderboards 公开接口,最近抓取时间 2026-09-23 00:10:00,本站每日抓取快照并留存历史。 榜单仅反映真实用户偏好,不构成技术评测结论。 相关榜单:社区榜单(工具热度榜与开源模型下载榜)、 模型库(按厂商 / 参数 / 下载量筛选)。

常见问题

为什么这个维度没有 Elo 得分?
该维度数据源只提供 6 项细分指标与一个综合名次,没有折算成单一 Elo 分数。本站如实呈现原始字段,不做二次换算,以免用一个自定义公式造出数据源本身并不存在的分数。
6 项细分指标分别是什么?
净改进:任务完成后相对起点的实际改善幅度;确认成功:任务被判定为成功完成的比例;赞赏比:正面反馈相对负面反馈的比值;可操控性:模型跟随指令与约束的程度;Bash 恢复:命令执行失败后自行纠错、恢复流程的能力;工具幻觉:调用不存在的工具或参数的比例,越低越好。
做自动化工作流该优先看哪几项?
优先看 Bash 恢复与工具幻觉:前者决定流程中断后能不能自己接回来,后者决定它会不会编造工具名与参数。可操控性次之,它影响你能否用提示词把执行边界收紧。
智能体能力强就等于能做自动化吗?
不完全。落地效果还取决于编排框架、工具描述质量与错误处理策略。模型是其中一环,系统的整体设计同样关键。