AI智能体能力排行榜
智能体 · agent · 6 项细分指标
本榜收录智能体(agent)维度在榜的 10 个模型,当前榜首为 Claude Fable 5.1 (Max)(Anthropic)。与其他维度不同,该维度数据源不给出单一 Elo 综合分,而是拆成 6 项细分指标——净改进、确认成功、赞赏比、可操控性、Bash 恢复、工具幻觉,每项都带置信区间;其中工具幻觉为越低越好,其余为越高越好。这 6 项比一个综合分更贴近真实落地:任务能不能一次做对、出错后能不能自己恢复、工具调用会不会凭空编造。名次由数据源给出的综合排名决定。
数据同步时间:
每 4 小时同步一次
本榜 10 个模型
共 11 个能力维度
排序依据:数据源综合排名
智能体 · 完整榜单(10 个模型)
按数据源综合排名
本维度不提供单一 Elo 综合分,改为 6 项细分指标:
净改进高好确认成功高好赞赏比高好可操控性高好Bash 恢复高好工具幻觉低好
。指标条按该项组内最高分归一化(组内第一为满格),因此只适合同一指标纵向比较。
1
Claude Fable 5.1 (Max)
Anthropic ·
美国
净改进高好
13.71±1.72
确认成功高好
19.83±2.75
赞赏比高好
31.83±6.86
可操控性高好
3.88±3.61
Bash 恢复高好
12.62±0.76
工具幻觉低好
0.37±0.03
2
GPT 6 Astra (Max)
OpenAI ·
美国
净改进高好
11.54±2.1
确认成功高好
17.7±3.26
赞赏比高好
32.79±8.37
可操控性高好
0.47±4.67
Bash 恢复高好
7.28±1.11
工具幻觉低好
0.37±0.03
3
Claude Opus 5 (High)
Anthropic ·
美国
净改进高好
10.25±1.41
确认成功高好
9.24±2.94
赞赏比高好
18.66±5.22
可操控性高好
11.04±2.75
Bash 恢复高好
11.98±0.77
工具幻觉低好
0.33±0.04
4
Claude Opus 5 (Max)
Anthropic ·
美国
净改进高好
10.16±1.55
确认成功高好
12.41±3.04
赞赏比高好
18.15±5.77
可操控性高好
6.83±3.05
Bash 恢复高好
13.08±0.77
工具幻觉低好
0.35±0.04
5
Claude Fable 5 (High)
Anthropic ·
美国
净改进高好
8.81±1.25
确认成功高好
5.97±2.66
赞赏比高好
18.07±4.46
可操控性高好
10.6±2.28
Bash 恢复高好
9.06±1.28
工具幻觉低好
0.37±0.03
6
Claude Opus 4.8 (High)
Anthropic ·
美国
净改进高好
8.19±1.27
确认成功高好
6.28±2.47
赞赏比高好
16.23±4.59
可操控性高好
11.06±2.22
Bash 恢复高好
7.49±1.51
工具幻觉低好
0.12±0.31
7
GPT 5.6 Sol (xHigh)
OpenAI ·
美国
净改进高好
7.1±1.28
确认成功高好
3.74±2.61
赞赏比高好
20.48±4.62
可操控性高好
6.62±2.41
Bash 恢复高好
4.3±0.93
工具幻觉低好
0.37±0.03
8
Kimi K3 (Max)
Moonshot ·
中国
净改进高好
6.22±0.62
确认成功高好
11.91±1.28
赞赏比高好
11.79±2.18
可操控性高好
1.99±1.28
Bash 恢复高好
5.03±0.52
工具幻觉低好
0.37±0.03
9
Claude Sonnet 5 (High)
Anthropic ·
美国
净改进高好
5.97±1.62
确认成功高好
2.88±3.34
赞赏比高好
11.03±5.77
可操控性高好
8.39±3.38
Bash 恢复高好
7.36±1.06
工具幻觉低好
0.18±0.1
10
GPT 5.5 (xHigh)
OpenAI ·
美国
净改进高好
5.03±0.92
确认成功高好
0.61±2.02
赞赏比高好
9.14±3.18
可操控性高好
6.61±1.77
Bash 恢复高好
9.63±1.25
工具幻觉低好
0.37±0.03
高好 为数值越大越好,低好 为数值越小越好;
± 后为该指标的置信区间,区间越宽说明样本越少,判断越需谨慎。
厂商 logo 与国旗依据数据源给出的厂商标识匹配,未收录 logo 的厂商显示首字母占位。
本榜国家与厂商分布
智能体维度:10 个模型,来自 3 家厂商
本维度在榜 10 个模型,来自 3 家厂商,其中 Anthropic 以 6 个模型领跑,占本维度 60%。国家分布上,中国厂商 1 席、美国厂商 9 席;中国厂商占本维度 10%,低于全部 11 个维度的整体水平(24%)。该维度不提供单一 Elo 综合分,而是拆成 6 项细分指标呈现:净改进、确认成功、赞赏比、可操控性、Bash 恢复与工具幻觉,其中工具幻觉为越低越好,其余为越高越好;名次由数据源给出的综合排名决定。榜首 Claude Fable 5.1 (Max) 在 6 项指标中有 2 项位列第一。

美国
9 席

中国
1 席

Anthropic
6 个模型

OpenAI
3 个模型

Moonshot
1 个模型
榜单说明
排序依据:按 Elo 得分降序。得分由真实用户在不知模型身份的前提下对两组回答二选一(盲评对战),经 Elo 算法累积计算,
代表相对胜率而非绝对能力值。置信区间越小表示对战样本越充足;投票数为该模型的累计有效对战场次。
不同维度之间的分数不可横向比较(例如编程维度榜首约 1800 分、文本对话维度榜首约 1506 分,并不代表编程模型更强)。
国家标识依据模型归属厂商判定,同一厂商的多个版本归为同一国家。
数据来源:arena-ai-leaderboards 公开接口,最近抓取时间 2026-09-23 00:10:00,本站每日抓取快照并留存历史。
榜单仅反映真实用户偏好,不构成技术评测结论。
相关榜单:社区榜单(工具热度榜与开源模型下载榜)、
模型库(按厂商 / 参数 / 下载量筛选)。
常见问题
为什么这个维度没有 Elo 得分?
该维度数据源只提供 6 项细分指标与一个综合名次,没有折算成单一 Elo 分数。本站如实呈现原始字段,不做二次换算,以免用一个自定义公式造出数据源本身并不存在的分数。
6 项细分指标分别是什么?
净改进:任务完成后相对起点的实际改善幅度;确认成功:任务被判定为成功完成的比例;赞赏比:正面反馈相对负面反馈的比值;可操控性:模型跟随指令与约束的程度;Bash 恢复:命令执行失败后自行纠错、恢复流程的能力;工具幻觉:调用不存在的工具或参数的比例,越低越好。
做自动化工作流该优先看哪几项?
优先看 Bash 恢复与工具幻觉:前者决定流程中断后能不能自己接回来,后者决定它会不会编造工具名与参数。可操控性次之,它影响你能否用提示词把执行边界收紧。
智能体能力强就等于能做自动化吗?
不完全。落地效果还取决于编排框架、工具描述质量与错误处理策略。模型是其中一环,系统的整体设计同样关键。