大模型排行榜

文本对话 · text

本榜为主榜,收录文本对话(text)维度在榜的 10 个模型,按 Elo 得分降序排列,当前榜首为 Claude Fable 5 High(Anthropic),得分 1506。榜单数据每 4 小时同步一次,页面顶部的同步时间即为最近一次同步时刻,名次会随对战结果变动。得分来自真实用户在不知模型身份的前提下对两组回答二选一,反映实际使用偏好而非题库打分;置信区间越小表示对战样本越充足、排名越稳定。页面顶部可切换其余 10 个能力维度,每个维度独立成页。

数据同步时间: 4 小时同步一次 本榜 10 个模型 11 个能力维度 排序依据:Elo 得分 ↓
文本对话 编程开发 视觉理解 文生图 图像编辑 文生视频 图生视频 文档理解 联网搜索 智能体 视频编辑

文本对话 · 完整榜单(10 个模型)

按 Elo 得分降序
排名 模型 厂商 / 国家 Elo 得分 置信区间 投票数
1 Claude Fable 5 High 美国 Anthropic 1506 ±5 30,057
2 Claude Opus 4 6 High 美国 Anthropic 1505 ±4 71,993
3 Claude Opus 4 7 High 美国 Anthropic 1502 ±4 60,002
4 muse-spark-1.2 (xHigh) 美国 Meta 1500 ±11 3,227
5 Claude Fable 5.1 Max 美国 Anthropic 1498 ±8 5,783
6 Claude Opus 4 6 美国 Anthropic 1497 ±3 75,878
7 Claude Opus 4 7 美国 Anthropic 1494 ±4 61,128
8 Muse Spark 1.3 Max 美国 Meta 1493 ±9 4,723
9 Gemini 3.8 Flash High 美国 Google 1493 ±9 5,076
10 Claude Opus 5 High 美国 Anthropic 1493 ±4 42,617
置信区间图例:绿色 ±5 以内(样本充足,排名稳定)· 灰色 ±6~10(一般)· 橙色 ±11 以上(样本偏少,排名可能变动)。 厂商 logo 与国旗依据数据源给出的厂商标识匹配,未收录 logo 的厂商显示首字母占位。

本榜国家与厂商分布

文本对话维度:10 个模型,来自 3 家厂商

本维度在榜 10 个模型,来自 3 家厂商,其中 Anthropic 以 7 个模型领跑,占本维度 70%。国家分布上,美国厂商 10 席,暂无中国厂商入榜;作为对照,全部 11 个维度合计中国厂商占 24%。榜首 Claude Fable 5 High(Anthropic)得分 1506,与第 2 名分差在 1 分以内;其中 1 个模型置信区间在 ±11 以上(对战样本偏少),名次仍有变动空间。

美国美国
10 席
Anthropic
7 个模型
Meta
2 个模型
Google
1 个模型

榜单说明

排序依据:按 Elo 得分降序。得分由真实用户在不知模型身份的前提下对两组回答二选一(盲评对战),经 Elo 算法累积计算, 代表相对胜率而非绝对能力值。置信区间越小表示对战样本越充足;投票数为该模型的累计有效对战场次。 不同维度之间的分数不可横向比较(例如编程维度榜首约 1800 分、文本对话维度榜首约 1506 分,并不代表编程模型更强)。 国家标识依据模型归属厂商判定,同一厂商的多个版本归为同一国家。 数据来源:arena-ai-leaderboards 公开接口,最近抓取时间 2026-09-23 00:10:00,本站每日抓取快照并留存历史。 榜单仅反映真实用户偏好,不构成技术评测结论。 相关榜单:社区榜单(工具热度榜与开源模型下载榜)、 模型库(按厂商 / 参数 / 下载量筛选)。

常见问题

这个排行榜和「社区榜单」里的模型榜有什么区别?
两者衡量的东西不同:这里的排行榜衡量模型能力——按真实用户盲评对战的 Elo 得分排列,并按 11 个能力维度拆分;「社区榜单」里的模型下载榜衡量的是开源模型的采用热度——按社区累计下载量排序。选型时建议结合两者:能力榜看你需要的能力谁最强,下载榜看哪个模型被用得最多、生态最成熟。
Elo 得分和置信区间该怎么看?
得分越高代表盲评胜率越高。置信区间表示得分的波动范围:区间小说明该模型对战样本充足、排名可信;区间大说明样本还少,排名可能继续变动。判断排名含金量时,建议把得分与投票数一起看——投票数过少的模型即使名次靠前,也不宜直接当作结论。
文本对话能力和实际选型是一回事吗?
不完全一致。对话能力强的模型在写作、问答、总结等通用任务上通常占优,但如果你的场景是写代码、处理长文档或生成图片,应改看对应的能力维度——各维度分数不可横向比较,不同维度之间没有统一的换算关系。