大模型排行榜
本榜为主榜,收录文本对话(text)维度在榜的 10 个模型,按 Elo 得分降序排列,当前榜首为 Claude Fable 5 High(Anthropic),得分 1506。榜单数据每 4 小时同步一次,页面顶部的同步时间即为最近一次同步时刻,名次会随对战结果变动。得分来自真实用户在不知模型身份的前提下对两组回答二选一,反映实际使用偏好而非题库打分;置信区间越小表示对战样本越充足、排名越稳定。页面顶部可切换其余 10 个能力维度,每个维度独立成页。
文本对话 · 完整榜单(10 个模型)
按 Elo 得分降序| 排名 | 模型 | 厂商 / 国家 | Elo 得分 | 置信区间 | 投票数 |
|---|---|---|---|---|---|
| 1 |
Claude Fable 5 High
|
Anthropic
|
1506 | ±5 | 30,057 |
| 2 |
Claude Opus 4 6 High
|
Anthropic
|
1505 | ±4 | 71,993 |
| 3 |
Claude Opus 4 7 High
|
Anthropic
|
1502 | ±4 | 60,002 |
| 4 |
muse-spark-1.2 (xHigh)
|
Meta
|
1500 | ±11 | 3,227 |
| 5 |
Claude Fable 5.1 Max
|
Anthropic
|
1498 | ±8 | 5,783 |
| 6 |
Claude Opus 4 6
|
Anthropic
|
1497 | ±3 | 75,878 |
| 7 |
Claude Opus 4 7
|
Anthropic
|
1494 | ±4 | 61,128 |
| 8 |
Muse Spark 1.3 Max
|
Meta
|
1493 | ±9 | 4,723 |
| 9 |
Gemini 3.8 Flash High
|
Google
|
1493 | ±9 | 5,076 |
| 10 |
Claude Opus 5 High
|
Anthropic
|
1493 | ±4 | 42,617 |
本榜国家与厂商分布
文本对话维度:10 个模型,来自 3 家厂商
本维度在榜 10 个模型,来自 3 家厂商,其中 Anthropic 以 7 个模型领跑,占本维度 70%。国家分布上,美国厂商 10 席,暂无中国厂商入榜;作为对照,全部 11 个维度合计中国厂商占 24%。榜首 Claude Fable 5 High(Anthropic)得分 1506,与第 2 名分差在 1 分以内;其中 1 个模型置信区间在 ±11 以上(对战样本偏少),名次仍有变动空间。
榜单说明
排序依据:按 Elo 得分降序。得分由真实用户在不知模型身份的前提下对两组回答二选一(盲评对战),经 Elo 算法累积计算, 代表相对胜率而非绝对能力值。置信区间越小表示对战样本越充足;投票数为该模型的累计有效对战场次。 不同维度之间的分数不可横向比较(例如编程维度榜首约 1800 分、文本对话维度榜首约 1506 分,并不代表编程模型更强)。 国家标识依据模型归属厂商判定,同一厂商的多个版本归为同一国家。 数据来源:arena-ai-leaderboards 公开接口,最近抓取时间 2026-09-23 00:10:00,本站每日抓取快照并留存历史。 榜单仅反映真实用户偏好,不构成技术评测结论。 相关榜单:社区榜单(工具热度榜与开源模型下载榜)、 模型库(按厂商 / 参数 / 下载量筛选)。