AI文档理解能力排行榜
本榜收录文档理解(document)维度在榜的 44 个模型,按 Elo 得分降序排列,当前榜首为 Claude Opus 5 High(Anthropic),得分 1516。该维度考察模型处理长文档与结构化材料的能力——信息抽取、要点归纳、跨段落推理,适合合同审阅、报告摘要、知识库问答等场景参考。
文档理解 · 完整榜单(44 个模型)
按 Elo 得分降序| 排名 | 模型 | 厂商 / 国家 | Elo 得分 | 置信区间 | 投票数 |
|---|---|---|---|---|---|
| 1 |
Claude Opus 5 High
|
Anthropic
|
1516 | ±7 | 8,794 |
| 2 |
Claude Fable 5.1 Max
|
Anthropic
|
1513 | ±15 | 1,403 |
| 3 |
Claude Opus 4 6 High
|
Anthropic
|
1507 | ±6 | 27,929 |
| 4 |
Claude Opus 4 6
|
Anthropic
|
1507 | ±6 | 41,260 |
| 5 |
Claude Fable 5 High
|
Anthropic
|
1496 | ±8 | 8,497 |
| 6 |
Claude Opus 4 7
|
Anthropic
|
1495 | ±6 | 22,192 |
| 7 |
Claude Opus 4 7 High
|
Anthropic
|
1495 | ±7 | 21,957 |
| 8 |
GPT 5.5
|
OpenAI
|
1486 | ±6 | 21,279 |
| 9 |
GPT 5.5 High
|
OpenAI
|
1484 | ±6 | 20,944 |
| 10 |
GPT 5.6 Sol Xhigh
|
OpenAI
|
1483 | ±9 | 4,818 |
| 11 |
Claude Sonnet 4 6
|
Anthropic
|
1482 | ±6 | 57,813 |
| 12 |
Claude Opus 4 8 High
|
Anthropic
|
1475 | ±7 | 11,551 |
| 13 |
GPT 5.6 Terra Xhigh
|
OpenAI
|
1472 | ±8 | 5,787 |
| 14 |
GPT 5.4
|
OpenAI
|
1471 | ±6 | 33,331 |
| 15 |
Muse Spark 1.3 Max
|
Meta
|
1471 | ±18 | 1,006 |
| 16 |
GPT 6 Astra Max
|
OpenAI
|
1468 | ±14 | 1,621 |
| 17 |
Claude Sonnet 5 High
|
Anthropic
|
1466 | ±8 | 7,411 |
| 18 |
Muse Spark 1.1
|
Meta
|
1465 | ±9 | 4,885 |
| 19 |
Claude Opus 4 8
|
Anthropic
|
1464 | ±7 | 12,128 |
| 20 |
Gemini 3.5 Flash Medium
|
Google
|
1463 | ±8 | 6,500 |
| 21 |
Claude Opus 4 5 20251101
|
Anthropic
|
1462 | ±10 | 7,981 |
| 22 |
Gemini 3.5 Flash High
|
Google
|
1461 | ±9 | 4,061 |
| 23 |
GPT 5.6 Luna Xhigh
|
OpenAI
|
1457 | ±8 | 5,766 |
| 24 |
Gemini 3.6 Flash High
|
Google
|
1456 | ±11 | 2,975 |
| 25 |
Grok 4.6 High
|
SpaceXAI
|
1452 | ±12 | 2,258 |
| 26 |
Grok 4.5
|
SpaceXAI
|
1452 | ±9 | 4,965 |
| 27 |
Kimi K2.6
|
Moonshot
|
1451 | ±8 | 11,291 |
| 28 |
Claude Sonnet 4 5 20250929
|
Anthropic
|
1450 | ±6 | 31,455 |
| 29 |
Muse Spark
|
Meta
|
1444 | ±18 | 1,084 |
| 30 |
Qwen3.7 Plus
|
Alibaba
|
1444 | ±9 | 4,591 |
| 31 |
Gemini 3.1 Pro Preview
|
Google
|
1444 | ±5 | 49,457 |
| 32 |
MiniMax M3
|
MiniMax
|
1435 | ±8 | 6,314 |
| 33 |
Gemini 3 Pro
|
Google
|
1434 | ±9 | 10,769 |
| 34 |
Kimi K2.5 Thinking
|
Moonshot
|
1430 | ±7 | 21,569 |
| 35 |
Gemma 4 31b
|
Google
|
1425 | ±8 | 12,326 |
| 36 |
Gemini 2.5 Pro
|
Google
|
1421 | ±6 | 25,110 |
| 37 |
Claude Haiku 4 5 20251001
|
Anthropic
|
1420 | ±6 | 34,677 |
| 38 |
Grok 4.20 Beta 0309 Reasoning
|
SpaceXAI
|
1416 | ±7 | 20,948 |
| 39 | Z GLM 5v Turbo |
Z.ai
|
1416 | ±8 | 6,995 |
| 40 |
Gemini 3 Flash
|
Google
|
1413 | ±9 | 7,158 |
| 41 |
GPT 5.2 High
|
OpenAI
|
1405 | ±10 | 7,108 |
| 42 |
GPT 5.1
|
OpenAI
|
1403 | ±9 | 8,244 |
| 43 |
GPT 5.5 Instant
|
OpenAI
|
1403 | ±8 | 8,497 |
| 44 |
GPT 5.2
|
OpenAI
|
1401 | ±6 | 28,212 |
本榜国家与厂商分布
文档理解维度:44 个模型,来自 9 家厂商(按数量列前 8 家)
本维度在榜 44 个模型,来自 9 家厂商,厂商分布较分散,数量最多的 Anthropic 也只占 32%。国家分布上,中国厂商 5 席、美国厂商 39 席;中国厂商占本维度 11%,低于全部 11 个维度的整体水平(24%)。榜首 Claude Opus 5 High(Anthropic)得分 1516,领先第 2 名 3 分;其中 6 个模型置信区间在 ±11 以上(对战样本偏少),名次仍有变动空间。
榜单说明
排序依据:按 Elo 得分降序。得分由真实用户在不知模型身份的前提下对两组回答二选一(盲评对战),经 Elo 算法累积计算, 代表相对胜率而非绝对能力值。置信区间越小表示对战样本越充足;投票数为该模型的累计有效对战场次。 不同维度之间的分数不可横向比较(例如编程维度榜首约 1800 分、文本对话维度榜首约 1506 分,并不代表编程模型更强)。 国家标识依据模型归属厂商判定,同一厂商的多个版本归为同一国家。 数据来源:arena-ai-leaderboards 公开接口,最近抓取时间 2026-09-23 00:10:00,本站每日抓取快照并留存历史。 榜单仅反映真实用户偏好,不构成技术评测结论。 相关榜单:社区榜单(工具热度榜与开源模型下载榜)、 模型库(按厂商 / 参数 / 下载量筛选)。