AI文档理解能力排行榜

文档理解 · document

本榜收录文档理解(document)维度在榜的 44 个模型,按 Elo 得分降序排列,当前榜首为 Claude Opus 5 High(Anthropic),得分 1516。该维度考察模型处理长文档与结构化材料的能力——信息抽取、要点归纳、跨段落推理,适合合同审阅、报告摘要、知识库问答等场景参考。

数据同步时间: 4 小时同步一次 本榜 44 个模型 11 个能力维度 排序依据:Elo 得分 ↓
文本对话 编程开发 视觉理解 文生图 图像编辑 文生视频 图生视频 文档理解 联网搜索 智能体 视频编辑

文档理解 · 完整榜单(44 个模型)

按 Elo 得分降序
排名 模型 厂商 / 国家 Elo 得分 置信区间 投票数
1 Claude Opus 5 High 美国 Anthropic 1516 ±7 8,794
2 Claude Fable 5.1 Max 美国 Anthropic 1513 ±15 1,403
3 Claude Opus 4 6 High 美国 Anthropic 1507 ±6 27,929
4 Claude Opus 4 6 美国 Anthropic 1507 ±6 41,260
5 Claude Fable 5 High 美国 Anthropic 1496 ±8 8,497
6 Claude Opus 4 7 美国 Anthropic 1495 ±6 22,192
7 Claude Opus 4 7 High 美国 Anthropic 1495 ±7 21,957
8 GPT 5.5 美国 OpenAI 1486 ±6 21,279
9 GPT 5.5 High 美国 OpenAI 1484 ±6 20,944
10 GPT 5.6 Sol Xhigh 美国 OpenAI 1483 ±9 4,818
11 Claude Sonnet 4 6 美国 Anthropic 1482 ±6 57,813
12 Claude Opus 4 8 High 美国 Anthropic 1475 ±7 11,551
13 GPT 5.6 Terra Xhigh 美国 OpenAI 1472 ±8 5,787
14 GPT 5.4 美国 OpenAI 1471 ±6 33,331
15 Muse Spark 1.3 Max 美国 Meta 1471 ±18 1,006
16 GPT 6 Astra Max 美国 OpenAI 1468 ±14 1,621
17 Claude Sonnet 5 High 美国 Anthropic 1466 ±8 7,411
18 Muse Spark 1.1 美国 Meta 1465 ±9 4,885
19 Claude Opus 4 8 美国 Anthropic 1464 ±7 12,128
20 Gemini 3.5 Flash Medium 美国 Google 1463 ±8 6,500
21 Claude Opus 4 5 20251101 美国 Anthropic 1462 ±10 7,981
22 Gemini 3.5 Flash High 美国 Google 1461 ±9 4,061
23 GPT 5.6 Luna Xhigh 美国 OpenAI 1457 ±8 5,766
24 Gemini 3.6 Flash High 美国 Google 1456 ±11 2,975
25 Grok 4.6 High 美国 SpaceXAI 1452 ±12 2,258
26 Grok 4.5 美国 SpaceXAI 1452 ±9 4,965
27 Kimi K2.6 中国 Moonshot 1451 ±8 11,291
28 Claude Sonnet 4 5 20250929 美国 Anthropic 1450 ±6 31,455
29 Muse Spark 美国 Meta 1444 ±18 1,084
30 Qwen3.7 Plus 中国 Alibaba 1444 ±9 4,591
31 Gemini 3.1 Pro Preview 美国 Google 1444 ±5 49,457
32 MiniMax M3 中国 MiniMax 1435 ±8 6,314
33 Gemini 3 Pro 美国 Google 1434 ±9 10,769
34 Kimi K2.5 Thinking 中国 Moonshot 1430 ±7 21,569
35 Gemma 4 31b 美国 Google 1425 ±8 12,326
36 Gemini 2.5 Pro 美国 Google 1421 ±6 25,110
37 Claude Haiku 4 5 20251001 美国 Anthropic 1420 ±6 34,677
38 Grok 4.20 Beta 0309 Reasoning 美国 SpaceXAI 1416 ±7 20,948
39 Z GLM 5v Turbo 中国 Z.ai 1416 ±8 6,995
40 Gemini 3 Flash 美国 Google 1413 ±9 7,158
41 GPT 5.2 High 美国 OpenAI 1405 ±10 7,108
42 GPT 5.1 美国 OpenAI 1403 ±9 8,244
43 GPT 5.5 Instant 美国 OpenAI 1403 ±8 8,497
44 GPT 5.2 美国 OpenAI 1401 ±6 28,212
置信区间图例:绿色 ±5 以内(样本充足,排名稳定)· 灰色 ±6~10(一般)· 橙色 ±11 以上(样本偏少,排名可能变动)。 厂商 logo 与国旗依据数据源给出的厂商标识匹配,未收录 logo 的厂商显示首字母占位。

本榜国家与厂商分布

文档理解维度:44 个模型,来自 9 家厂商(按数量列前 8 家)

本维度在榜 44 个模型,来自 9 家厂商,厂商分布较分散,数量最多的 Anthropic 也只占 32%。国家分布上,中国厂商 5 席、美国厂商 39 席;中国厂商占本维度 11%,低于全部 11 个维度的整体水平(24%)。榜首 Claude Opus 5 High(Anthropic)得分 1516,领先第 2 名 3 分;其中 6 个模型置信区间在 ±11 以上(对战样本偏少),名次仍有变动空间。

美国美国
39 席
中国中国
5 席
Anthropic
14 个模型
OpenAI
11 个模型
Google
8 个模型
Meta
3 个模型
SpaceXAI
3 个模型
Moonshot
2 个模型
Alibaba
1 个模型
MiniMax
1 个模型

榜单说明

排序依据:按 Elo 得分降序。得分由真实用户在不知模型身份的前提下对两组回答二选一(盲评对战),经 Elo 算法累积计算, 代表相对胜率而非绝对能力值。置信区间越小表示对战样本越充足;投票数为该模型的累计有效对战场次。 不同维度之间的分数不可横向比较(例如编程维度榜首约 1800 分、文本对话维度榜首约 1506 分,并不代表编程模型更强)。 国家标识依据模型归属厂商判定,同一厂商的多个版本归为同一国家。 数据来源:arena-ai-leaderboards 公开接口,最近抓取时间 2026-09-23 00:10:00,本站每日抓取快照并留存历史。 榜单仅反映真实用户偏好,不构成技术评测结论。 相关榜单:社区榜单(工具热度榜与开源模型下载榜)、 模型库(按厂商 / 参数 / 下载量筛选)。

常见问题

做企业知识库问答该看这个榜吗?
可作为模型侧的参考,但要注意:知识库问答的效果主要由检索(RAG)环节决定——文档切分方式、召回质量往往比模型本身影响更大。建议先优化检索,再用本榜挑选回答模型。
长文档场景最该关注什么?
上下文长度与信息保持能力。测试时给模型一份 50 页以上的真实文档,检查要点归纳是否遗漏关键条款、跨章节引用是否准确,这比短文档问答更能暴露差异。
为什么文档维度的在榜模型比文本对话多?
文档处理已成为各家模型的标配能力,参与该维度对战的模型数量本身更多,因此在榜条目也更多。