AI视觉理解能力排行榜

视觉理解 · vision

本榜收录视觉理解(vision)维度在榜的 30 个模型,按 Elo 得分降序排列,当前榜首为 Claude Fable 5 High(Anthropic),得分 1310。该维度考察模型对图片内容的理解能力——看图问答、图表解读、场景描述等,适合需要图像理解能力的业务(图文审核、票据识别辅助、商品图理解)参考。

数据同步时间: 4 小时同步一次 本榜 30 个模型 11 个能力维度 排序依据:Elo 得分 ↓
文本对话 编程开发 视觉理解 文生图 图像编辑 文生视频 图生视频 文档理解 联网搜索 智能体 视频编辑

视觉理解 · 完整榜单(30 个模型)

按 Elo 得分降序
排名 模型 厂商 / 国家 Elo 得分 置信区间 投票数
1 Claude Fable 5 High 美国 Anthropic 1310 ±8 11,304
2 Qwen3.8 Max 中国 Alibaba 1302 ±8 8,665
3 Claude Opus 4 7 High 美国 Anthropic 1301 ±7 21,092
4 Claude Opus 4 7 美国 Anthropic 1300 ±7 21,450
5 Claude Opus 4 6 High 美国 Anthropic 1299 ±7 20,835
6 Muse Spark 1.3 Max 美国 Meta 1294 ±15 1,804
7 Muse Spark 美国 Meta 1294 ±9 5,572
8 Claude Opus 4 6 美国 Anthropic 1293 ±7 25,140
9 muse-spark-1.2 (xHigh) 美国 Meta 1292 ±15 1,841
10 Claude Opus 5 High 美国 Anthropic 1289 ±8 11,599
11 Claude Fable 5.1 Max 美国 Anthropic 1289 ±12 2,701
12 Gemini 3 Pro 美国 Google 1289 ±8 12,995
13 GPT 5.5 美国 OpenAI 1287 ±6 23,423
14 GPT 5.6 Sol Xhigh 美国 OpenAI 1286 ±8 7,729
15 GPT 5.4 High 美国 OpenAI 1285 ±6 25,357
16 GPT 6 Astra Max 美国 OpenAI 1284 ±17 1,367
17 Gemini 3.5 Flash High 美国 Google 1284 ±8 9,579
18 Claude Opus 4 8 High 美国 Anthropic 1283 ±7 15,274
19 GPT 5.5 High 美国 OpenAI 1283 ±6 21,960
20 Gemini 3.5 Flash Medium 美国 Google 1283 ±8 9,618
21 Gemini 3.6 Flash High 美国 Google 1283 ±10 5,159
22 Muse Spark 1.1 美国 Meta 1281 ±8 8,447
23 GPT 5.4 美国 OpenAI 1280 ±7 21,188
24 Grok 4.5 美国 SpaceXAI 1279 ±8 8,355
25 Claude Opus 4 8 美国 Anthropic 1279 ±7 15,801
26 Gemini 3.1 Pro Preview 美国 Google 1279 ±5 40,691
27 GPT 5.2 Chat Latest 20260210 美国 OpenAI 1278 ±7 15,432
28 GPT 5.5 Instant 美国 OpenAI 1278 ±9 7,226
29 Claude Sonnet 4 6 美国 Anthropic 1275 ±6 25,552
30 Z GLM 5.3 Flash 中国 Z.ai 1275 ±12 3,110
置信区间图例:绿色 ±5 以内(样本充足,排名稳定)· 灰色 ±6~10(一般)· 橙色 ±11 以上(样本偏少,排名可能变动)。 厂商 logo 与国旗依据数据源给出的厂商标识匹配,未收录 logo 的厂商显示首字母占位。

本榜国家与厂商分布

视觉理解维度:30 个模型,来自 7 家厂商

本维度在榜 30 个模型,来自 7 家厂商,厂商分布较分散,数量最多的 Anthropic 也只占 33%。国家分布上,中国厂商 2 席、美国厂商 28 席;中国厂商占本维度 7%,低于全部 11 个维度的整体水平(24%)。榜首 Claude Fable 5 High(Anthropic)得分 1310,领先第 2 名 8 分;其中 5 个模型置信区间在 ±11 以上(对战样本偏少),名次仍有变动空间。

美国美国
28 席
中国中国
2 席
Anthropic
10 个模型
OpenAI
8 个模型
Google
5 个模型
Meta
4 个模型
Alibaba
1 个模型
SpaceXAI
1 个模型
Z Z.ai
1 个模型

榜单说明

排序依据:按 Elo 得分降序。得分由真实用户在不知模型身份的前提下对两组回答二选一(盲评对战),经 Elo 算法累积计算, 代表相对胜率而非绝对能力值。置信区间越小表示对战样本越充足;投票数为该模型的累计有效对战场次。 不同维度之间的分数不可横向比较(例如编程维度榜首约 1800 分、文本对话维度榜首约 1506 分,并不代表编程模型更强)。 国家标识依据模型归属厂商判定,同一厂商的多个版本归为同一国家。 数据来源:arena-ai-leaderboards 公开接口,最近抓取时间 2026-09-23 00:10:00,本站每日抓取快照并留存历史。 榜单仅反映真实用户偏好,不构成技术评测结论。 相关榜单:社区榜单(工具热度榜与开源模型下载榜)、 模型库(按厂商 / 参数 / 下载量筛选)。

常见问题

视觉理解和文生图是一回事吗?
不是。视觉理解(vision)是「看图」——输入图片、输出理解与回答;文生图(text-to-image)是「画图」——输入文字、输出图片。两者是完全不同的能力方向,各有独立榜单,选型时要按自己需要的是读图还是产图来取舍。
做图片审核类业务该看哪个榜?
看本榜。图文审核、内容识别类任务依赖的是模型的图像理解与判断能力,视觉理解维度更贴近;文生图维度衡量的是生成质量,与审核场景无关。
为什么有些模型只在部分维度在榜?
数据源按各维度实际参与对战的情况统计,未参与某维度对战的模型不会出现在该维度榜单中。因此同一模型在 11 个维度中的在榜情况不同。