AI联网搜索能力排行榜

联网搜索 · search

本榜收录联网搜索(search)维度在榜的 34 个模型,按 Elo 得分降序排列,当前榜首为 GPT 5.6 Sol Xhigh(OpenAI),得分 1257。该维度考察模型在需要实时信息、来源追溯的任务中的表现——能否正确检索、辨别信源质量并给出可核验的答案,适合资讯聚合、竞品调研与事实核查类场景参考。

数据同步时间: 4 小时同步一次 本榜 34 个模型 11 个能力维度 排序依据:Elo 得分 ↓
文本对话 编程开发 视觉理解 文生图 图像编辑 文生视频 图生视频 文档理解 联网搜索 智能体 视频编辑

联网搜索 · 完整榜单(34 个模型)

按 Elo 得分降序
排名 模型 厂商 / 国家 Elo 得分 置信区间 投票数
1 GPT 5.6 Sol Xhigh 美国 OpenAI 1257 ±7 29,663
2 Claude Opus 4 6 Search 美国 Anthropic 1253 ±5 134,699
3 GPT 5.5 Search 美国 OpenAI 1242 ±5 89,873
4 Claude Opus 4 7 美国 Anthropic 1233 ±5 91,394
5 Claude Fable 5 High 美国 Anthropic 1230 ±8 41,795
6 ERNIE 5.1 中国 Baidu 1227 ±10 3,788
7 Claude Sonnet 4 6 Search 美国 Anthropic 1221 ±5 134,905
8 Grok 4.5 美国 SpaceXAI 1213 ±7 31,505
9 Gemini 3.1 Pro Grounding 美国 Google 1210 ±5 113,282
10 Gemini 3 Pro Grounding 美国 Google 1207 ±6 37,024
11 GPT 5.2 Search 美国 OpenAI 1207 ±6 52,712
12 Claude Opus 4 8 美国 Anthropic 1204 ±6 70,998
13 Grok 4.20 Multi Agent Beta 0309 美国 SpaceXAI 1204 ±5 109,553
14 GPT 5.1 Search 美国 OpenAI 1199 ±5 59,909
15 Gemini 3 Flash Grounding 美国 Google 1198 ±5 149,334
16 GPT 5.4 Search 美国 OpenAI 1197 ±5 110,116
17 Claude Sonnet 5 Search 美国 Anthropic 1194 ±7 40,230
18 Grok 4.20 Beta1 美国 SpaceXAI 1189 ±6 53,921
19 Claude Opus 4 5 Search 美国 Anthropic 1180 ±6 61,573
20 GPT 5.2 Search Non Reasoning 美国 OpenAI 1172 ±6 75,658
21 Grok 4 1 Fast Search 美国 SpaceXAI 1171 ±5 81,507
22 Grok 4 Fast Search 美国 SpaceXAI 1171 ±5 41,794
23 Grok 4.3 美国 SpaceXAI 1165 ±5 91,483
24 Claude Sonnet 4 5 Search 美国 Anthropic 1158 ±5 127,378
25 Claude Opus 4 1 Search 美国 Anthropic 1148 ±5 76,933
26 o3 Search 美国 OpenAI 1144 ±5 20,644
27 Gemini 2.5 Pro Grounding 美国 Google 1142 ±5 83,404
28 Grok 4 Search 美国 SpaceXAI 1142 ±6 19,108
29 Ppl Sonar Reasoning Pro High 美国 Perplexity AI 1139 ±6 29,055
30 GPT 5 Search 美国 OpenAI 1133 ±6 20,781
31 Ppl Sonar Pro High 美国 Perplexity AI 1130 ±6 28,519
32 Claude Opus 4 Search 美国 Anthropic 1126 ±5 31,037
33 D Diffbot Small Xl 美国 Diffbot 1023 ±8 6,388
34 Api GPT 4o Search 美国 OpenAI 1006 ±11 3,411
置信区间图例:绿色 ±5 以内(样本充足,排名稳定)· 灰色 ±6~10(一般)· 橙色 ±11 以上(样本偏少,排名可能变动)。 厂商 logo 与国旗依据数据源给出的厂商标识匹配,未收录 logo 的厂商显示首字母占位。

本榜国家与厂商分布

联网搜索维度:34 个模型,来自 7 家厂商

本维度在榜 34 个模型,来自 7 家厂商,厂商分布较分散,数量最多的 Anthropic 也只占 29%。国家分布上,中国厂商 1 席、美国厂商 33 席;中国厂商占本维度 3%,低于全部 11 个维度的整体水平(24%)。榜首 GPT 5.6 Sol Xhigh(OpenAI)得分 1257,领先第 2 名 4 分;其中 1 个模型置信区间在 ±11 以上(对战样本偏少),名次仍有变动空间。

美国美国
33 席
中国中国
1 席
Anthropic
10 个模型
OpenAI
9 个模型
SpaceXAI
7 个模型
Google
4 个模型
Perplexity AI
2 个模型
Baidu
1 个模型
D Diffbot
1 个模型

榜单说明

排序依据:按 Elo 得分降序。得分由真实用户在不知模型身份的前提下对两组回答二选一(盲评对战),经 Elo 算法累积计算, 代表相对胜率而非绝对能力值。置信区间越小表示对战样本越充足;投票数为该模型的累计有效对战场次。 不同维度之间的分数不可横向比较(例如编程维度榜首约 1800 分、文本对话维度榜首约 1506 分,并不代表编程模型更强)。 国家标识依据模型归属厂商判定,同一厂商的多个版本归为同一国家。 数据来源:arena-ai-leaderboards 公开接口,最近抓取时间 2026-09-23 00:10:00,本站每日抓取快照并留存历史。 榜单仅反映真实用户偏好,不构成技术评测结论。 相关榜单:社区榜单(工具热度榜与开源模型下载榜)、 模型库(按厂商 / 参数 / 下载量筛选)。

常见问题

联网搜索能力对做资讯类产品有多重要?
较重要。带检索的模型能直接给出带来源的答案,减少事实性错误;但信源质量与时效性仍需人工把关,尤其是涉及数据、政策类内容时。
为什么这个榜的模型数量比文生图少很多?
该维度需要模型具备完整的检索能力并提供可对战的结果,参与门槛较高,因此在榜条目相对集中在少数具备搜索链路的模型上。
榜单里的分数高低代表什么?
代表在检索类对战任务中的相对偏好胜率,不等同于「能搜到更多结果」。信源覆盖广度、时效性这些指标不在本榜范围内,需要自行验证。