AI联网搜索能力排行榜
本榜收录联网搜索(search)维度在榜的 34 个模型,按 Elo 得分降序排列,当前榜首为 GPT 5.6 Sol Xhigh(OpenAI),得分 1257。该维度考察模型在需要实时信息、来源追溯的任务中的表现——能否正确检索、辨别信源质量并给出可核验的答案,适合资讯聚合、竞品调研与事实核查类场景参考。
联网搜索 · 完整榜单(34 个模型)
按 Elo 得分降序| 排名 | 模型 | 厂商 / 国家 | Elo 得分 | 置信区间 | 投票数 |
|---|---|---|---|---|---|
| 1 |
GPT 5.6 Sol Xhigh
|
OpenAI
|
1257 | ±7 | 29,663 |
| 2 |
Claude Opus 4 6 Search
|
Anthropic
|
1253 | ±5 | 134,699 |
| 3 |
GPT 5.5 Search
|
OpenAI
|
1242 | ±5 | 89,873 |
| 4 |
Claude Opus 4 7
|
Anthropic
|
1233 | ±5 | 91,394 |
| 5 |
Claude Fable 5 High
|
Anthropic
|
1230 | ±8 | 41,795 |
| 6 |
ERNIE 5.1
|
Baidu
|
1227 | ±10 | 3,788 |
| 7 |
Claude Sonnet 4 6 Search
|
Anthropic
|
1221 | ±5 | 134,905 |
| 8 |
Grok 4.5
|
SpaceXAI
|
1213 | ±7 | 31,505 |
| 9 |
Gemini 3.1 Pro Grounding
|
Google
|
1210 | ±5 | 113,282 |
| 10 |
Gemini 3 Pro Grounding
|
Google
|
1207 | ±6 | 37,024 |
| 11 |
GPT 5.2 Search
|
OpenAI
|
1207 | ±6 | 52,712 |
| 12 |
Claude Opus 4 8
|
Anthropic
|
1204 | ±6 | 70,998 |
| 13 |
Grok 4.20 Multi Agent Beta 0309
|
SpaceXAI
|
1204 | ±5 | 109,553 |
| 14 |
GPT 5.1 Search
|
OpenAI
|
1199 | ±5 | 59,909 |
| 15 |
Gemini 3 Flash Grounding
|
Google
|
1198 | ±5 | 149,334 |
| 16 |
GPT 5.4 Search
|
OpenAI
|
1197 | ±5 | 110,116 |
| 17 |
Claude Sonnet 5 Search
|
Anthropic
|
1194 | ±7 | 40,230 |
| 18 |
Grok 4.20 Beta1
|
SpaceXAI
|
1189 | ±6 | 53,921 |
| 19 |
Claude Opus 4 5 Search
|
Anthropic
|
1180 | ±6 | 61,573 |
| 20 |
GPT 5.2 Search Non Reasoning
|
OpenAI
|
1172 | ±6 | 75,658 |
| 21 |
Grok 4 1 Fast Search
|
SpaceXAI
|
1171 | ±5 | 81,507 |
| 22 |
Grok 4 Fast Search
|
SpaceXAI
|
1171 | ±5 | 41,794 |
| 23 |
Grok 4.3
|
SpaceXAI
|
1165 | ±5 | 91,483 |
| 24 |
Claude Sonnet 4 5 Search
|
Anthropic
|
1158 | ±5 | 127,378 |
| 25 |
Claude Opus 4 1 Search
|
Anthropic
|
1148 | ±5 | 76,933 |
| 26 |
o3 Search
|
OpenAI
|
1144 | ±5 | 20,644 |
| 27 |
Gemini 2.5 Pro Grounding
|
Google
|
1142 | ±5 | 83,404 |
| 28 |
Grok 4 Search
|
SpaceXAI
|
1142 | ±6 | 19,108 |
| 29 |
Ppl Sonar Reasoning Pro High
|
Perplexity AI
|
1139 | ±6 | 29,055 |
| 30 |
GPT 5 Search
|
OpenAI
|
1133 | ±6 | 20,781 |
| 31 |
Ppl Sonar Pro High
|
Perplexity AI
|
1130 | ±6 | 28,519 |
| 32 |
Claude Opus 4 Search
|
Anthropic
|
1126 | ±5 | 31,037 |
| 33 | D Diffbot Small Xl |
Diffbot
|
1023 | ±8 | 6,388 |
| 34 |
Api GPT 4o Search
|
OpenAI
|
1006 | ±11 | 3,411 |
本榜国家与厂商分布
联网搜索维度:34 个模型,来自 7 家厂商
本维度在榜 34 个模型,来自 7 家厂商,厂商分布较分散,数量最多的 Anthropic 也只占 29%。国家分布上,中国厂商 1 席、美国厂商 33 席;中国厂商占本维度 3%,低于全部 11 个维度的整体水平(24%)。榜首 GPT 5.6 Sol Xhigh(OpenAI)得分 1257,领先第 2 名 4 分;其中 1 个模型置信区间在 ±11 以上(对战样本偏少),名次仍有变动空间。
榜单说明
排序依据:按 Elo 得分降序。得分由真实用户在不知模型身份的前提下对两组回答二选一(盲评对战),经 Elo 算法累积计算, 代表相对胜率而非绝对能力值。置信区间越小表示对战样本越充足;投票数为该模型的累计有效对战场次。 不同维度之间的分数不可横向比较(例如编程维度榜首约 1800 分、文本对话维度榜首约 1506 分,并不代表编程模型更强)。 国家标识依据模型归属厂商判定,同一厂商的多个版本归为同一国家。 数据来源:arena-ai-leaderboards 公开接口,最近抓取时间 2026-09-23 00:10:00,本站每日抓取快照并留存历史。 榜单仅反映真实用户偏好,不构成技术评测结论。 相关榜单:社区榜单(工具热度榜与开源模型下载榜)、 模型库(按厂商 / 参数 / 下载量筛选)。