图像编辑能力排行榜
本榜收录图像编辑(image-edit)维度在榜的 55 个模型,按 Elo 得分降序排列,当前榜首为 GPT Image 2.5 Sunburst(OpenAI),得分 1520。该维度考察模型在给定原图与编辑指令下改造图片的能力——局部重绘、物体替换、风格迁移、背景处理等,适合设计、电商与内容运营场景参考。
图像编辑 · 完整榜单(55 个模型)
按 Elo 得分降序| 排名 | 模型 | 厂商 / 国家 | Elo 得分 | 置信区间 | 投票数 |
|---|---|---|---|---|---|
| 1 |
GPT Image 2.5 Sunburst
|
OpenAI
|
1520 | ±9 | 6,704 |
| 2 |
GPT Image 2.5 Flare
|
OpenAI
|
1491 | ±9 | 5,676 |
| 3 |
gpt-image-2 (medium)
|
OpenAI
|
1461 | ±3 | 235,928 |
| 4 |
grok-imagine-image-2.0 (low)
|
SpaceXAI
|
1439 | ±8 | 5,941 |
| 5 |
Mai Image 2.6
|
Microsoft AI
|
1434 | ±8 | 9,481 |
| 6 |
Muse Image
|
Meta
|
1403 | ±5 | 83,408 |
| 7 |
Mai Image 2.5
|
Microsoft AI
|
1400 | ±4 | 174,744 |
| 8 | B Seedream 5.0 Pro |
Bytedance
|
1394 | ±4 | 179,966 |
| 9 |
gemini-3-pro-image-2k (nano-banana-pro)
|
Google
|
1390 | ±3 | 556,580 |
| 10 |
grok-imagine-image-quality (20260519)
|
SpaceXAI
|
1390 | ±6 | 35,594 |
| 11 |
chatgpt-image-latest-high-fidelity (20251216)
|
OpenAI
|
1389 | ±3 | 543,587 |
| 12 |
gemini-3.1-flash-image (nano-banana-2) [web-search]
|
Google
|
1387 | ±4 | 157,693 |
| 13 |
gemini-3-pro-image-preview (nano-banana-pro)
|
Google
|
1385 | ±3 | 518,495 |
| 14 | R Reve 2.1 |
Reve
|
1375 | ±6 | 19,125 |
| 15 |
GPT Image 1.5 High Fidelity
|
OpenAI
|
1370 | ±3 | 566,510 |
| 16 | R Reve 2.0 |
Reve
|
1358 | ±7 | 17,505 |
| 17 | L Uni 1.1 Max |
Luma AI
|
1333 | ±5 | 40,916 |
| 18 |
Grok Imagine Image
|
SpaceXAI
|
1330 | ±3 | 624,951 |
| 19 |
gemini-3.1-flash-lite-image (nano-banana-2-lite)
|
Google
|
1314 | ±5 | 59,280 |
| 20 | L Uni 1.1 |
Luma AI
|
1314 | ±4 | 132,966 |
| 21 |
Qwen Image 2.0 Pro 2026 06 22
|
Alibaba
|
1304 | ±5 | 50,820 |
| 22 |
Hunyuan Image 3.0 Instruct
|
Tencent
|
1302 | ±3 | 307,730 |
| 23 |
Wan2.7 Image Pro
|
Alibaba
|
1302 | ±4 | 41,535 |
| 24 | B Seedream 4.5 |
Bytedance
|
1302 | ±2 | 1,100,289 |
| 25 |
Wan2.7 Image
|
Alibaba
|
1301 | ±4 | 42,373 |
| 26 | B Seedream 5.0 Lite |
Bytedance
|
1294 | ±3 | 373,781 |
| 27 |
gemini-2.5-flash-image-preview (nano-banana)
|
Google
|
1293 | ±2 | 11,176,305 |
| 28 | B Seedream 4 2k |
Bytedance
|
1271 | ±7 | 212,663 |
| 29 | B Flux 2 Max |
Black Forest Labs
|
1262 | ±3 | 352,883 |
| 30 | R Reve V1.1 |
Reve
|
1261 | ±3 | 632,188 |
| 31 |
Kling Image o1
|
KlingAI
|
1251 | ±4 | 135,280 |
| 32 | B Flux 2 Pro |
Black Forest Labs
|
1245 | ±3 | 539,449 |
| 33 |
Qwen Image Edit
|
Alibaba
|
1241 | ±3 | 1,981,112 |
| 34 |
Qwen Image Edit 2511
|
Alibaba
|
1235 | ±3 | 452,591 |
| 35 | R Reve V1 |
Reve
|
1234 | ±5 | 380,880 |
| 36 |
Wan2.6 Image
|
Alibaba
|
1230 | ±3 | 574,912 |
| 37 | B Flux 2 Dev |
Black Forest Labs
|
1226 | ±4 | 237,559 |
| 38 | B Flux 2 Flex |
Black Forest Labs
|
1225 | ±3 | 415,750 |
| 39 | B Flux 2 Klein 9b |
Black Forest Labs
|
1224 | ±3 | 507,078 |
| 40 | B Seedream 4 High Res Fal |
Bytedance
|
1217 | ±3 | 1,184,097 |
| 41 | AI P Image Edit |
|
1211 | ±3 | 336,658 |
| 42 | B Seedream 4 Fal |
Bytedance
|
1210 | ±6 | 153,461 |
| 43 | R Reve V1.1 Fast |
Reve
|
1207 | ±3 | 521,762 |
| 44 | R Reve Edit Fast |
Reve
|
1198 | ±4 | 221,481 |
| 45 | B Flux 2 Klein 4b |
Black Forest Labs
|
1188 | ±3 | 507,119 |
| 46 |
Wan2.5 I2i Preview
|
Alibaba
|
1181 | ±3 | 619,267 |
| 47 | B Flux 1 Kontext Max |
Black Forest Labs
|
1181 | ±3 | 391,207 |
| 48 | B Flux 1 Kontext Pro |
Black Forest Labs
|
1176 | ±3 | 6,400,334 |
| 49 | B Flux 1 Kontext Dev |
Black Forest Labs
|
1149 | ±3 | 3,639,708 |
| 50 | B Seededit 3.0 |
Bytedance
|
1139 | ±3 | 4,928,669 |
| 51 |
GPT Image 1
|
OpenAI
|
1139 | ±3 | 2,853,022 |
| 52 |
GPT Image 1 Mini
|
OpenAI
|
1124 | ±3 | 653,148 |
| 53 |
Gemini 2.0 Flash Preview Image Generation
|
Google
|
1081 | ±2 | 4,947,555 |
| 54 | B Bagel |
Bytedance
|
1026 | ±6 | 13,503 |
| 55 | S Step1x Edit |
StepFun
|
998 | ±4 | 155,558 |
本榜国家与厂商分布
图像编辑维度:55 个模型,来自 13 家厂商(按数量列前 8 家)
本维度在榜 55 个模型,来自 13 家厂商,厂商分布较分散,数量最多的 Black Forest Labs 也只占 16%。国家分布上,中国厂商 17 席、美国厂商 38 席;中国厂商占本维度 31%,与全部 11 个维度的整体水平(24%)大致相当。榜首 GPT Image 2.5 Sunburst(OpenAI)得分 1520,领先第 2 名 29 分;在榜模型置信区间均较窄,对战样本相对充足,排名较为稳定。
榜单说明
排序依据:按 Elo 得分降序。得分由真实用户在不知模型身份的前提下对两组回答二选一(盲评对战),经 Elo 算法累积计算, 代表相对胜率而非绝对能力值。置信区间越小表示对战样本越充足;投票数为该模型的累计有效对战场次。 不同维度之间的分数不可横向比较(例如编程维度榜首约 1800 分、文本对话维度榜首约 1506 分,并不代表编程模型更强)。 国家标识依据模型归属厂商判定,同一厂商的多个版本归为同一国家。 数据来源:arena-ai-leaderboards 公开接口,最近抓取时间 2026-09-23 00:10:00,本站每日抓取快照并留存历史。 榜单仅反映真实用户偏好,不构成技术评测结论。 相关榜单:社区榜单(工具热度榜与开源模型下载榜)、 模型库(按厂商 / 参数 / 下载量筛选)。