AI视频编辑能力排行榜
视频编辑 · video-edit
本榜收录视频编辑(video-edit)维度在榜的 10 个模型,按 Elo 得分降序排列,当前榜首为 Wan3.0(Alibaba),得分 1414。该维度考察模型在给定原始视频与编辑指令下的改造能力——风格迁移、元素替换、局部修改等,是 11 个维度中在榜模型最少、也最偏前沿的一项。
数据同步时间:
每 4 小时同步一次
本榜 10 个模型
共 11 个能力维度
排序依据:Elo 得分 ↓
视频编辑 · 完整榜单(10 个模型)
按 Elo 得分降序| 排名 | 模型 | 厂商 / 国家 | Elo 得分 | 置信区间 | 投票数 |
|---|---|---|---|---|---|
| 1 |
Wan3.0
|
Alibaba
|
1414 | ±26 | 463 |
| 2 | B Dreamina Seedance 2.5 720p |
Bytedance
|
1410 | ±26 | 429 |
| 3 |
MiniMax H3
|
MiniMax
|
1392 | ±19 | 962 |
| 4 |
Gemini Omni Flash
|
Google
|
1367 | ±15 | 2,109 |
| 5 | B Dreamina Seedance 2.0 720p |
Bytedance
|
1365 | ±14 | 3,852 |
| 6 |
Happyhorse 1.0
|
Alibaba-ATH
|
1307 | ±14 | 3,116 |
| 7 |
Grok Imagine Video
|
SpaceXAI
|
1258 | ±10 | 13,724 |
| 8 |
Kling o3 Pro
|
KlingAI
|
1255 | ±11 | 7,540 |
| 9 |
Kling o1 Pro
|
KlingAI
|
1197 | ±10 | 10,542 |
| 10 | R Runway Gen4 Aleph |
Runway
|
1182 | ±9 | 9,818 |
置信区间图例:绿色 ±5 以内(样本充足,排名稳定)·
灰色 ±6~10(一般)·
橙色 ±11 以上(样本偏少,排名可能变动)。
厂商 logo 与国旗依据数据源给出的厂商标识匹配,未收录 logo 的厂商显示首字母占位。
本榜国家与厂商分布
视频编辑维度:10 个模型,来自 8 家厂商
本维度在榜 10 个模型,来自 8 家厂商,厂商分布较分散,数量最多的 Bytedance 也只占 20%。国家分布上,中国厂商 5 席、美国厂商 5 席;中国厂商占本维度 50%,高于全部 11 个维度的整体水平(24%)。榜首 Wan3.0(Alibaba)得分 1414,领先第 2 名 4 分;其中 7 个模型置信区间在 ±11 以上(对战样本偏少),名次仍有变动空间。
榜单说明
排序依据:按 Elo 得分降序。得分由真实用户在不知模型身份的前提下对两组回答二选一(盲评对战),经 Elo 算法累积计算, 代表相对胜率而非绝对能力值。置信区间越小表示对战样本越充足;投票数为该模型的累计有效对战场次。 不同维度之间的分数不可横向比较(例如编程维度榜首约 1800 分、文本对话维度榜首约 1506 分,并不代表编程模型更强)。 国家标识依据模型归属厂商判定,同一厂商的多个版本归为同一国家。 数据来源:arena-ai-leaderboards 公开接口,最近抓取时间 2026-09-23 00:10:00,本站每日抓取快照并留存历史。 榜单仅反映真实用户偏好,不构成技术评测结论。 相关榜单:社区榜单(工具热度榜与开源模型下载榜)、 模型库(按厂商 / 参数 / 下载量筛选)。
常见问题
视频编辑和文生视频有什么区别?
文生视频是从零生成;视频编辑是在已有视频上按指令改造,强调保留原视频的叙事与主体、只改动指定部分。后者更贴近真实的后期需求。
这个维度为什么模型这么少?
该能力较新,具备完整视频编辑能力并参与对战的模型本身就少。在榜条目少、样本量低,因此名次波动会比其他维度更明显。
当前阶段可以用于生产吗?
适合创意验证与素材实验。受限于一致性、时长与算力成本,建议先在小批量素材上试验,确认效果满足要求后再考虑进入正式流程。