AI编程能力排行榜

编程开发 · code

本榜收录编程开发(code)维度在榜的 20 个模型,按 Elo 得分降序排列,当前榜首为 GPT 6 Astra Max(OpenAI),得分 1800。该维度的对战题目以代码生成、调试与工程实现为主,反映模型在真实编码任务上的相对胜率,适合作为选择编程助手、IDE 插件或代码 Agent 的参考依据之一。

数据同步时间: 4 小时同步一次 本榜 20 个模型 11 个能力维度 排序依据:Elo 得分 ↓
文本对话 编程开发 视觉理解 文生图 图像编辑 文生视频 图生视频 文档理解 联网搜索 智能体 视频编辑

编程开发 · 完整榜单(20 个模型)

按 Elo 得分降序
排名 模型 厂商 / 国家 Elo 得分 置信区间 投票数
1 GPT 6 Astra Max 美国 OpenAI 1800 ±16 2,281
2 Claude Fable 5.1 Max 美国 Anthropic 1758 ±14 3,036
3 Claude Opus 5 Max 美国 Anthropic 1687 ±7 12,087
4 Qwen3.8 Max 0902 中国 Alibaba 1681 ±15 2,262
5 Kimi K3 Max 中国 Moonshot 1674 ±11 4,547
6 Qwen3.8 Max 中国 Alibaba 1671 ±12 3,221
7 Claude Opus 5 High 美国 Anthropic 1660 ±7 12,566
8 Muse Spark 1.3 Max 美国 Meta 1652 ±12 2,972
9 Qwen3.8 Flash Next 中国 Alibaba 1635 ±13 2,779
10 Claude Fable 5 High 美国 Anthropic 1628 ±7 10,081
11 Hy4 Preview 中国 Tencent 1624 ±13 2,321
12 muse-spark-1.3 (xHigh) 美国 Meta 1623 ±14 2,123
13 Grok 4.6 High 美国 SpaceXAI 1618 ±10 4,282
14 gpt-5.6-sol-xhigh (codex-harness) 美国 OpenAI 1617 ±7 11,916
15 Z GLM 5.3 Max 中国 Z.ai 1614 ±11 3,725
16 DeepSeek V4.1 Flash Max 中国 DeepSeek 1614 ±17 1,361
17 Z GLM 5.3 Flash 中国 Z.ai 1607 ±12 2,925
18 Qwen3.8 27b 中国 Alibaba 1593 ±9 4,913
19 Z GLM 5.2 Max 中国 Z.ai 1592 ±7 10,516
20 Gemini 3.7 Flash High 美国 Google 1587 ±12 3,007
置信区间图例:绿色 ±5 以内(样本充足,排名稳定)· 灰色 ±6~10(一般)· 橙色 ±11 以上(样本偏少,排名可能变动)。 厂商 logo 与国旗依据数据源给出的厂商标识匹配,未收录 logo 的厂商显示首字母占位。

本榜国家与厂商分布

编程开发维度:20 个模型,来自 10 家厂商(按数量列前 8 家)

本维度在榜 20 个模型,来自 10 家厂商,厂商分布较分散,数量最多的 Anthropic 也只占 20%。国家分布上,中国厂商 10 席、美国厂商 10 席;中国厂商占本维度 50%,高于全部 11 个维度的整体水平(24%)。榜首 GPT 6 Astra Max(OpenAI)得分 1800,领先第 2 名 42 分;其中 13 个模型置信区间在 ±11 以上(对战样本偏少),名次仍有变动空间。

美国美国
10 席
中国中国
10 席
Anthropic
4 个模型
Alibaba
4 个模型
Z Z.ai
3 个模型
OpenAI
2 个模型
Meta
2 个模型
Moonshot
1 个模型
Tencent
1 个模型
SpaceXAI
1 个模型

榜单说明

排序依据:按 Elo 得分降序。得分由真实用户在不知模型身份的前提下对两组回答二选一(盲评对战),经 Elo 算法累积计算, 代表相对胜率而非绝对能力值。置信区间越小表示对战样本越充足;投票数为该模型的累计有效对战场次。 不同维度之间的分数不可横向比较(例如编程维度榜首约 1800 分、文本对话维度榜首约 1506 分,并不代表编程模型更强)。 国家标识依据模型归属厂商判定,同一厂商的多个版本归为同一国家。 数据来源:arena-ai-leaderboards 公开接口,最近抓取时间 2026-09-23 00:10:00,本站每日抓取快照并留存历史。 榜单仅反映真实用户偏好,不构成技术评测结论。 相关榜单:社区榜单(工具热度榜与开源模型下载榜)、 模型库(按厂商 / 参数 / 下载量筛选)。

常见问题

这个榜能直接用来选编程助手吗?
可以作为初筛。对战成绩反映的是模型在编码任务上的相对偏好胜率,但实际选型还要考虑工具链集成(是否支持你的 IDE、是否可接入私有代码库)、上下文长度、响应速度与价格。建议先用本榜缩小到 3-5 个候选,再用自有代码库实测。
为什么同一个厂商有多个模型在榜?
同一模型的不同推理档位(如 High / Max / Flash)以及不同版本迭代都会分别参与对战并单独统计,因此会出现同厂商多个条目。选择时可以优先看同一厂商中得分与投票数综合表现更好的版本。
置信区间大的模型还能参考吗?
可以看,但要谨慎。置信区间大说明累计对战样本少,名次可能随时变动。这类模型通常较新或使用量较小,建议结合投票数判断——投票数明显偏低的条目,更适合作为「值得关注」而非「结论」。