AI编程能力排行榜
本榜收录编程开发(code)维度在榜的 20 个模型,按 Elo 得分降序排列,当前榜首为 GPT 6 Astra Max(OpenAI),得分 1800。该维度的对战题目以代码生成、调试与工程实现为主,反映模型在真实编码任务上的相对胜率,适合作为选择编程助手、IDE 插件或代码 Agent 的参考依据之一。
编程开发 · 完整榜单(20 个模型)
按 Elo 得分降序| 排名 | 模型 | 厂商 / 国家 | Elo 得分 | 置信区间 | 投票数 |
|---|---|---|---|---|---|
| 1 |
GPT 6 Astra Max
|
OpenAI
|
1800 | ±16 | 2,281 |
| 2 |
Claude Fable 5.1 Max
|
Anthropic
|
1758 | ±14 | 3,036 |
| 3 |
Claude Opus 5 Max
|
Anthropic
|
1687 | ±7 | 12,087 |
| 4 |
Qwen3.8 Max 0902
|
Alibaba
|
1681 | ±15 | 2,262 |
| 5 |
Kimi K3 Max
|
Moonshot
|
1674 | ±11 | 4,547 |
| 6 |
Qwen3.8 Max
|
Alibaba
|
1671 | ±12 | 3,221 |
| 7 |
Claude Opus 5 High
|
Anthropic
|
1660 | ±7 | 12,566 |
| 8 |
Muse Spark 1.3 Max
|
Meta
|
1652 | ±12 | 2,972 |
| 9 |
Qwen3.8 Flash Next
|
Alibaba
|
1635 | ±13 | 2,779 |
| 10 |
Claude Fable 5 High
|
Anthropic
|
1628 | ±7 | 10,081 |
| 11 |
Hy4 Preview
|
Tencent
|
1624 | ±13 | 2,321 |
| 12 |
muse-spark-1.3 (xHigh)
|
Meta
|
1623 | ±14 | 2,123 |
| 13 |
Grok 4.6 High
|
SpaceXAI
|
1618 | ±10 | 4,282 |
| 14 |
gpt-5.6-sol-xhigh (codex-harness)
|
OpenAI
|
1617 | ±7 | 11,916 |
| 15 | Z GLM 5.3 Max |
Z.ai
|
1614 | ±11 | 3,725 |
| 16 |
DeepSeek V4.1 Flash Max
|
DeepSeek
|
1614 | ±17 | 1,361 |
| 17 | Z GLM 5.3 Flash |
Z.ai
|
1607 | ±12 | 2,925 |
| 18 |
Qwen3.8 27b
|
Alibaba
|
1593 | ±9 | 4,913 |
| 19 | Z GLM 5.2 Max |
Z.ai
|
1592 | ±7 | 10,516 |
| 20 |
Gemini 3.7 Flash High
|
Google
|
1587 | ±12 | 3,007 |
本榜国家与厂商分布
编程开发维度:20 个模型,来自 10 家厂商(按数量列前 8 家)
本维度在榜 20 个模型,来自 10 家厂商,厂商分布较分散,数量最多的 Anthropic 也只占 20%。国家分布上,中国厂商 10 席、美国厂商 10 席;中国厂商占本维度 50%,高于全部 11 个维度的整体水平(24%)。榜首 GPT 6 Astra Max(OpenAI)得分 1800,领先第 2 名 42 分;其中 13 个模型置信区间在 ±11 以上(对战样本偏少),名次仍有变动空间。
榜单说明
排序依据:按 Elo 得分降序。得分由真实用户在不知模型身份的前提下对两组回答二选一(盲评对战),经 Elo 算法累积计算, 代表相对胜率而非绝对能力值。置信区间越小表示对战样本越充足;投票数为该模型的累计有效对战场次。 不同维度之间的分数不可横向比较(例如编程维度榜首约 1800 分、文本对话维度榜首约 1506 分,并不代表编程模型更强)。 国家标识依据模型归属厂商判定,同一厂商的多个版本归为同一国家。 数据来源:arena-ai-leaderboards 公开接口,最近抓取时间 2026-09-23 00:10:00,本站每日抓取快照并留存历史。 榜单仅反映真实用户偏好,不构成技术评测结论。 相关榜单:社区榜单(工具热度榜与开源模型下载榜)、 模型库(按厂商 / 参数 / 下载量筛选)。