首页 > 资讯 > Grok 4以95.44分居首:2026-09-21 Smoke快测数据简报

Grok 4以95.44分居首:2026-09-21 Smoke快测数据简报

赢政天下 2026-09-21 03:35 7 阅读 查看原文

2026-09-21 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 95.44 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度,主榜公式为 0.55 × 代码执行 + 0.45 × 材料约束。由于每日样本量较小,单日分数更适合作为监控信号,而不是对模型能力做长期定论。

当日排名

排名 模型 主榜 代码执行 材料约束 诚信
#1 Grok 4 95.44 91.7 100 warn
#2 Gemini 3.1 Pro 95.19 100 89.3 pass
#3 DeepSeek V4 Pro 95.01 100 88.9 pass
#4 豆包 Pro 90.62 91.7 89.3 pass
#5 Gemini 2.5 Pro 85.63 91.7 78.2 pass
#6 GPT-o3 81.44 75 89.3 pass
#7 GPT-5.5 76.44 75 78.2 pass
#8 Claude Sonnet 4.6 72.5 50 100 pass
#9 Qwen3 Max 72.25 58.3 89.3 pass
#10 Claude Opus 4.7 70.77 55.6 89.3 pass

数据解读

今日赢政指数 Smoke 快测中,头部模型在代码执行与材料约束的搭配上呈现不同特征。Grok 4 主榜 95.44,代码执行 91.7,材料约束 100,其材料约束得分突出。Gemini 3.1 Pro 主榜 95.19,代码执行 100,材料约束 89.3,代码执行维度达到满分。DeepSeek V4 Pro 主榜 95.01,代码执行 100,材料约束 88.9,同样依赖代码执行高分支撑。豆包 Pro 主榜 90.62,代码执行 91.7,材料约束 89.3,两种维度较为均衡。

与上一同口径 run 相比,部分模型出现明显波动。Claude Opus 4.7 主榜-26.2分,代码执行-44.4分。Grok 4 主榜+20.1分,代码执行+17.4分,材料约束+23.3分。Gemini 3.1 Pro 主榜+19.8分,代码执行+25.7分,材料约束+12.6分。DeepSeek V4 Pro 主榜+19.2分,代码执行+25分,材料约束+12.2分。Gemini 2.5 Pro 主榜+18.4分,代码执行+41.7分,材料约束-10.1分。

异常信号方面,GPT-5.5 主榜暴跌 -10.1 分,Claude Sonnet 4.6 主榜暴跌 -17 分,Qwen3 Max 主榜暴跌 -17.3 分,Claude Opus 4.7 主榜暴跌 -26.2 分,这些变化可能源于题目抽样波动或真实退化,需后续 run 复核确认。GLM-4.6 数据不完整,已进入自动补跑,本期不参与排名。Smoke 作为小样本单日信号,上述观察仅供参考。

主要变化

  • Claude Opus 4.7:主榜下降26.2分,代码执行-44.4分
  • Grok 4:主榜上升20.1分,代码执行+17.4分,材料约束+23.3分,诚信pass→warn
  • Gemini 3.1 Pro:主榜上升19.8分,代码执行+25.7分,材料约束+12.6分
  • DeepSeek V4 Pro:主榜上升19.2分,代码执行+25分,材料约束+12.2分
  • Gemini 2.5 Pro:主榜上升18.4分,代码执行+41.7分,材料约束-10.1分

需要关注的信号

  • GPT-5.5:主榜暴跌 -10.1 分
  • Claude Sonnet 4.6:主榜暴跌 -17 分
  • Qwen3 Max:主榜暴跌 -17.3 分
  • Claude Opus 4.7:主榜暴跌 -26.2 分
  • GLM-4.6:数据不完整(缺 execution,grounding,judgment,integrity,communication 维度,API 故障/超时),已进入自动补跑,本期不参与排名

读这类 Smoke 简报时,重点应放在两个问题上:第一,某个模型是否连续多日暴露同一类弱点;第二,诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化,可能来自题目抽样,也可能是真实退化的早期信号,需要后续 run 复核。


数据来源:赢政指数 (YZ Index) | Run #332 | 查看原始数据