首页 > 资讯 > Gemini 2.5 Pro以88.21分居首:2026-09-06 Smoke快测数据简报

Gemini 2.5 Pro以88.21分居首:2026-09-06 Smoke快测数据简报

赢政天下 2026-09-06 03:35 3 阅读 查看原文

2026-09-06 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 2.5 Pro 以 88.21 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度,主榜公式为 0.55 × 代码执行 + 0.45 × 材料约束。由于每日样本量较小,单日分数更适合作为监控信号,而不是对模型能力做长期定论。

当日排名

排名 模型 主榜 代码执行 材料约束 诚信
#1 Gemini 2.5 Pro 88.21 90.1 85.9 pass
#2 Gemini 3.1 Pro 79.19 86.7 70 pass
#3 DeepSeek V4 Pro 77.44 91.7 60 pass
#4 GPT-o3 72.75 75 70 pass
#5 Grok 4 68.66 75 60.9 pass
#6 Claude Sonnet 4.6 68.32 70.3 65.9 pass
#7 GPT-5.5 67.75 70 65 pass
#8 豆包 Pro 66.16 50 85.9 pass
#9 GLM-4.6 63.66 70 55.9 pass
#10 Claude Opus 4.7 61.25 50 75 pass
#11 Qwen3 Max 57.33 54.4 60.9 warn

数据解读

今日赢政指数 Smoke 快测中,Gemini 2.5 Pro 以主榜 88.21 位居首位,其代码执行 90.1 与材料约束 85.9 形成均衡搭配,Gemini 3.1 Pro 主榜 79.19、代码执行 86.7、材料约束 70 则显示代码执行相对突出。DeepSeek V4 Pro 主榜 77.44、代码执行 91.7、材料约束 60,体现代码执行强势而材料约束偏弱的结构特点。GPT-o3 主榜 72.75、代码执行 75、材料约束 70,整体搭配较为均衡。

与上一同口径 run 相比,Gemini 2.5 Pro 主榜+31.4分、代码执行+40.1分、材料约束+20.7分,DeepSeek V4 Pro 主榜+16.6分、代码执行+41.7分、材料约束-14.2分,Claude Opus 4.7 主榜-24.9分、代码执行-50分、材料约束+5.8分,GPT-o3 主榜-17.9分、代码执行-25分、材料约束-9.2分,豆包 Pro 主榜-17.8分、代码执行-46分、材料约束+16.7分。异常信号显示无,上述分数变化可能源于题目抽样波动,也可能反映真实退化,需后续 run 复核以确认信号稳定性。

Smoke 作为小样本单日信号,上述解读仅基于当日数据结构进行描述,未对模型长期表现作出判断。

主要变化

  • Gemini 2.5 Pro:主榜上升31.4分,代码执行+40.1分,材料约束+20.7分
  • Claude Opus 4.7:主榜下降24.9分,代码执行-50分,材料约束+5.8分
  • GPT-o3:主榜下降17.9分,代码执行-25分,材料约束-9.2分
  • 豆包 Pro:主榜下降17.8分,代码执行-46分,材料约束+16.7分
  • DeepSeek V4 Pro:主榜上升16.6分,代码执行+41.7分,材料约束-14.2分

需要关注的信号

  • 本次未保留可发布的异常信号。

读这类 Smoke 简报时,重点应放在两个问题上:第一,某个模型是否连续多日暴露同一类弱点;第二,诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化,可能来自题目抽样,也可能是真实退化的早期信号,需要后续 run 复核。


数据来源:赢政指数 (YZ Index) | Run #310 | 查看原始数据