首页 > 资讯 > DeepSeek V4 Pro以96.94分居首:2026-10-10 Smoke快测数据简报

DeepSeek V4 Pro以96.94分居首:2026-10-10 Smoke快测数据简报

赢政天下 2026-10-10 03:35 9 阅读 查看原文

2026-10-10 赢政指数 Smoke 快测覆盖 15 个模型,DeepSeek V4 Pro 以 96.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度,主榜公式为 0.55 × 代码执行 + 0.45 × 材料约束。由于每日样本量较小,单日分数更适合作为监控信号,而不是对模型能力做长期定论。

当日排名

排名 模型 主榜 代码执行 材料约束 诚信
#1 DeepSeek V4 Pro 96.94 100 93.2 pass
#2 GPT-6.1 Sol 92.85 100 84.1 pass
#3 Claude Opus 4.7 92.02 98.5 84.1 pass
#4 Gemini 3.1 Pro 91.81 100 81.8 pass
#5 GPT-o3 89.77 98.5 79.1 pass
#6 GPT-6 Astra 88.75 100 75 pass
#7 GPT-6 Luna 88.75 100 75 pass
#8 豆包 Pro 86.91 100 70.9 pass
#9 GPT-5.5 86.91 100 70.9 pass
#10 Claude Sonnet 4.6 82.41 100 60.9 pass
#11 GPT-6 Sol 77.59 100 50.2 pass
#12 Qwen3 Max 76.75 87.5 63.6 pass
#13 Grok 4 75 75 75 warn
#14 Gemini 2.5 Pro 74.18 73.5 75 pass
#15 GLM-4.6 45.66 25 70.9 pass

数据解读

今日赢政指数Smoke快测中,DeepSeek V4 Pro主榜96.94位居首位,代码执行100、材料约束93.2的结构形成突出平衡。GPT-6.1 Sol代码执行100、材料约束84.1,主榜92.85;Gemini 3.1 Pro代码执行100、材料约束81.8,主榜91.81;Claude Opus 4.7代码执行98.5、材料约束84.1,主榜92.02。头部模型代码执行普遍维持高位,材料约束的差异直接影响主榜排序。

GLM-4.6主榜45.66,代码执行25、材料约束70.9,较上一run主榜-31.4分、代码执行-33.3分、材料约束-29.1分。GPT-o3主榜89.77,代码执行98.5、材料约束79.1,较前主榜+18分、代码执行+40.2分。Gemini 3.1 Pro主榜+16.8分、代码执行+25分。Claude Opus 4.7材料约束暴跌-15.9分、GPT-6 Luna材料约束暴跌-20分、豆包Pro材料约束暴跌-29.1分、Claude Sonnet 4.6主榜-12.3分、GPT-6 Sol材料约束暴跌-19.6分,这些异常信号可能来自题目抽样波动或真实退化,需后续run复核确认。Smoke快测为小样本单日信号,措辞保持克制。

主要变化

  • GLM-4.6:主榜下降31.4分,代码执行-33.3分,材料约束-29.1分,诚信warn→pass
  • GPT-o3:主榜上升18分,代码执行+40.2分,材料约束-9.2分
  • Gemini 3.1 Pro:主榜上升16.8分,代码执行+25分,材料约束+6.8分
  • GPT-6 Luna:主榜上升13.9分,代码执行+41.7分,材料约束-20分
  • Claude Sonnet 4.6:主榜下降12.3分,材料约束-27.4分

需要关注的信号

  • Claude Opus 4.7:材料约束暴跌 -15.9 分
  • GPT-6 Luna:材料约束暴跌 -20 分
  • 豆包 Pro:材料约束暴跌 -29.1 分
  • Claude Sonnet 4.6:主榜暴跌 -12.3 分
  • GPT-6 Sol:材料约束暴跌 -19.6 分
  • GLM-4.6:主榜暴跌 -31.4 分

读这类 Smoke 简报时,重点应放在两个问题上:第一,某个模型是否连续多日暴露同一类弱点;第二,诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化,可能来自题目抽样,也可能是真实退化的早期信号,需要后续 run 复核。


数据来源:赢政指数 (YZ Index) | Run #370 | 查看原始数据