首页 > 资讯 > 豆包 Pro以95.52分居首:2026-10-01 Smoke快测数据简报

豆包 Pro以95.52分居首:2026-10-01 Smoke快测数据简报

赢政天下 2026-10-01 03:35 9 阅读 查看原文

2026-10-01 赢政指数 Smoke 快测覆盖 15 个模型,豆包 Pro 以 95.52 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度,主榜公式为 0.55 × 代码执行 + 0.45 × 材料约束。由于每日样本量较小,单日分数更适合作为监控信号,而不是对模型能力做长期定论。

当日排名

排名 模型 主榜 代码执行 材料约束 诚信
#1 豆包 Pro 95.52 94.3 97 pass
#2 GPT-6 Sol 89.56 95 82.9 pass
#3 GPT-6 Astra 88.57 95 80.7 pass
#4 GPT-6.1 Sol 88.57 95 80.7 pass
#5 Grok 4 88.39 100 74.2 pass
#6 Claude Sonnet 4.6 87.89 95 79.2 pass
#7 Claude Opus 4.7 86.25 75 100 pass
#8 GLM-4.6 84 75 95 pass
#9 DeepSeek V4 Pro 81.25 70 95 pass
#10 Gemini 3.1 Pro 81.25 70 95 pass
#11 GPT-o3 77.39 75 80.3 pass
#12 Gemini 2.5 Pro 77.16 70 85.9 pass
#13 GPT-6 Luna 77.16 70 85.9 pass
#14 Qwen3 Max 77.16 70 85.9 pass
#15 GPT-5.5 70.25 50 95 pass

数据解读

从分数结构分析,豆包 Pro 以主榜 95.52 分领先,代码执行 94.3 分和材料约束 97 分形成均衡搭配。GPT-6 Sol 主榜 89.56 分,代码执行 95 分但材料约束 82.9 分。Grok 4 代码执行 100 分、材料约束 74.2 分,主榜 88.39 分。Claude Opus 4.7 则材料约束 100 分、代码执行 75 分,主榜 86.25 分。GLM-4.6 主榜 84 分,代码执行 75 分与材料约束 95 分的组合也较为突出。这些头部模型在代码执行与材料约束的强弱搭配上各有侧重。

与上一同口径 run 相比,GLM-4.6 主榜 +31.4 分,代码执行 +53 分,材料约束 +5 分。豆包 Pro 主榜 +25 分,代码执行 +22.3 分,材料约束 +28.3 分。DeepSeek V4 Pro 主榜 +24.2 分,代码执行 +48 分,材料约束 -5 分。Grok 4 主榜 +19.6 分,代码执行 +37 分。Gemini 2.5 Pro 主榜 +13.3 分,代码执行 +20 分,材料约束 +5 分。这些变化显示出单日测试中部分模型指标的明显起伏。

异常信号包括 Qwen3 Max 代码执行暴跌 -24 分以及 GPT-5.5 代码执行暴跌 -22 分。可能解释为题目抽样波动或真实退化,但需后续 run 复核。Smoke 是小样本单日信号,相关分析保持克制,不做长期结论。

主要变化

  • GLM-4.6:主榜上升31.4分,代码执行+53分,材料约束+5分
  • 豆包 Pro:主榜上升25分,代码执行+22.3分,材料约束+28.3分
  • DeepSeek V4 Pro:主榜上升24.2分,代码执行+48分,材料约束-5分
  • Grok 4:主榜上升19.6分,代码执行+37分
  • Gemini 2.5 Pro:主榜上升13.3分,代码执行+20分,材料约束+5分

需要关注的信号

  • Qwen3 Max:代码执行暴跌 -24 分
  • GPT-5.5:代码执行暴跌 -22 分

读这类 Smoke 简报时,重点应放在两个问题上:第一,某个模型是否连续多日暴露同一类弱点;第二,诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化,可能来自题目抽样,也可能是真实退化的早期信号,需要后续 run 复核。


数据来源:赢政指数 (YZ Index) | Run #354 | 查看原始数据