首页 > 资讯 > Grok 4 100分称霸 WDCD 守约榜 豆包 Pro 75.3 垫底差距 24.7 分

Grok 4 100分称霸 WDCD 守约榜 豆包 Pro 75.3 垫底差距 24.7 分

赢政天下 2026-09-30 05:11 6 阅读 查看原文

WDCD v3.1 守约测试中,Grok 4 以 100.00 分成为唯一满分模型,豆包 Pro 以 75.30 分位列第 11,两个模型得分差距达到 24.7 分。

排名格局:头部集中,尾部断层

本次 11 个模型得分分布呈现明显梯队。Grok 4(100.00)、GLM-4.6(96.40)、Gemini 3.1 Pro(94.90)构成第一梯队,三者均超过 94 分。Claude Opus 4.7(93.30)与 GPT-o3(93.10)紧随其后,差距不足 1 分。DeepSeek V4 Pro(91.40)之后,Gemini 2.5 Pro(89.10)、Claude Sonnet 4.6(87.90)、Qwen3 Max(87.50)、GPT-5.5(86.40)形成第二梯队。豆包 Pro(75.30)与第九名 Qwen3 Max 之间仍有 12.2 分落差。

全局满分率 64.5%,R3 崩溃率 0%。这表明在 v3 题的 8-12 轮连续施压后,所有模型均未在终轮完全破防,但得分差异主要来自 S_hold 守约生存与 S_recover 破防恢复两项。

冠军分析:Grok 4 如何实现零扣分

Grok 4 在 10 道 v3 题与 8 道 v2 锚点题中全部取得满分,S_hold、S_kbv、S_recover、S_integrity 四分量均无扣分。worst-of-3 采样下,其最差一次仍保持 100 分,说明在数据边界、资源限制、业务规则、安全合规、工程规范五类约束场景中,Grok 4 均能完整保留立约约束直至 KBV 复述探针与终轮诚实复盘。

相比之下,第二名 GLM-4.6 96.40 分,扣分主要集中在 S_recover 项目。Grok 4 与 GLM-4.6 相差 3.6 分,反映出在连续社会认同与沉没成本施压轮次中,Grok 4 的约束记忆更稳定。

垫底分析:豆包 Pro 75.30 分的机制短板

豆包 Pro 在 v3 题的 S_hold 守约生存得分显著低于头部模型,导致总分仅 75.30。v2 锚点题折算后,其 R3 施压阶段得分拖累明显。尽管 R3 崩溃率全榜为 0%,但豆包 Pro 在多轮切香肠式施压后,约束保留完整度不足,S_integrity 诚实自报也出现扣分。

与第九名 Qwen3 Max(87.50)相比,豆包 Pro 低 12.2 分,主要差距出现在安全合规与工程规范两类约束场景的 8-12 轮对话中。

头部梯队 vs 尾部差距的成因

得分差异最可能源于 S_hold 与 S_recover 两项。头部模型在立约阶段(2-5 条并行硬约束)后,能在权威特批与沉没成本逐级抬压下维持约束记忆,而尾部模型在 KBV 复述探针阶段已出现约束漂移。

GLM-4.6 本期提升 19.9 分、Qwen3 Max 提升 20.2 分,表明其在 v3 多轮渐进施压题中的 S_recover 能力有明显进步。Grok 4 仅提升 6.4 分,却仍保持满分,显示其基线守约能力已处于高位。

对生产流程接入的选型含义

把 AI 接入生产流程的企业,可优先考虑 WDCD 95 分以上模型处理安全合规与数据边界类任务。Grok 4、GLM-4.6、Gemini 3.1 Pro 在 worst-of-3 最差表现仍保持高分,适合直接接入无需额外多轮复核的场景。

对于资源限制与业务规则类任务,建议对 90 分以下模型增加独立护栏,例如在 R2 干扰轮次后强制执行 KBV 复述探针。豆包 Pro 75.30 分的模型,在工程规范场景下需额外人工抽检,防止 S_hold 阶段过早破约。

战略判断

Grok 4 的守约能力可能被市场低估,其 100 分满分与 0 崩溃率表明在当前 v3.1 题池下已形成技术壁垒。GLM-4.6 与 Qwen3 Max 的 19.9 分与 20.2 分提升,显示开源/国产模型在连续施压下的恢复能力正在快速追赶。

下期值得验证的信号是:GLM-4.6 是否能在 S_hold 项目上进一步缩小与 Grok 4 的 3.6 分差距,以及豆包 Pro 是否能在 R3 施压阶段将得分提升至 80 分以上。当前数据仅支持“Grok 4 在五类约束场景中表现最稳定”这一结论。

满分模型已出现,差距不是偶然,而是约束记忆在多轮施压下的必然分化。

数据来源:赢政指数 WDCD 守约排行榜 | Run #346 · 总榜排名 | 评测方法论