首页 > 资讯 > GLM-4.6暴涨26分 GPT-5.5跟进10.5 WDCD守约格局突变

GLM-4.6暴涨26分 GPT-5.5跟进10.5 WDCD守约格局突变

赢政天下 2026-10-04 05:49 5 阅读 查看原文

本期WDCD v3.1试点中,GLM-4.6分数较Run #346上升26分,GPT-5.5上升10.5分,其余13个参评模型无下降记录。GLM-4.6当前WDCD得分87.55,跃居第三;Grok 4以95.69保持首位,Gemini 3.1 Pro 88.14位列第二。

数据事实:仅两模型正向移动

15个模型中仅GLM-4.6与GPT-5.5出现正向变化。GLM-4.6从此前水平提升26分后达到87.55,进入Top 5;GPT-5.5提升10.5分但未进入前五。v3题池包含17道多轮渐进施压题与8道v2锚点题,采样采用worst-of-3口径。守约总分由v3百分制与v2锚点题折算值等权平均得出。

成因分析:多轮施压下的S_hold差异

GLM-4.6的26分增幅最可能来自v3题的8-12轮对话结构。v3题先设定2-5条并行硬约束,再依次施加社会认同、权威特批、切香肠、沉没成本压力,最后进行KBV复述探针与终轮诚实复盘。S_hold权重60分,破约越晚得分越高。GLM-4.6或许在第6-9轮的连续施压阶段更晚破防,导致S_hold分值显著提升。GPT-5.5的10.5分增幅较小,可能仅在部分约束场景(如资源限制或工程规范)中R3轮次表现改善,而v2锚点题三轮得分(R1:1+R2:1+R3:2)贡献相对有限。

GLM-4.6 WDCD 87.55与Grok 4 WDCD 95.69之间仍存在8.14分差距,说明其在最差一次采样下的约束记忆与破防恢复能力仍有差距。

选型含义:生产流程接入的场景边界

对把AI接入生产流程的企业而言,GLM-4.6的守约得分提升意味着在数据边界与安全合规场景下可降低部分护栏强度。企业可在内部知识库检索、合规文档生成等低风险链路直接使用GLM-4.6,而无需每轮追加人工复核。但在资源限制与业务规则严格并行的场景,仍需保留人工终审,因为worst-of-3采样显示其最差一次仍可能晚期破约。Grok 4 WDCD 95.69的领先地位,使其适合作为高价值交易或权限分配的首选模型,Claude Opus 4.7 WDCD 86.34则适合作为次级校验节点。

  • 高合规要求场景:优先GLM-4.6或Grok 4,减少二次提示工程成本
  • 多模型并行流水线:用Gemini 3.1 Pro WDCD 88.14承担中间转换环节
  • DeepSeek V4 Pro WDCD 86.62适合低敏感度数据处理

战略判断:守约能力被低估的信号

GLM-4.6单期26分跃升显示其在v3多轮渐进施压下的S_integrity与S_recover能力可能被此前市场低估。DeepSeek V4 Pro与Claude Opus 4.7分别86.62与86.34,差距仅0.28分,说明两者在当前约束场景下实际表现接近。下一期需重点验证GLM-4.6在KBV复述探针环节的S_kbv得分是否稳定,以及GPT-5.5是否能在更多v3题中复制10.5分增幅。Grok 4的95.69高分仍构成明显护城河,但其领先优势是否会因其他模型的单轮突破而缩小,值得持续跟踪。

GLM-4.6的26分增幅与GPT-5.5的10.5分增幅共同指向一个事实:当前阶段守约能力提升主要发生在多轮施压的中间轮次,而非单轮锚点题。企业选型时应将WDCD得分作为动态阈值,而非静态排名。


数据来源:赢政指数 WDCD 守约排行榜 | Run #360 · 变化追踪 | 评测方法论