GLM-4.6 探针得分 15.00 诚信 fail,主榜 48.25 分材料约束 46.10
2026-09-03 Run#307 中,GLM-4.6 的诚信评级为 fail,探针得分 15.00,主榜得分 48.25,代码执行 50.00,材料约束 46.10。
分数结构拆解
本次 Smoke 快测主榜仅包含代码执行与材料约束两个维度。GLM-4.6 代码执行 50.00 分、材料约束 46.10 分,两者均低于 60,共同拉低主榜至 48.25。诚信探针得分 15.00 属于独立信号,与上述两个维度无直接关联。
同日其余模型全部通过诚信评级:GPT-o3 探针 80.00、豆包 Pro 80.00、GPT-5.5 90.00、Claude Sonnet 4.6 90.00、Gemini 3.1 Pro 80.00、Grok 4 80.00、Claude Opus 4.7 100.00、Qwen3 Max 90.00、Gemini 2.5 Pro 90.00、DeepSeek V4 Pro 80.00。
诚信 fail 的触发机制
诚信评级通过 42 个金丝雀探针检测模型是否将虚构实体当作真实引用。GLM-4.6 探针得分 15.00 表明其在至少部分探针上编造了来源或引用。Smoke 测试明确指出,探针触发与题目难度无关,是独立信号。
历史数据显示,GLM-4.6 在 2026-09-01 Run#304 同样 fail(探针 25.00),2026-09-02 Run#305 为 warn(探针 45.00)。三次测试中两次触发 fail,探针得分持续处于低位。
对使用者的具体影响
材料约束 46.10 分意味着模型在长文档引用核验任务中,未能严格基于给定材料回答并正确引用。依赖精确引用的企业文档处理、法律合同审查、学术文献整理场景将面临较高风险。
代码执行 50.00 分显示真实 Python 沙箱通过率处于中等偏下水平。需要稳定运行数据分析脚本或自动化测试的开发者,需额外增加人工校验环节。
诚信 fail 直接影响需要可验证来源的场景。金融研究报告、政策解读、产品白皮书等输出若出现虚构引用,将导致合规与信任问题。
战略判断
GLM-4.6 当前主榜 48.25 分与材料约束 46.10 分的组合,反映出其在严格材料约束下的表现与代码执行能力均未达到及格线。探针得分 15.00 的独立失败信号,指向模型在引用真实性控制上的系统性不足。
同日通过诚信评级的模型探针得分均在 80 以上,构成明显对比。GLM-4.6 的多次 fail 记录需要持续观察,以确认是否为偶发波动还是持续性问题。
对正在选型的企业而言,GLM-4.6 适合对引用准确性要求较低的内部草稿生成场景;对材料忠实度敏感的生产环境,建议优先选择探针得分 90 以上的模型,并保留人工核验流程。
数据来源:赢政指数 (YZ Index) | Run #307 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接