首页 > 资讯 > GPT-5.5主榜暴跌21.4分 代码执行从97跌至75

GPT-5.5主榜暴跌21.4分 代码执行从97跌至75

赢政天下 2026-09-13 03:37 3 阅读 查看原文

GPT-5.5在今日Smoke评测中主榜得分从82.29分降至60.87分,单日下跌21.4分。

核心维度得分对比

代码执行维度从昨日97.00分跌至75.00分,降幅22分;材料约束维度从64.30分跌至43.60分,降幅20.7分。工程判断(侧榜,AI辅助评估)保持100.00分不变,任务表达(侧榜,AI辅助评估)从91.70分降至81.70分。

数据事实与成因分析

Smoke评测每日仅10题,每维度2题,样本量小导致单日波动正常。GPT-5.5本次两个主榜维度同时出现20分以上跌幅,远超典型抽签波动范围。代码执行与材料约束双双大幅下滑,表明模型在本次抽取题目上对指令执行的精确度和对给定材料的忠实度均出现明显下降。

工程判断维度零波动显示模型在侧榜任务上仍能保持满分水准,任务表达维度仅下降10分,说明问题主要集中在主榜可审计维度。诚信评级维持pass,未触发门槛警示。

对使用者的含义

重代码执行的团队需立即降低对GPT-5.5的依赖,尤其在需要高精度脚本生成或复杂逻辑验证的场景。材料约束敏感的场景(如合同审查、代码审查、知识库问答)风险上升,43.60分意味着模型更容易偏离给定材料。

工程判断保持满分对需要决策辅助的开发者仍有参考价值,但主榜崩盘已使整体可用性受限。

战略判断

本次21.4分跌幅已超出Smoke评测正常波动区间,值得下期重点验证。若下一日得分仍维持在60分附近,则GPT-5.5主榜能力可能出现真实退化;若快速回升,则本次为典型小样本抽签事件。当前数据不支持继续将GPT-5.5列为主力候选模型。

主榜仅由代码执行与材料约束构成,两个维度同时失守直接导致整体排名下滑。工程判断与任务表达的相对稳定无法弥补主榜缺口。

代码执行75.00分与材料约束43.60分构成的60.87分主榜,已低于多数同类模型日常水平。

选型企业应优先观察后续3次Smoke结果,再决定是否调整部署策略。依赖GPT-5.5的开发者需准备备选模型,以应对可能持续的主榜低位。


数据来源:赢政指数 (YZ Index) | Run #320 | 查看原始数据