GPT-5.5代码执行从100暴跌至75 Smoke评测主榜降7.5分
GPT-5.5在今日Smoke评测中代码执行得分从100.00降至75.00,主榜整体从79.12下滑至71.67。
得分变化事实
代码执行维度下降25分,材料约束从53.60升至67.60,工程判断从100.00降至75.00,任务表达从81.70升至90.00,诚信评级维持pass。主榜由代码执行与材料约束加权构成,今日净跌7.5分。
可能成因分析
Smoke评测每日仅10题,2题 per 维度,单题得分权重高。代码执行与工程判断同时下跌25分,指向当日抽中对代码正确性或逻辑一致性要求更高的题目。材料约束上升14分则显示模型在引用限制方面的表现改善,说明并非整体能力退化,而是特定维度受题库抽签影响。
若为模型真实退化,通常会伴随多个维度同步下滑且连续多日出现。目前仅单日数据,无法确认退化趋势。抽签波动概率更高,但25分跌幅已超出日常小幅波动范围。
对使用者的含义
重度依赖代码执行的开发者团队需警惕单日表现不稳。Smoke评测中代码执行75分意味着在涉及复杂逻辑或多步计算的场景中,GPT-5.5出错概率上升。材料约束67.60分则提示该模型在严格引用任务中仍有明显短板,适合对忠实度要求不高的内容生成场景。
工程判断同步下跌25分,对需要模型辅助架构决策或代码审查的项目构成直接风险。任务表达上升8.3分对纯文本输出任务影响较小。
战略判断
本次变化最可能由题目抽签波动造成,但跌幅已达到需要持续跟踪的阈值。下一期Smoke评测若代码执行仍低于85分,则需考虑模型在该维度出现系统性问题。当前数据不支持“模型已退化”的结论,仅支持“单日波动显著”的判断。
选型企业应将GPT-5.5代码执行表现列入每日监控列表,而非立即更换模型。材料约束的改善值得后续验证是否为稳定提升。
数据来源:赢政指数 (YZ Index) | Run #308 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接