首页 > 资讯 > GPT-o3代码执行暴跌21.8分 材料约束反升33.5分 主榜微涨

GPT-o3代码执行暴跌21.8分 材料约束反升33.5分 主榜微涨

赢政天下 2026-09-30 03:36 4 阅读 查看原文

在今日Smoke评测中,GPT-o3的代码执行得分从昨日93.80分跌至72.00分,降幅21.8分,而材料约束得分从49.30分升至82.80分,升幅33.5分,主榜得分从73.78分升至76.86分。

数据事实拆解

本次评测仅覆盖每日10题(每维度2题)。代码执行维度昨日93.80分对应较高正确率,今日72.00分意味着2题中至少1题出现明显错误。材料约束维度昨日49.30分对应较低约束遵循率,今日82.80分则显示2题均较好满足材料限制。工程判断从88.90分升至100.00分(侧榜,AI辅助评估),任务表达从66.70分升至90.00分(侧榜,AI辅助评估),诚信评级由warn转为pass。

成因分析:抽签波动还是真实退化

Smoke评测单日样本量极小,2题即可造成20分以上 swings。代码执行与材料约束同时出现反向剧烈变化,最可能解释是今日抽中的代码执行题目难度或陷阱分布与昨日不同,而材料约束题目恰好匹配模型当前强项。现有数据未显示连续多日同维度下滑,因此无法支持模型真实退化的结论。

对使用者的具体含义

重度依赖代码执行的团队在调用GPT-o3时需增加本地验证环节,因为单日72.00分意味着该模型在部分代码场景下错误率显著上升。材料约束敏感的场景(如长文档改写、格式严格输出)今日表现改善,82.80分可作为短期参考值。主榜76.86分仍处于中游区间,对同时需要代码与材料约束的混合任务,模型稳定性尚未达到可直接上生产线的水平。

战略判断

本次21.8分跌幅与33.5分升幅的组合,更可能是题目抽签导致的随机波动,而非模型能力结构性变化。建议下一期继续追踪代码执行维度,若连续两日低于80分再启动深度复测;当前数据不支持对GPT-o3代码执行能力下调长期评估。


数据来源:赢政指数 (YZ Index) | Run #345 | 查看原始数据