GPT-o3在今日Smoke评测中,材料约束从70.00分跌至50.00分,工程判断从100.00分跌至50.00分,主榜得分却从72.75分升至77.50分。
得分变化细节
代码执行从75.00分升至100.00分,任务表达从91.70分升至95.00分,诚信评级维持pass。材料约束与工程判断两项维度各跌20分和50分,抵消了代码执行带来的25分增益后,主榜仍实现4.75分净增长。
成因分析
Smoke评测每日仅10题,每维度2题,样本量极小。材料约束暴跌20分最可能源于今日抽中的2题恰好触及模型在引用原始材料时的弱点,而昨日抽中的2题则未触发该弱点。工程判断从100.00分跌至50.00分同样指向题目抽签波动:工程判断侧重实际部署场景的取舍,单题失误即可导致50分级差。
代码执行升25分则显示模型在今日抽中的代码题上表现稳定或更好。两种维度方向相反的剧烈变化,符合小样本抽签导致的随机波动特征,而非模型参数在一天内发生系统性退化。
对使用者的含义
重度依赖材料忠实度的企业场景,例如合同条款抽取、政策文件比对,将面临GPT-o3今日暴露的50.00分水平风险。开发者在构建RAG流水线时,需额外增加材料约束的校验层,以防单次回答出现大范围遗漏或改写。
代码执行得分升至100.00分的表现,对纯算法实现、重代码生成的任务仍有参考价值。工程判断跌至50.00分则提醒,依赖模型做部署决策的团队应降低对单次输出的信任权重。
战略判断
基于现有得分对比,GPT-o3材料约束与工程判断的同步大跌更可能是抽签波动,而非真实退化。主榜得分上升4.8分的事实也支持这一判断:整体能力未出现系统性下滑。
若下一期Smoke评测中材料约束仍维持在50.00分附近,则需将该维度列为重点观察对象,验证是否存在持续性弱点。目前单日数据不足以支持模型被低估或高估的结论,仅构成需要持续跟踪的信号。
数据来源:赢政指数 (YZ Index) | Run #312 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接