首页 > 资讯 > GPT-6.1 Sol主榜暴跌9.2分 代码执行单日降16.7分

GPT-6.1 Sol主榜暴跌9.2分 代码执行单日降16.7分

赢政天下 2026-10-03 03:36 6 阅读 查看原文

GPT-6.1 Sol在今日Smoke评测中主榜得分从86.25分跌至77.07分,代码执行维度从75.00分降至58.30分,降幅16.7分。

得分对比数据

昨日代码执行75.00分、材料约束100.00分、工程判断100.00分、任务表达72.50分,主榜86.25分。今日代码执行58.30分、材料约束100.00分、工程判断100.00分、任务表达87.50分,主榜77.07分。诚信评级维持pass。

数据事实拆解

主榜下降9.2分完全由代码执行维度拉动,材料约束与工程判断零变化,任务表达反而上升15分。Smoke评测每日仅10题,每维度2题,单题得分权重高,2题失误即可造成维度分数大幅波动。

成因分析

代码执行维度今日58.30分最可能源于抽签到的2道题目难度或类型与昨日不同。材料约束与工程判断保持满分,说明模型基础能力未出现系统性退化。任务表达得分上升,显示模型在表达维度上对今日题目适应性更好。单日10题测试的固有方差,足以解释16.7分降幅,无需假设模型真实能力下降。

对使用者的含义

重度依赖代码执行的开发团队,在Smoke评测波动日需增加人工复核环节,避免直接采纳模型生成的代码片段。材料约束保持满分的模型,仍可用于需要严格忠实原文的场景。任务表达得分上升,对需要清晰输出的产品文档生成场景提供正面信号。

战略判断

本次主榜下跌属于Smoke评测正常范围内的单日波动,代码执行维度16.7分降幅未伴随其他维度同步下滑,暂不构成需要立即关注的退化信号。下期评测若代码执行维度继续低于65分,则需验证是否进入持续低位区间。

企业选型时,GPT-6.1 Sol代码执行维度的历史中位数仍高于多数竞品,单日数据不应改变整体评估。开发者可继续使用该模型处理非关键代码任务,但对生产环境代码生成建议保留人工校验流程。

材料约束维度持续满分,证明模型在约束遵循方面保持稳定输出。工程判断维度同样维持100.00分,适合需要工程决策辅助的场景。任务表达维度从72.50分升至87.50分,显示模型在表达任务上具备即时适应能力。

综合今日全部维度数据,GPT-6.1 Sol未出现跨维度系统性下滑,仅代码执行维度受限于测试题量产生较大方差。下一轮Smoke评测结果将提供更清晰的波动性质判断依据。


数据来源:赢政指数 (YZ Index) | Run #358 | 查看原始数据