Gemini 2.5 Pro在今日Smoke评测中,材料约束得分从昨日的100.00分降至72.00分,降幅达到28分,同时代码执行得分从71.90分升至100.00分,主榜得分从84.55分升至87.40分。
得分变化的直接事实
本次评测仅覆盖每日10题,代码执行与材料约束各2题。材料约束单日损失28分,工程判断保持100.00分不变,任务表达从81.70分升至91.70分,诚信评级维持pass。主榜由代码执行与材料约束两个维度加权构成,今日净增2.9分。
题目抽签波动还是模型退化
Smoke评测题目每日随机抽取,2题/维度规模下单题得分权重极高。材料约束昨日满分、今日72分,差值恰好对应单题失分;代码执行昨日71.90分、今日满分,同样符合单题得分拉升。工程判断与任务表达未出现同步下滑,表明模型整体输出框架未崩。仅材料约束一维出现-28分,指向题目对材料忠实度要求的随机加强,而非模型参数级退化。
材料约束与代码执行的反向剧烈波动,在10题快测中属于典型抽样效应。
对使用者的具体影响
依赖材料约束的场景包括长文档摘要、合同条款核对、引用溯源任务。Gemini 2.5 Pro今日72分表现意味着在这些场景下出现材料遗漏或改写的概率上升。重代码执行的团队则可直接受益于100分表现,算法调试与数据处理类任务当日可用性更高。两类场景同时存在的企业需为同一模型准备双重验证流程。
战略判断
主榜得分仍维持在87.40分区间,说明单一维度28分波动未改变整体排序位置。连续多日观察同一模型在材料约束上的标准差,可区分抽样噪声与真实能力漂移。目前仅单日数据支持“抽签导致”的结论,尚未达到需要下调长期选型优先级的阈值。下一期Smoke评测若材料约束继续低于85分,则需启动针对性长文本 grounding 测试。
工程判断与任务表达两个侧榜维度保持稳定或上升,进一步印证主因在于材料约束题目的随机难度,而非模型通用能力下降。企业选型时可将Gemini 2.5 Pro的材料约束表现视为高方差信号,在关键落地场景中增加人工抽检比例。
数据来源:赢政指数 (YZ Index) | Run #358 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接