首页 > 资讯 > Gemini 2.5 Pro 材料约束暴跌28分 代码执行却升至100分

Gemini 2.5 Pro 材料约束暴跌28分 代码执行却升至100分

赢政天下 2026-10-03 03:36 7 阅读 查看原文

Gemini 2.5 Pro在今日Smoke评测中,材料约束得分从昨日的100.00分降至72.00分,降幅达到28分,同时代码执行得分从71.90分升至100.00分,主榜得分从84.55分升至87.40分。

得分变化的直接事实

本次评测仅覆盖每日10题,代码执行与材料约束各2题。材料约束单日损失28分,工程判断保持100.00分不变,任务表达从81.70分升至91.70分,诚信评级维持pass。主榜由代码执行与材料约束两个维度加权构成,今日净增2.9分。

题目抽签波动还是模型退化

Smoke评测题目每日随机抽取,2题/维度规模下单题得分权重极高。材料约束昨日满分、今日72分,差值恰好对应单题失分;代码执行昨日71.90分、今日满分,同样符合单题得分拉升。工程判断与任务表达未出现同步下滑,表明模型整体输出框架未崩。仅材料约束一维出现-28分,指向题目对材料忠实度要求的随机加强,而非模型参数级退化。

材料约束与代码执行的反向剧烈波动,在10题快测中属于典型抽样效应。

对使用者的具体影响

依赖材料约束的场景包括长文档摘要、合同条款核对、引用溯源任务。Gemini 2.5 Pro今日72分表现意味着在这些场景下出现材料遗漏或改写的概率上升。重代码执行的团队则可直接受益于100分表现,算法调试与数据处理类任务当日可用性更高。两类场景同时存在的企业需为同一模型准备双重验证流程。

战略判断

主榜得分仍维持在87.40分区间,说明单一维度28分波动未改变整体排序位置。连续多日观察同一模型在材料约束上的标准差,可区分抽样噪声与真实能力漂移。目前仅单日数据支持“抽签导致”的结论,尚未达到需要下调长期选型优先级的阈值。下一期Smoke评测若材料约束继续低于85分,则需启动针对性长文本 grounding 测试。

工程判断与任务表达两个侧榜维度保持稳定或上升,进一步印证主因在于材料约束题目的随机难度,而非模型通用能力下降。企业选型时可将Gemini 2.5 Pro的材料约束表现视为高方差信号,在关键落地场景中增加人工抽检比例。


数据来源:赢政指数 (YZ Index) | Run #358 | 查看原始数据