GPT-6.1 Sol 首测:18题88分,执行力98.7 OpenAI 官方账号@OpenAIDevs 今日发布公告,称 GPT-6.1 Sol 可为编码代理提供更大工作空间,在编码、计算机使用及跨应用工作流场景表现强劲,且成本低于 GPT-6 Astra。该模型刚完成官方更新,赢政天下随即启动 18 题定向评测,题量为日常 Smoke 测试的两倍。 本次评测为快速定向口径,综合分定格在 88。执行力得分 98.7,展现出极高的任务完成稳定性;扎实度为 74.8,反映模型在细节处理与长程一致性上的表现;诚信评级通过(pass)。上述全部数据严格来自 18 题定向测试,未进行任何外推或补全。 需要明确的是,此次 18 题评测并非完整周榜口径,样本规模与难度分布均与全量基线存在差异。当前主榜前十(最近一次完整周评结果)中,claude-opus-4.7 位列 83.9,grok-4 为 83.3,doubao-pro 80.5,其余依次为 gpt-5.5(78.2)、gpt-o3(77.7)、claude-sonnet-4.6(76.4)、gemini-3.1-pro(75.5)、deepseek-v4-pro(75.2)、gemini-2.5-pro(74)、qwen3-max(68.7)。这些分数均基于完整周度评测,与本次 18 题定向结果不可直接混排对照,仅供粗略参考。 官方公告强调的编码与计算机使用能力,在本次定向测试中得到一定印证,但 18 题样本量有限,无法覆盖周榜全场景。扎实度 74.8 与执行力 98.7 的分差,也提示模型在不同维度仍存在优化空间。 赢政天下后续将按既定计划,于下周启动完整周度 Full 评测,覆盖更大题量与更全面维度,以给出与主榜口径一致的最终定位。届时将同步发布详细子项拆解与跨模型对比。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接