GPT-6 Sol 首测:18题定向84分 OpenAI 官方今日宣布,GPT-6 with Intelligent UI 已向 Plus、Pro、Business 和 Enterprise 用户全球推送,GPT-6 Sol 成为上述付费层级的默认模型,Free 与 Go 用户将于明日起陆续获得 GPT-6 Luna 版本。消息发布后数小时,赢政指数随即启动 18 题定向评测,题量为日常 Smoke 测试的两倍,但仍属快速定向口径,并非完整周榜基线。 本次 18 题定向评测结果显示,GPT-6 Sol 综合分达到 84 分。其中执行力 85.7,扎实度 81.8,诚信评级为 pass。三项核心指标均在 18 题限定范围内取得,反映模型在指令遵循、内容完整性与合规表现上的即时水准。由于评测规模仅为常规周榜的一半,上述分数仅供快速参考,完整基线仍需下次周度 Full 评测确认。 与当前主榜前十进行粗略对照时,需特别注意口径差异。主榜最新完整周评中,gpt-6-sol 以 82.2 分位列第一,claude-opus-4.7 为 81.5,gpt-o3 为 80.6,其余依次为 gpt-5.5(80.5)、grok-4(80.4)、gpt-6-astra(80.4)、claude-sonnet-4.6(80.1)、gpt-6-luna(79.4)、gpt-6.1-sol(78.6)和 doubao-pro(76.7)。本次 18 题定向评测的 84 分与主榜 82.2 分不可直接混排,原因在于题量、难度分布与评测时长均存在显著不同。定向测试更侧重即时响应与特定场景执行力,而周度 Full 评测涵盖更广维度与更长周期稳定性。 从已知数据看,GPT-6 Sol 在 18 题口径下的执行力 85.7 高于扎实度 81.8,显示模型在任务拆解与输出结构上反应迅速,但内容深度与一致性仍有提升空间。诚信评级 pass 则表明模型未出现明显越界或虚构行为,符合付费用户对安全性的基础要求。 赢政指数将按既定节奏推进后续评测。下一期周度 Full 评测完成后,gpt-6-sol 的完整基线分数将与现有主榜进行同口径对比,届时 18 题定向结果仅作为前期参考。用户可继续通过 ChatGPT 界面体验 GPT-6 Sol 的 Intelligent UI 功能,实际表现仍以官方逐步开放为准。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接