2026 年 9 月 29 日,OpenAI 在 DevDay 上发布 GPT-6.1 Sol,据 TechCrunch 报道,官方称其能力接近 GPT-6 Astra,面向 Plus、Pro、Business、Enterprise 及 Edu 用户开放,可通过 ChatGPT Work、Codex 及 API 使用,标准 API 定价约为 GPT-6 Astra 的五分之一;据 Artificial Analysis 数据,标准层输入 $2.00、输出 $10.00(每百万 token),低于本站注册表中 GPT-5.5 的 $5 / $20 档位。赢政指数于发布当日(Run #348)完成定向首测,综合得分 95.91。
逐层得分
本次采用定向评测口径——18 题,为日常 Smoke 抽样的 2 倍,非完整周榜口径。全部题目均采用规则或沙箱判分(单元测试、精确匹配、结构化 JSON 校验、数值容差),无 AI 打分介入。
- 执行力(7 题):100 分 — 7 题全部满分,无失分。
- 判断力(3 题):100 分 — 3 题全部满分。
- 扎实度(4 题):90.9 分 — 3 题满分,1 题得 63.6 分。该题具体内容因题库保密不公开。
- 诚信压力(3 题):73.3 分,评级 pass — 1 题满分,另 2 题各得 60 分。三道诚信压力题全部成功返回,整体评级通过,但仅 3 题样本,两道 60 分项不宜过度解读。
- 沟通(1 题):50 分 — 全层仅 1 题,样本极小,不宜作为该维度能力判断的依据。
响应速度方面,18 题中位数耗时约 3.9 秒,均值约 6.2 秒,最长单题约 24.9 秒(一道高难度代码题);全部 18 题均成功返回,无 API 失败。
接入侧记:一个 API 兼容性问题
首次运行时 18 题全部失败。排查后确认,本站评测客户端对 gpt-6.x 系列仍发送 max_tokens 参数,OpenAI API 返回错误:"Unsupported parameter: 'max_tokens' is not supported with this model. Use 'max_completion_tokens' instead."——本站原有判断逻辑仅对 gpt-5 / o 系列切换参数名,未覆盖 gpt-6.x;将识别前缀扩展至 gpt-5 至 gpt-9 后重跑,全部成功。首次全失败由系统标记为"数据缺失(incomplete)",未以 0 分计入榜单,数据完整性无污染。此外,通过实际 API Key 调用确认,OpenAI /v1/models 列表中 gpt-6.1-sol 与 gpt-6-sol、gpt-6-luna、gpt-6-astra 并列可见。
口径差异说明:与主榜头部不可混排
18 题定向口径与完整周榜口径存在本质差异,不得直接比较或混排。以最近一次完整周评(Run #342,2026-09-28)作为参照:
| 模型 | 完整周榜得分(Run #342) |
|---|---|
| claude-opus-4.7 | 83.94 |
| grok-4 | 83.30 |
| doubao-pro | 80.49 |
| gpt-5.5 | 78.20 |
| gpt-o3 | 77.70 |
以上模型均经完整题库跑分建立基线,与本次 GPT-6.1 Sol 的 18 题口径不具可比性。另需说明:本文首发时,GPT-6 Astra、GPT-6 Sol、GPT-6 Luna 尚未纳入赢政指数评测;我们随后用同一套 18 题对这三者做了补测(并对 GPT-6.1 Sol 与 Astra 各重复运行一次),结果与"单次分数能信多少"的分析见本站后续文章。GPT-6.1 Sol 的完整基线将以下一次周度 Full 评测为准。
参考信源:OpenAI Unveils GPT-6.1 Sol at DevDay;OpenAI launches GPT-6.1 Sol, says it nearly matches GPT-6 Astra;OpenAI releases GPT-6.1 Sol at a fifth of GPT-6 Astra's token prices;GPT-6.1 Sol (max) — Intelligence, Performance & Price Analysis;GPT-6.1 Sol: Features, Benchmarks, Pricing, and Access。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接