首页 > 资讯 > GPT-6.1 Sol 接入实录:max_tokens 让首跑 18 题全军覆没

GPT-6.1 Sol 接入实录:max_tokens 让首跑 18 题全军覆没

赢政天下 2026-09-30 12:04 4 阅读 查看原文

2026-09-30,赢政指数在 GPT-6.1 Sol 发布后数小时内完成接入,触发 Run #348(18 题定向评测,执行力·扎实度·判断力·诚信压力·沟通五层覆盖,为日常 Smoke 的 2 倍题量)。修复接入问题后的完整运行,18 题全部成功返回、无 API 失败,单题响应中位数 3.9 秒、均值 6.2 秒、最长 24.9 秒,综合得分 95.91(18 题定向口径,非完整周榜口径;完整基线将在下次 Full 评测产出)。但在这个数字之前,我们先经历了一次干净的全面失败。

现象:5 层 18 题,API 全部返回 400

首次运行,所有评测层的 API 调用无一进入推理阶段,均以 HTTP 400 失败,返回消息完全一致:

"Unsupported parameter: 'max_tokens' is not supported with this model. Use 'max_completion_tokens' instead."

没有任何一道题收到模型回复。

根因与修复:前缀枚举型白名单的固有盲区

本站评测客户端通过模型 ID 前缀决定使用哪个 token 限制参数:gpt-5 系列和 o 系列已切换为 max_completion_tokens,其余模型保留旧字段 max_tokens。问题在于,gpt-6.x 既不匹配 gpt-5 白名单,也不属于 o 系列,因此走了旧路径,直接触发 400。

修复方式直接:将前缀匹配范围从"gpt-5.x + o 系列"扩展为"gpt-5.x 至 gpt-9.x + o 系列",覆盖当前及未来数代 GPT 命名。重跑后 18 题全部正常返回。

更根本的建议是放弃按版本号枚举白名单的整体思路——这是一种"追更型"设计,每代新模型发布都需要人工修改代码,遗漏几乎不可避免。若不确定边界,一个更稳的做法是对 Chat Completions 调用统一使用 max_completion_tokens,而不是维护型号白名单;但请在你实际使用的每个模型上先验证再上线。公开 issue 追踪器上已有多个开源集成项目记录了接入 gpt-6 系列时完全相同的 400 报错与修复路径。

失败记为"缺失"而非 0 分,不写入公开榜单

本站评测系统区分两类失败:模型参与了评测但答错,记为对应分数;API 调用全量失败导致数据不可用,记为该层数据缺失(incomplete),不参与任何聚合计算,不写入公开榜单。Run #348 首跑因参数错误触发全量 API 失败,系统自动标记为缺失状态,修复后重跑的数据才作为有效数据公示。这一设计的出发点是:一个因接入错误而失败的模型,不应在榜单上留下一个虚假的低分记录,进而影响横向比较。

官方接入规格(多源交叉核实)

以下规格来自 OpenAI 官方开发者文档(developers.openai.com/api/docs/models/gpt-6.1-sol),并经 The Rundown AI 与 DataCamp 报道交叉确认一致:

Model ID gpt-6.1-sol
上下文窗口 1,050,000 token
最大输出 128,000 token
输入模态 文本、图像
Token 限制参数 max_completion_tokens(max_tokens 返回 400)
推理强度 reasoning_effort:low / medium(默认)/ high / xhigh / max;不支持 none 和 minimal
温度参数 仅接受默认值 1(我们实测:传入 temperature=0.2 返回 400,"Only the default (1) value is supported";官方模型页未说明)
工具调用 须通过 Responses API;Chat Completions 接口不支持工具调用
知识截止 2026-04-30

据 The Rundown AI 与 DataCamp 报道(两份数字一致),标准用量(输入 ≤ 272,000 token)定价为输入 $2.00、输出 $10.00(每百万 token);当单次请求输入超过 272,000 token 时,整个请求的输入费率升至 $4.00,输出费率升至 $15.00——注意是整个请求按高费率计算,而非仅超出部分,超长上下文场景的成本估算需单独处理。

Codex 与 ChatGPT Work 可用性

据 DataCamp 报道,GPT-6.1 Sol 面向 Plus、Pro、Business、Enterprise 及 Edu 账户开放,可通过 ChatGPT 桌面应用、Codex CLI 及 IDE 插件(VS Code、JetBrains 等)调用;Free 和 Go 计划不包含该模型。OpenAI 官方公告称该模型同时在 ChatGPT Work 和 Codex 中可用。本站用同一 API Key 实测 /v1/models 端点,可见 gpt-6.1-sol、gpt-6-sol、gpt-6-luna、gpt-6-astra 并列,后三者我们随后也用同一套 18 题做了补测(见本站后续文章),使用前需确认 ID 拼写。

迁移检查清单

  • 替换 token 限制参数:将 max_tokens 替换为 max_completion_tokens;若不确定模型覆盖范围,考虑统一使用后者,并在每个在用模型上验证。
  • 扩宽前缀匹配范围:如使用条件分支区分模型族,将匹配条件从"gpt-5.x + o 系列"扩展到"gpt-5.x 至 gpt-9.x + o 系列",覆盖未来子版本,避免每代重复修改。
  • 不要传自定义 temperature:我们实测该模型只接受默认值 1,传 0.2 会返回 400;沿用旧代码里的低温度设置会直接失败。
  • 工具调用迁移:function calling 及内置工具(web search、code interpreter 等)须通过 Responses API 调用;依赖 Chat Completions 工具调用的代码路径将直接失效。
  • 推理强度参数审查:reasoning_effort 仅接受 low / medium / high / xhigh / max;代码中传入 none 或 minimal 将报错,需删除或替换为最低有效值 low。
  • 长上下文费率断点:272,000 token 为费率切换点,超出后整个请求按高费率计算,提前在成本估算逻辑中加入分段处理。
  • API 失败分类处理:区分参数错误(400,应立即中止并告警)与能力边界失败(可视业务降级);避免将 API 失败静默累计为 0 分,防止污染下游评分或分析数据。
  • 模型 ID 核实:发布期间模型 ID 可能存在别名或快照变化,建议通过 /v1/models 端点实时核实,不依赖文档截图中的字符串。

参考信源:GPT-6.1 Sol Model — OpenAI Developer Docs;GPT-6.1 Sol: Features, Pricing, Context Window & Alternatives;GPT-6.1 Sol: Features, Benchmarks, Pricing, and Access — DataCamp;Graker does not support GPT-6 models due to deprecated max_tokens — GitHub;OpenAI 400 BadRequestError when using newer models — GitHub/honcho。