首页 > 开源 > Cognition 发布 SWE-2:用 Kimi K3 做基座,RL 后训练追平 Fable 5.1

Cognition 发布 SWE-2:用 Kimi K3 做基座,RL 后训练追平 Fable 5.1

OSChina资讯 2026-09-11 10:26 1 阅读 查看原文

Cognition 昨天发布了 SWE-2,一个从 Kimi K3(2.8T 参数)通过 RL 后训练而来的编码 Agent 模型。

它在 FrontierCode 1.1 Main 上拿到 50.0%,距离 Fable 5.1 的 50.9% 只差不到一个百分点,比 GPT-5.6 Sol(47.5%)高 2.5 分。价格比 Fable 5.1 便宜 64%。

FrontierCode 是 Cognition 自家维护的 SWE-bench 升级版。SWE-2 在另一套经典评测 DeepSWE 1.1 上 73.0%,超过了 Fable 5.1(67.4%)和 Grok 4.6(67.5%),也略高于 GPT-5.6 Sol(72.7%)。Terminal-Bench 2.1 更是拉到 92.8%。

但 Terminal-Bench 4 上 SWE-2 只有 27.3%,比 Opus 5(51.8%)和 Astra(57.9%)差了一大截。TB 4 是几周前才发布的新基准,这种新旧基准之间的分数落差,正好成了"benchmaxxing"讨论的靶子。

RL 训练方案是这篇博客最值得看的技术部分。Cognition 的选择是让一个训练任务同时覆盖所有推理努力级别(medium / high / max),努力级别越高推理步数越多、成本越大。奖励函数 R = S − λₑC,S 是任务成功与否(0 或 1),C 是美元成本加 rollout 时间。他们把 λₑ 设成基座模型在该努力级别的帕累托前沿斜率——这套推导附在博客的 Appendix B 里,逻辑是:如果只关心平均成本和平均通过率,线性成本惩罚是强制的(从 Jensen 函数方程推出),选 λₑ 等于局部斜率则能确保沿着前沿的微扰不改变目标函数。

具体到行为指标:SWE-2 medium 平均每轮 53 步,SWE-1.7 是 127 步;首次真实编辑的中位步数从 48 降到 18。成本降了 81%。

基座选 Kimi K3 是个挺有意思的信号。Cognition 自己的解释是"the best base model available for coding agents today",但从博文给出的数据看,RL 后训练在多个基准上加 5–6 个百分点,效果确实摆在那里。

工程层面做了一些有意思的工作:用了 DSpark 推测解码 + SpecForge 在线训练 draft 模型来保持推理效率,prefill delayer 把相近请求攒批处理提升 10–20% 通量。MLA 层从 SWE-1.7 时代的混合精度简化到全 FP8 做 K、Q、V 和 score 计算,训练—推理 KL 散度反而更低,尽管基座模型大了 3 倍。

Hacker News 社区对这个编码 Agent 模型的讨论几乎一边倒地集中在 benchmark 策略上。

Top-voted 评论毫不客气:"通过闭源权重和狂刷 benchmark 的策略。这家公司以 480 亿的估值融资了 20 亿,太疯狂了。" 

不过也有人出来为 Cognition 说话:"TB 2.1 已经饱和了——Sol xhigh 在上面也是 90%,新版本只有 37%。所谓 benchmaxxed 的指控毫无根据。" jkelleyrtp(疑似 Cognition 员工)解释不开放 API 的原因是"优先向 Devin 用户保证推理容量,连 OpenAI 都在停新注册了"。

也有人发现了一些微小的使用摩擦:免费用户说 CLI 上 SWE-2 还没显示出来,Pro 用户说实际用了按需额度而不是免费。Cognition 员工回复说桌面版和 CLI 免费,云端 75% 折扣。

来源: