首页 > AI前沿 > Why we no longer evaluate SWE-bench Verified

Why we no longer evaluate SWE-bench Verified

OpenAI 2026-02-23 19:00 1 阅读 查看原文

SWE-bench Verified 基准测试的污染问题

SWE-bench Verified 正日益受到数据污染的影响,并已无法准确衡量前沿编码技术的进展。我们的分析揭示了其中存在的测试缺陷与训练数据泄漏问题。

核心问题分析

随着该基准测试在业界被广泛采用,其原始测试集已逐渐被纳入大语言模型的预训练语料库中,导致模型在评估时出现“背答案”而非“解新题”的现象。此外,部分测试用例本身存在描述模糊或补丁验证逻辑错误,进一步扭曲了真实的能力排名。

我们强烈建议研究社区与工业界采用新推出的 SWE-bench Pro 作为替代基准,该版本通过动态生成任务与隔离验证集,能够更稳健地反映模型的实际编程泛化能力。

主要发现与建议

  • 训练泄漏:超过 23% 的原始验证集问题已出现在公开代码仓库及模型训练数据中。
  • 测试缺陷:约 11% 的测试用例存在错误的环境依赖或过于宽松的通过条件。
  • 改进方案:SWE-bench Pro 采用时间隔离(time-based split)与私有测试运行器,确保评估的公平性。

我们呼吁所有依赖该基准的团队重新审视其评估流程,并迁移至更可靠的评测体系。