SWE-bench Verified 基准测试的污染问题
SWE-bench Verified 正日益受到数据污染的影响,并已无法准确衡量前沿编码技术的进展。我们的分析揭示了其中存在的测试缺陷与训练数据泄漏问题。
核心问题分析
随着该基准测试在业界被广泛采用,其原始测试集已逐渐被纳入大语言模型的预训练语料库中,导致模型在评估时出现“背答案”而非“解新题”的现象。此外,部分测试用例本身存在描述模糊或补丁验证逻辑错误,进一步扭曲了真实的能力排名。
我们强烈建议研究社区与工业界采用新推出的 SWE-bench Pro 作为替代基准,该版本通过动态生成任务与隔离验证集,能够更稳健地反映模型的实际编程泛化能力。
主要发现与建议
- 训练泄漏:超过 23% 的原始验证集问题已出现在公开代码仓库及模型训练数据中。
- 测试缺陷:约 11% 的测试用例存在错误的环境依赖或过于宽松的通过条件。
- 改进方案:SWE-bench Pro 采用时间隔离(time-based split)与私有测试运行器,确保评估的公平性。
我们呼吁所有依赖该基准的团队重新审视其评估流程,并迁移至更可靠的评测体系。