首页 > AI前沿 > Separating signal from noise in coding evaluations

Separating signal from noise in coding evaluations

OpenAI 2026-07-08 21:00 1 阅读 查看原文
A new analysis from OpenAI reveals issues in SWE-Bench Pro, a popular coding benchmark, raising concerns about reliability and accuracy in evaluating AI models.