SWE-Bench Pro 不再可靠:~30% 任务存在致命缺陷,OpenAI 撤回推荐 背景:OpenAI 为什么要重新审这个榜
准确评测直接关系到部署与安全判断(含 Preparedness Framework)。此前 OpenAI 已指出 SWE-bench Verified 存在设计与污染问题,分数不再反映真实软件工程能力,于是推荐 SWE-Bench Pro——更长 horizon、更贴近真实改动,从公开/私有仓库的历史变更中抽取任务:模型需实现功能并通过新测试,且不破坏既有行为。
公开 731 题上,前沿模型通过率在约八个月内从 23.3% 升至 80.3%。分数飙升本身就要求追问:进步是能力,还是评测噪声?
方法:如何把「坏题」找出来
目标很明确:失败应反映模型不足,成功应反映对题面要求的完整、有效解。
流程分三层:
· 自动化质检:对照题面、模型尝试、评分测试,标出可疑题(约 286 题)。
· 人机协同深审:Codex 类 investigator agent 可进仓库、跑测试、看失败模式;多轮独立审计后由研究员定标。
· 人工标注:每题由 5 名有经验工程师独立审题面、测试与 gold patch,再参考流水线材料;分歧与低置信度升级复审。
人工比 agent 更常判「坏题」,也更常给多标签;两者大类一致约 74%。Agent 路径偏保守,尤其低估 低覆盖测试(人工约 9.4% vs agent 约 4.1%)。
四类主要失效模式
· 过严测试:测的是未在题面要求的实现细节,功能正确也会挂
· 题面欠指定:隐藏测试要求的内容题面未写、也无法合理推断
· 低覆盖测试:测不全,残缺修复也能过
· 误导性题面:把模型引向错误行为,或与测试要求矛盾
讨论:根因与启示
开源 PR 本是给人协作的:描述、合并代码、单测往往经多轮协商,并不天然构成干净、自洽的评测单元。尤其 PR 里的测试常为「验证某次具体改动」而写,而非「实现无关的验收标准」——于是容易过严或与题面错位。
另一面:模型变强后,用 agent 大规模检查题面、测试、patch、trace 变得可行,评测质检本身也在 agent 化。
OpenAI 的主张是:希望社区由有经验工程师专门为测模型能力设计新榜,既保留难度与真实感,又便于全程人工把关。好评测应:难刷、可信、真正反映能力或对齐——因为这些数字会进入部署与安全决策。
Separating signal from noise in coding evaluations openai.com/index/separati…