← 回總覽

SWE‑Bench Pro 出现约 30% 有缺陷任务,OpenAI 撤回推荐

📅 2026-07-09 08:33 meng shao 人工智能 1 分鐘 1189 字 評分: 89
SWE-Bench Pro OpenAI AI 评测 软件工程 基准缺陷
📌 一句话摘要 OpenAI 审计发现 SWE‑Bench Pro 约 30% 任务存在致命缺陷,因而撤回其作为领先代码评测的推荐。 📝 详细摘要 OpenAI 重新审查了广泛使用的 SWE‑Bench Pro 基准,发现约 30% 的任务存在致命缺陷,导致得分不再真实反映软件工程能力。通过自动化质检、人机协同深审和人工标注三层流程,识别出过严测试、题面欠指定、低覆盖测试和误导性题面四类失效模式。文章进一步指出,开源 PR 本非天然的干净评测单元,主张由有经验工程师专门设计新基准,以保证难度、可信度和真实能力的体现,因为这些数字将直接影响部署与安全决策。 📊 文章信息 AI 初评:89

SWE-Bench Pro 不再可靠:~30% 任务存在致命缺陷,OpenAI 撤回推荐 背景:OpenAI 为什么要重新审这个榜

准确评测直接关系到部署与安全判断(含 Preparedness Framework)。此前 OpenAI 已指出 SWE-bench Verified 存在设计与污染问题,分数不再反映真实软件工程能力,于是推荐 SWE-Bench Pro——更长 horizon、更贴近真实改动,从公开/私有仓库的历史变更中抽取任务:模型需实现功能并通过新测试,且不破坏既有行为。

公开 731 题上,前沿模型通过率在约八个月内从 23.3% 升至 80.3%。分数飙升本身就要求追问:进步是能力,还是评测噪声?

方法:如何把「坏题」找出来

目标很明确:失败应反映模型不足,成功应反映对题面要求的完整、有效解。

流程分三层:

· 自动化质检:对照题面、模型尝试、评分测试,标出可疑题(约 286 题)。

· 人机协同深审:Codex 类 investigator agent 可进仓库、跑测试、看失败模式;多轮独立审计后由研究员定标。

· 人工标注:每题由 5 名有经验工程师独立审题面、测试与 gold patch,再参考流水线材料;分歧与低置信度升级复审。

人工比 agent 更常判「坏题」,也更常给多标签;两者大类一致约 74%。Agent 路径偏保守,尤其低估 低覆盖测试(人工约 9.4% vs agent 约 4.1%)。

四类主要失效模式

· 过严测试:测的是未在题面要求的实现细节,功能正确也会挂

· 题面欠指定:隐藏测试要求的内容题面未写、也无法合理推断

· 低覆盖测试:测不全,残缺修复也能过

· 误导性题面:把模型引向错误行为,或与测试要求矛盾

讨论:根因与启示

开源 PR 本是给人协作的:描述、合并代码、单测往往经多轮协商,并不天然构成干净、自洽的评测单元。尤其 PR 里的测试常为「验证某次具体改动」而写,而非「实现无关的验收标准」——于是容易过严或与题面错位。

另一面:模型变强后,用 agent 大规模检查题面、测试、patch、trace 变得可行,评测质检本身也在 agent 化。

OpenAI 的主张是:希望社区由有经验工程师专门为测模型能力设计新榜,既保留难度与真实感,又便于全程人工把关。好评测应:难刷、可信、真正反映能力或对齐——因为这些数字会进入部署与安全决策。

Separating signal from noise in coding evaluations openai.com/index/separati…

查看原文 → 發佈: 2026-07-09 08:33:20 收錄: 2026-07-09 12:00:40

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。