SWE-bench Verified
编码已核验最近更新 2026-10-04
真实 GitHub Issue 修复基准;OpenAI 已公开宣布停止报送。
OpenAI 因确认存在污染与测试缺陷,于 2026 年 2 月 23 日起停止报送 SWE-bench Verified;流传的 80-88% 区间描述的是 2025 年底至 2026 年中,而到 2026 年后期前沿已超过 95%。
关键事实
| 2026 前沿 | 2025 年底约 80%(Claude Opus 4.5 为 80.9%);到 2026 年后期已达 95%+ |
|---|---|
| 可信度 | OpenAI 于 2026 年 2 月 23 日发布《为何我们不再评估 SWE-bench Verified》,同时给出测试设计缺陷与训练数据污染两项理由——模型可逐字复现金标准补丁。在模型常解不出的子集中,至少 59.4% 存在测试缺陷。这是基准因自身问题被退役的最清晰案例。 |
| 核验状态 | 已核验 |
| 来源 | OpenAI |
FAQ
SWE-bench Verified 测的是什么?
真实 GitHub Issue 修复基准;OpenAI 已公开宣布停止报送。
SWE-bench Verified 的 2026 年前沿水平是多少?
2025 年底约 80%(Claude Opus 4.5 为 80.9%);到 2026 年后期已达 95%+
SWE-bench Verified 可信吗?
OpenAI 于 2026 年 2 月 23 日发布《为何我们不再评估 SWE-bench Verified》,同时给出测试设计缺陷与训练数据污染两项理由——模型可逐字复现金标准补丁。在模型常解不出的子集中,至少 59.4% 存在测试缺陷。这是基准因自身问题被退役的最清晰案例。