Skip to content
A

SWE-bench Verified

编码已核验最近更新 2026-10-04

真实 GitHub Issue 修复基准;OpenAI 已公开宣布停止报送。

OpenAI 因确认存在污染与测试缺陷,于 2026 年 2 月 23 日起停止报送 SWE-bench Verified;流传的 80-88% 区间描述的是 2025 年底至 2026 年中,而到 2026 年后期前沿已超过 95%。

关键事实

2026 前沿2025 年底约 80%(Claude Opus 4.5 为 80.9%);到 2026 年后期已达 95%+
可信度OpenAI 于 2026 年 2 月 23 日发布《为何我们不再评估 SWE-bench Verified》,同时给出测试设计缺陷与训练数据污染两项理由——模型可逐字复现金标准补丁。在模型常解不出的子集中,至少 59.4% 存在测试缺陷。这是基准因自身问题被退役的最清晰案例。
核验状态已核验
来源OpenAI

Markdown 版本(供 LLM 读取)

FAQ

SWE-bench Verified 测的是什么?

真实 GitHub Issue 修复基准;OpenAI 已公开宣布停止报送。

SWE-bench Verified 的 2026 年前沿水平是多少?

2025 年底约 80%(Claude Opus 4.5 为 80.9%);到 2026 年后期已达 95%+

SWE-bench Verified 可信吗?

OpenAI 于 2026 年 2 月 23 日发布《为何我们不再评估 SWE-bench Verified》,同时给出测试设计缺陷与训练数据污染两项理由——模型可逐字复现金标准补丁。在模型常解不出的子集中,至少 59.4% 存在测试缺陷。这是基准因自身问题被退役的最清晰案例。