# SWE-bench Verified

> OpenAI 因确认存在污染与测试缺陷，于 2026 年 2 月 23 日起停止报送 SWE-bench Verified；流传的 80-88% 区间描述的是 2025 年底至 2026 年中，而到 2026 年后期前沿已超过 95%。

真实 GitHub Issue 修复基准；OpenAI 已公开宣布停止报送。

- **分类:** 编码
- **2026 前沿:** 2025 年底约 80%（Claude Opus 4.5 为 80.9%）；到 2026 年后期已达 95%+
- **可信度:** OpenAI 于 2026 年 2 月 23 日发布《为何我们不再评估 SWE-bench Verified》，同时给出测试设计缺陷与训练数据污染两项理由——模型可逐字复现金标准补丁。在模型常解不出的子集中，至少 59.4% 存在测试缺陷。这是基准因自身问题被退役的最清晰案例。
- **核验状态:** 已核验
- **来源:** [OpenAI](https://openai.com/zh-Hans-CN/index/why-we-no-longer-evaluate-swe-bench-verified/)
- **更新日期:** 2026-10-04
