# SWE-bench Pro

> SWE-bench Pro 于 2025 年 9 月发布，最高分为 23.3%（GPT-5），而多数顶尖模型在 SWE-bench Verified 上超过 70%——这正是「80% 的模型掉到 23%」这一误传的来源。

仓库级工程任务基准，以抗污染为设计目标。

- **分类:** 编码
- **2026 前沿:** 发布时 23.3%（GPT-5，2025-09）；公开集后续达 59.1-61.5%，商业集 51.5%（2026-09）
- **可信度:** 抗污染设计使其比 Verified 更可信。但要注意一条广为流传的误读：Scale 论文说的是「多数顶尖模型在 Verified 上超过 70%，而最好的模型在 Pro 上仅约 23%」——并不是「80% 的模型掉到 23%」。
- **核验状态:** 已核验
- **来源:** [Scale AI SWE-Bench Pro leaderboard](https://labs.scale.com/leaderboard/swe_bench_pro_public_v2)
- **更新日期:** 2026-10-04

> 常见错误说法: 「约 80% 的模型在 SWE-bench Verified 上得分不错，到 Pro 上掉到约 23%」这一说法。
