SWE-bench Pro
编码已核验最近更新 2026-10-04
仓库级工程任务基准,以抗污染为设计目标。
SWE-bench Pro 于 2025 年 9 月发布,最高分为 23.3%(GPT-5),而多数顶尖模型在 SWE-bench Verified 上超过 70%——这正是「80% 的模型掉到 23%」这一误传的来源。
常见的错误说法: 「约 80% 的模型在 SWE-bench Verified 上得分不错,到 Pro 上掉到约 23%」这一说法。
关键事实
| 2026 前沿 | 发布时 23.3%(GPT-5,2025-09);公开集后续达 59.1-61.5%,商业集 51.5%(2026-09) |
|---|---|
| 可信度 | 抗污染设计使其比 Verified 更可信。但要注意一条广为流传的误读:Scale 论文说的是「多数顶尖模型在 Verified 上超过 70%,而最好的模型在 Pro 上仅约 23%」——并不是「80% 的模型掉到 23%」。 |
| 核验状态 | 已核验 |
| 来源 | Scale AI SWE-Bench Pro leaderboard |
FAQ
SWE-bench Pro 测的是什么?
仓库级工程任务基准,以抗污染为设计目标。
SWE-bench Pro 的 2026 年前沿水平是多少?
发布时 23.3%(GPT-5,2025-09);公开集后续达 59.1-61.5%,商业集 51.5%(2026-09)
SWE-bench Pro 可信吗?
抗污染设计使其比 Verified 更可信。但要注意一条广为流传的误读:Scale 论文说的是「多数顶尖模型在 Verified 上超过 70%,而最好的模型在 Pro 上仅约 23%」——并不是「80% 的模型掉到 23%」。
关于 SWE-bench Pro 的常见说法准确吗?
「约 80% 的模型在 SWE-bench Verified 上得分不错,到 Pro 上掉到约 23%」这一说法。