Skip to content
A

SWE-bench Pro

编码已核验最近更新 2026-10-04

仓库级工程任务基准,以抗污染为设计目标。

SWE-bench Pro 于 2025 年 9 月发布,最高分为 23.3%(GPT-5),而多数顶尖模型在 SWE-bench Verified 上超过 70%——这正是「80% 的模型掉到 23%」这一误传的来源。

常见的错误说法: 「约 80% 的模型在 SWE-bench Verified 上得分不错,到 Pro 上掉到约 23%」这一说法。

关键事实

2026 前沿发布时 23.3%(GPT-5,2025-09);公开集后续达 59.1-61.5%,商业集 51.5%(2026-09)
可信度抗污染设计使其比 Verified 更可信。但要注意一条广为流传的误读:Scale 论文说的是「多数顶尖模型在 Verified 上超过 70%,而最好的模型在 Pro 上仅约 23%」——并不是「80% 的模型掉到 23%」。
核验状态已核验
来源Scale AI SWE-Bench Pro leaderboard

Markdown 版本(供 LLM 读取)

FAQ

SWE-bench Pro 测的是什么?

仓库级工程任务基准,以抗污染为设计目标。

SWE-bench Pro 的 2026 年前沿水平是多少?

发布时 23.3%(GPT-5,2025-09);公开集后续达 59.1-61.5%,商业集 51.5%(2026-09)

SWE-bench Pro 可信吗?

抗污染设计使其比 Verified 更可信。但要注意一条广为流传的误读:Scale 论文说的是「多数顶尖模型在 Verified 上超过 70%,而最好的模型在 Pro 上仅约 23%」——并不是「80% 的模型掉到 23%」。

关于 SWE-bench Pro 的常见说法准确吗?

「约 80% 的模型在 SWE-bench Verified 上得分不错,到 Pro 上掉到约 23%」这一说法。