MLE-bench
编码已核验最近更新 2026-10-04
取自真实 Kaggle 竞赛的机器学习工程任务基准。
MLE-bench 分数从 2024 年 10 月 o1-preview + AIDE 的 16.9%,升至 2026 年 2 月 Gemini 3 配合检索与 Agent 脚手架的 64.4%——这是系统级数字,而非裸模型成绩。
关键事实
| 2026 前沿 | 2024 年 10 月为 16.9%(o1-preview + AIDE),2026 年 2 月升至 64.4%(Gemini 3 配合检索与 Agent 脚手架) |
|---|---|
| 可信度 | 64.4% 是在检索与 Agent 脚手架加持下取得的,衡量的是整个系统而非模型本身。另需注意 MLE-bench Lite 是另一套口径,分数更高,不可混用。 |
| 核验状态 | 已核验 |
| 来源 | MLE-bench (OpenAI paper) / reporting |
FAQ
MLE-bench 测的是什么?
取自真实 Kaggle 竞赛的机器学习工程任务基准。
MLE-bench 的 2026 年前沿水平是多少?
2024 年 10 月为 16.9%(o1-preview + AIDE),2026 年 2 月升至 64.4%(Gemini 3 配合检索与 Agent 脚手架)
MLE-bench 可信吗?
64.4% 是在检索与 Agent 脚手架加持下取得的,衡量的是整个系统而非模型本身。另需注意 MLE-bench Lite 是另一套口径,分数更高,不可混用。