Skip to content
A

MLE-bench

编码已核验最近更新 2026-10-04

取自真实 Kaggle 竞赛的机器学习工程任务基准。

MLE-bench 分数从 2024 年 10 月 o1-preview + AIDE 的 16.9%,升至 2026 年 2 月 Gemini 3 配合检索与 Agent 脚手架的 64.4%——这是系统级数字,而非裸模型成绩。

关键事实

2026 前沿2024 年 10 月为 16.9%(o1-preview + AIDE),2026 年 2 月升至 64.4%(Gemini 3 配合检索与 Agent 脚手架)
可信度64.4% 是在检索与 Agent 脚手架加持下取得的,衡量的是整个系统而非模型本身。另需注意 MLE-bench Lite 是另一套口径,分数更高,不可混用。
核验状态已核验
来源MLE-bench (OpenAI paper) / reporting

Markdown 版本(供 LLM 读取)

FAQ

MLE-bench 测的是什么?

取自真实 Kaggle 竞赛的机器学习工程任务基准。

MLE-bench 的 2026 年前沿水平是多少?

2024 年 10 月为 16.9%(o1-preview + AIDE),2026 年 2 月升至 64.4%(Gemini 3 配合检索与 Agent 脚手架)

MLE-bench 可信吗?

64.4% 是在检索与 Agent 脚手架加持下取得的,衡量的是整个系统而非模型本身。另需注意 MLE-bench Lite 是另一套口径,分数更高,不可混用。