Skip to content
A

GAIA2

通用能力已核验最近更新 2026-10-04

GAIA 的继任基准,在动态、异步环境中考察 Agent。

2026 年 2 月 12 日发布、被 ICLR 2026 接收为 Oral 的 GAIA2,在异步动态环境的 1,120 个场景中考察 Agent,其中 GPT-5(high)为 42.1% pass@1,开源最佳 Kimi-K2 为 20.1%。

关键事实

2026 前沿GPT-5(high)42.1% pass@1;开源最佳 Kimi-K2 为 20.1% pass@1
可信度由 Meta Superintelligence Labs 发布,被 ICLR 2026 接收为 Oral,在异步测试平台上运行 1,120 个场景。其具体发现是:最强模型恰恰在时间敏感任务上失败——这与 GAIA 静态多步问题的失效模式不同。
核验状态已核验
来源GAIA2 (arXiv:2602.11964)

Markdown 版本(供 LLM 读取)

FAQ

GAIA2 测的是什么?

GAIA 的继任基准,在动态、异步环境中考察 Agent。

GAIA2 的 2026 年前沿水平是多少?

GPT-5(high)42.1% pass@1;开源最佳 Kimi-K2 为 20.1% pass@1

GAIA2 可信吗?

由 Meta Superintelligence Labs 发布,被 ICLR 2026 接收为 Oral,在异步测试平台上运行 1,120 个场景。其具体发现是:最强模型恰恰在时间敏感任务上失败——这与 GAIA 静态多步问题的失效模式不同。