GAIA
通用能力已核验最近更新 2026-10-04
通用助手基准,用需要多步推理与工具调用的真实问题考察 Agent。
截至 2026 年 5 月,GAIA 榜单显示搭配 HAL 脚手架的 Claude Sonnet 4.5 取得 L1 82.07%、L2 72.68%、L3 65.39%,而人类基线为 92%;但同一模型脱离该框架仅约 44%,脚手架带来约 30 分差距。
关键事实
| 2026 前沿 | L1 82.07% / L2 72.68% / L3 65.39%(HAL Generalist + Claude Sonnet 4.5,2026 年 5 月;整体 74.55%) |
|---|---|
| 人类基线 | 92% (original paper) |
| 可信度 | 分数主要由脚手架决定:同一模型裸调用约 44%,放进 Princeton HAL 框架则约 74%——差距约 30 分。因此 GAIA 分数是「脚手架 + 模型」的组合属性,不能只看模型。 |
| 核验状态 | 已核验 |
| 来源 | GAIA leaderboard / HAL analysis |
FAQ
GAIA 测的是什么?
通用助手基准,用需要多步推理与工具调用的真实问题考察 Agent。
GAIA 的 2026 年前沿水平是多少?
L1 82.07% / L2 72.68% / L3 65.39%(HAL Generalist + Claude Sonnet 4.5,2026 年 5 月;整体 74.55%)
GAIA 可信吗?
分数主要由脚手架决定:同一模型裸调用约 44%,放进 Princeton HAL 框架则约 74%——差距约 30 分。因此 GAIA 分数是「脚手架 + 模型」的组合属性,不能只看模型。