# GAIA

> 截至 2026 年 5 月，GAIA 榜单显示搭配 HAL 脚手架的 Claude Sonnet 4.5 取得 L1 82.07%、L2 72.68%、L3 65.39%，而人类基线为 92%；但同一模型脱离该框架仅约 44%，脚手架带来约 30 分差距。

通用助手基准，用需要多步推理与工具调用的真实问题考察 Agent。

- **分类:** 通用能力
- **2026 前沿:** L1 82.07% / L2 72.68% / L3 65.39%（HAL Generalist + Claude Sonnet 4.5，2026 年 5 月；整体 74.55%）
- **人类基线:** 92% (original paper)
- **可信度:** 分数主要由脚手架决定：同一模型裸调用约 44%，放进 Princeton HAL 框架则约 74%——差距约 30 分。因此 GAIA 分数是「脚手架 + 模型」的组合属性，不能只看模型。
- **核验状态:** 已核验
- **来源:** [GAIA leaderboard / HAL analysis](https://awesomeagents.ai/leaderboards/gaia-benchmark-leaderboard/)
- **更新日期:** 2026-10-04
