Skip to content
A

GAIA

通用能力已核验最近更新 2026-10-04

通用助手基准,用需要多步推理与工具调用的真实问题考察 Agent。

截至 2026 年 5 月,GAIA 榜单显示搭配 HAL 脚手架的 Claude Sonnet 4.5 取得 L1 82.07%、L2 72.68%、L3 65.39%,而人类基线为 92%;但同一模型脱离该框架仅约 44%,脚手架带来约 30 分差距。

关键事实

2026 前沿L1 82.07% / L2 72.68% / L3 65.39%(HAL Generalist + Claude Sonnet 4.5,2026 年 5 月;整体 74.55%)
人类基线92% (original paper)
可信度分数主要由脚手架决定:同一模型裸调用约 44%,放进 Princeton HAL 框架则约 74%——差距约 30 分。因此 GAIA 分数是「脚手架 + 模型」的组合属性,不能只看模型。
核验状态已核验
来源GAIA leaderboard / HAL analysis

Markdown 版本(供 LLM 读取)

FAQ

GAIA 测的是什么?

通用助手基准,用需要多步推理与工具调用的真实问题考察 Agent。

GAIA 的 2026 年前沿水平是多少?

L1 82.07% / L2 72.68% / L3 65.39%(HAL Generalist + Claude Sonnet 4.5,2026 年 5 月;整体 74.55%)

GAIA 可信吗?

分数主要由脚手架决定:同一模型裸调用约 44%,放进 Princeton HAL 框架则约 74%——差距约 30 分。因此 GAIA 分数是「脚手架 + 模型」的组合属性,不能只看模型。