评测与基准
每个 Agent 基准究竟在测什么、可信度如何,以及哪些广为流传的数字经不起核对。每个条目都写明前沿水平与可信度提示。
共 23 条 · 最近更新 2026-10-04
MLE-bench
取自真实 Kaggle 竞赛的机器学习工程任务基准。
2026 前沿:2024 年 10 月为 16.9%(o1-preview + AIDE),2026 年 2 月升至 64.4%(Gemini 3 配合检索与 Agent 脚手架)
64.4% 是在检索与 Agent 脚手架加持下取得的,衡量的是整个系统而非模型本身。另需注意 MLE-bench Lite 是另一套口径,分数更高,不可混用。
SWE-bench Pro
仓库级工程任务基准,以抗污染为设计目标。
2026 前沿:发布时 23.3%(GPT-5,2025-09);公开集后续达 59.1-61.5%,商业集 51.5%(2026-09)
抗污染设计使其比 Verified 更可信。但要注意一条广为流传的误读:Scale 论文说的是「多数顶尖模型在 Verified 上超过 70%,而最好的模型在 Pro 上仅约 23%」——并不是「80% 的模型掉到 23%」。
SWE-bench Verified
真实 GitHub Issue 修复基准;OpenAI 已公开宣布停止报送。
2026 前沿:2025 年底约 80%(Claude Opus 4.5 为 80.9%);到 2026 年后期已达 95%+
OpenAI 于 2026 年 2 月 23 日发布《为何我们不再评估 SWE-bench Verified》,同时给出测试设计缺陷与训练数据污染两项理由——模型可逐字复现金标准补丁。在模型常解不出的子集中,至少 59.4% 存在测试缺陷。这是基准因自身问题被退役的最清晰案例。
"AgentShield Bench v3" — does not exist
一个带版本号的安全基准名称,在任何地方都查不到。
2026 前沿:未找到
查不到任何名为 AgentShield Bench(无论 v3 还是其他版本)的基准。该名称与两件无关事物撞名:AgentShield(审计 Claude Code 配置的扫描器,不是基准)与 AgentShield-G(图结构护栏模型论文)。真实存在的 Agent 安全基准包括 Agent Security Bench(ICLR 2025)与 AgentSecBench——名称与作者都不同。
"LangGraph + CrewAI hybrid reaches 96.1%" — unverifiable claim
一条广泛流传但无法追溯来源的框架统计数字。
2026 前沿:未找到任何来源
检索未发现任何 IEEE 研究、没有 96.1% 这一数字、也没有「任务规格高 34%」这项指标。该说法还与已发表证据方向相反:固定模型的 ACM Arena 基准发现传统框架增加编排代码并未带来正确性优势,其他对比中复杂任务成功率约在 54-62%。
"Only 5 of 12 MCP servers exceed 80% reliability" — unverifiable figures
一张具体的 MCP 可靠性表格,其数字无法追溯到任何实测。
2026 前沿:所引数字未找到任何来源
该说法的「形态」能对应到一篇真实博客——它确实评测了 12 个 MCP Server——但所引数字一个都没出现其中。那篇评测的结论是 4 个保留 / 6 个淘汰 / 2 个观察,可用率为 Vercel 100%、Ahrefs 96%、Gmail 97%。其他真实 MCP 测试也存在(36 个服务器评级中约三分之一得 D/F;100 个服务器压测中位延迟 320ms、中位通过率 71%),但其中都没有 10%、4%、491ms 或 9/12 这些数字。
GAIA
通用助手基准,用需要多步推理与工具调用的真实问题考察 Agent。
2026 前沿:L1 82.07% / L2 72.68% / L3 65.39%(HAL Generalist + Claude Sonnet 4.5,2026 年 5 月;整体 74.55%)
分数主要由脚手架决定:同一模型裸调用约 44%,放进 Princeton HAL 框架则约 74%——差距约 30 分。因此 GAIA 分数是「脚手架 + 模型」的组合属性,不能只看模型。
GAIA2
GAIA 的继任基准,在动态、异步环境中考察 Agent。
2026 前沿:GPT-5(high)42.1% pass@1;开源最佳 Kimi-K2 为 20.1% pass@1
由 Meta Superintelligence Labs 发布,被 ICLR 2026 接收为 Oral,在异步测试平台上运行 1,120 个场景。其具体发现是:最强模型恰恰在时间敏感任务上失败——这与 GAIA 静态多步问题的失效模式不同。
OfficeQA Pro
面向企业级多文档落地推理,语料为美国财政部公报。
2026 前沿:前沿模型仅凭参数知识不足 5%;给定文档后平均仅 34.1%
它清晰量化了「知道」与「查得到」的差距:语料 89,000 页、2,600 万+ 数值,共 133 道题。即便把文档递给模型,前沿模型平均也仅 34.1%——对企业 RAG 规划而言,这个数字才是关键。
tau2-bench
多轮客服场景基准,衡量多次重复下的可靠率,而非仅看最好成绩。
2026 前沿:Telecom 领域最高 99.3%(pass^1,2026-02 报告)
Telecom 榜首已接近饱和——前三名差距不足 0.3 分。更有价值的是 pass^k 指标:它考察 Agent 能否连续 k 次成功,比单次成绩更接近生产可靠性。99.3% 属厂商自报,未经独立复现。
Terminal-Bench 2.1
命令行 Agent 任务基准;2.1 版是对 2.0 的校验后刷新。
2026 前沿:2026 年中约 80-89%(GLM-5.2 81.0%、Codex CLI 83.4%、Fable 5 88.0%);到 2026 年 9 月公开最高已到 90.6-92.8%
这是一个公开自我修复的基准:2.1 版修复了 2.0 的 89 个任务中的 28 个。这是基准维护的诚实做法,但也意味着 2.0 与 2.1 的分数不可直接比较。
Toolathlon
工具十项全能:跨 32 个应用、604 个工具的长程任务基准。
2026 前沿:最高 38.6%(Claude-4.5-Sonnet);开源最佳 20.1%(DeepSeek-V3.2-Exp)
显示 Agent 距离长程任务有多远:108 个手工任务平均约 20 轮交互,跨 32 个应用与 604 个工具,没有任何系统达到 40%。开源最佳约为闭源最佳的一半,是本清单中该差距最大的一个。
Agent sandbox comparison (10 options, 2026)
第三方对十款 Agent 沙箱工具的比较,并给出具体选型建议。
2026 前沿:建议:Membrane(Docker + eBPF)适合均衡;NVIDIA OpenShell 适合 Kubernetes 策略;Agent Safehouse 适合 macOS;Docker Sandboxes 适合 Docker-in-Docker
价值在于它点出取舍而非评选唯一赢家。两点需纠正:Agent Safehouse 与 Membrane 真实但项目很小;另外流传的一个版本把 Docker-in-Docker 推荐记到了 E2B 头上——原文该位置推荐的是 Docker Sandboxes,而 E2B 的卖点是无需本地安装的托管云隔离。
AgentPerf
Artificial Analysis 面向 Agentic AI 基础设施的基准,基于真实编码 Agent 轨迹构建。
2026 前沿:在 20 tok/s SLO 下,NVIDIA GB300 NVL72 达 91,507 agents/MW,最高为 HGX H200 的 20 倍
这是基础设施基准而非模型基准:衡量的是单位电力预算能支撑多少 Agent。两点需注意——该基准与 NVIDIA 合作开发(因此 NVIDIA 领先属预期),且结果对所选 SLO 高度敏感,例如 60 tok/s 时 GB300 约 61,400 agents/MW,而 H200 约 2,600。
Arena (agent framework benchmark)
ACM CAIS '26 论文中的基准,在固定模型条件下对比各 Agent 框架。
2026 前沿:同一模型下对比六个框架;随复杂度上升,没有任何框架获得正确性优势
这是目前最有用的框架对比,因为它固定了模型:Claude Agent SDK、LangChain、LangGraph、AWS Strands、CrewAI 与 Google ADK 指向同一个 MCP 工具服务器,按六项指标比较。结论——简单任务上各框架表现相近,但随复杂度上升,传统框架需要多出 2-4 倍的场景专用编排代码却无正确性收益——把「选框架」从能力问题变成了工程投入问题。
Observability instrumentation overhead
实测各 LLM/Agent 可观测工具带来的运行时开销。
2026 前沿:LangSmith 近 0%、Laminar 5%、AgentOps 12%、Langfuse 15%
来自单一基准:在一个多 Agent 旅行规划系统上重放 100 条相同查询并与无埋点基线对比。此类开销高度依赖上报是同步还是异步以及采样率,因此排序有参考意义,但不宜当作固定常数。
MCP-Atlas
Scale AI 面向 MCP Server 的基准:1,000 个任务、36 个服务器、220 个工具。
2026 前沿:Scale 官方论文最高为 62.3%(Claude Opus 4.5);第三方聚合站列出 Muse Spark 1.1 为 88.1%
存在两套差异极大的数字体系。Scale 官方榜单最高约 62%,而聚合站基于厂商自报给出 85-88%。以 BenchLM 为例,其 42 行中 40 行标注为厂商自报、仅 2 行为独立评测。
OSWorld
考察 Agent 端到端操作真实桌面环境的基准。
2026 前沿:Claude Sonnet 4.6 为 72.5%(2026-02);GPT-5.4 为 75.0%(2026-06)
属于较可信的 Agent 基准:72.36% 的人类基线是真实的参照点而非饱和上限,因此差距仍反映真实能力。需注意 72.36% 并非熟练用户的满分。
ClawsBench
同时衡量任务成功率与不安全行为率,跨模型与 harness 测试。
2026 前沿:任务成功率 39-64%;不安全行为率 7-33%(6 模型 × 4 harness × 33 种条件)
关键在于它的呈现方式:能力与安全并排报告,因此高成功率并不自动是好消息。一个 64% 成功率却伴随 33% 不安全行为的系统不可部署——这个基准把这道算术摆在了明面上。
HarnessRisk
把 Agent harness 的安全责任拆为六个生命周期阶段,并构造 128 个沙箱用例测试。
2026 前沿:在 14 种 model-harness 配置下,攻击成功率 12.6%-80.9%,任务可用性 75.0%-97.6%
价值在于它测的是 harness 而非模型:六个阶段(配置、能力扩展、运行时操作、状态持久化、动作控制、事件恢复)、128 个沙箱用例、3 个 harness 与 6 个模型交叉共 14 种配置。12.6% 到 80.9% 的攻击成功率区间是核心结论——同一模型放进不同 harness,就是不同的安全姿态。
SecureWebArena
首个面向 Web Agent 的整体安全基准,构建于六个真实 Web 环境之上。
2026 前沿:6 个真实 Web 环境、2,970 条对抗轨迹、6 类攻击向量
填补了一个明确空白:浏览器 Agent 早就有能力基准(WebArena),但「它们多容易被页面上的对抗内容操纵」长期无人测量。已被 ACL 2026 Findings 接收。
SkillTrustBench
面向 Agent Skill 的安全基准,用例提炼自真实技能市场。
2026 前沿:5,520 个评测用例,覆盖 9 类攻击(T01-T09)与 5 个依赖层
其价值在于来源规模:用例提炼自主流技能市场中 62,652 个真实 Skill,因此测的是真实发布出来的威胁,而非凭空设计的攻击。2026 年 6 月由腾讯朱雀实验室与香港中文大学(深圳)联合发布。
WebArena
在自建的真实网站复刻环境中执行端到端浏览器任务。
2026 前沿:OpAgent 71.6%(2026-01);WebTactix 74.3%(2026-02)
可信度较高:与 78.24% 人类基线之间的剩余差距是真实能力差而非假象。进展很快——从 2023 年的约 15% 升到 2026 年初的 74.3%。