Skip to content
A

Terminal-Bench 2.1

通用能力已核验最近更新 2026-10-04

命令行 Agent 任务基准;2.1 版是对 2.0 的校验后刷新。

2026 年 5 月 6 日发布的 Terminal-Bench 2.1 修复了 2.0 版 89 个任务中的 28 个;2026 年中前沿约 80-89%,到 2026 年 9 月升至约 90.6-92.8%,因此「约 81%」只对应某一时点而非当前前沿。

关键事实

2026 前沿2026 年中约 80-89%(GLM-5.2 81.0%、Codex CLI 83.4%、Fable 5 88.0%);到 2026 年 9 月公开最高已到 90.6-92.8%
可信度这是一个公开自我修复的基准:2.1 版修复了 2.0 的 89 个任务中的 28 个。这是基准维护的诚实做法,但也意味着 2.0 与 2.1 的分数不可直接比较。
核验状态已核验
来源Terminal-Bench score ledger

Markdown 版本(供 LLM 读取)

FAQ

Terminal-Bench 2.1 测的是什么?

命令行 Agent 任务基准;2.1 版是对 2.0 的校验后刷新。

Terminal-Bench 2.1 的 2026 年前沿水平是多少?

2026 年中约 80-89%(GLM-5.2 81.0%、Codex CLI 83.4%、Fable 5 88.0%);到 2026 年 9 月公开最高已到 90.6-92.8%

Terminal-Bench 2.1 可信吗?

这是一个公开自我修复的基准:2.1 版修复了 2.0 的 89 个任务中的 28 个。这是基准维护的诚实做法,但也意味着 2.0 与 2.1 的分数不可直接比较。