# ClawsBench

> 2026 年 4 月 6 日首次发布的 ClawsBench，在 6 个模型、4 个 Agent harness、33 种条件下测试，得出任务成功率 39-64%、不安全行为率 7-33%。

同时衡量任务成功率与不安全行为率，跨模型与 harness 测试。

- **分类:** 安全
- **2026 前沿:** 任务成功率 39-64%；不安全行为率 7-33%（6 模型 × 4 harness × 33 种条件）
- **可信度:** 关键在于它的呈现方式：能力与安全并排报告，因此高成功率并不自动是好消息。一个 64% 成功率却伴随 33% 不安全行为的系统不可部署——这个基准把这道算术摆在了明面上。
- **核验状态:** 已核验
- **来源:** [ClawsBench (arXiv:2604.05172)](https://arxiv.org/abs/2604.05172)
- **更新日期:** 2026-10-04
