HarnessRisk
安全已核验最近更新 2026-10-04
把 Agent harness 的安全责任拆为六个生命周期阶段,并构造 128 个沙箱用例测试。
2026 年 8 月 18 日发布的 HarnessRisk,在 6 个生命周期阶段、128 个沙箱用例、14 种 model-harness 配置下评估 Agent harness 安全性,攻击成功率区间为 12.6% 至 80.9%。
关键事实
| 2026 前沿 | 在 14 种 model-harness 配置下,攻击成功率 12.6%-80.9%,任务可用性 75.0%-97.6% |
|---|---|
| 可信度 | 价值在于它测的是 harness 而非模型:六个阶段(配置、能力扩展、运行时操作、状态持久化、动作控制、事件恢复)、128 个沙箱用例、3 个 harness 与 6 个模型交叉共 14 种配置。12.6% 到 80.9% 的攻击成功率区间是核心结论——同一模型放进不同 harness,就是不同的安全姿态。 |
| 核验状态 | 已核验 |
| 来源 | HarnessRisk (arXiv:2608.17597) |
FAQ
HarnessRisk 测的是什么?
把 Agent harness 的安全责任拆为六个生命周期阶段,并构造 128 个沙箱用例测试。
HarnessRisk 的 2026 年前沿水平是多少?
在 14 种 model-harness 配置下,攻击成功率 12.6%-80.9%,任务可用性 75.0%-97.6%
HarnessRisk 可信吗?
价值在于它测的是 harness 而非模型:六个阶段(配置、能力扩展、运行时操作、状态持久化、动作控制、事件恢复)、128 个沙箱用例、3 个 harness 与 6 个模型交叉共 14 种配置。12.6% 到 80.9% 的攻击成功率区间是核心结论——同一模型放进不同 harness,就是不同的安全姿态。