Skip to content
A

HarnessRisk

安全已核验最近更新 2026-10-04

把 Agent harness 的安全责任拆为六个生命周期阶段,并构造 128 个沙箱用例测试。

2026 年 8 月 18 日发布的 HarnessRisk,在 6 个生命周期阶段、128 个沙箱用例、14 种 model-harness 配置下评估 Agent harness 安全性,攻击成功率区间为 12.6% 至 80.9%。

关键事实

2026 前沿在 14 种 model-harness 配置下,攻击成功率 12.6%-80.9%,任务可用性 75.0%-97.6%
可信度价值在于它测的是 harness 而非模型:六个阶段(配置、能力扩展、运行时操作、状态持久化、动作控制、事件恢复)、128 个沙箱用例、3 个 harness 与 6 个模型交叉共 14 种配置。12.6% 到 80.9% 的攻击成功率区间是核心结论——同一模型放进不同 harness,就是不同的安全姿态。
核验状态已核验
来源HarnessRisk (arXiv:2608.17597)

Markdown 版本(供 LLM 读取)

FAQ

HarnessRisk 测的是什么?

把 Agent harness 的安全责任拆为六个生命周期阶段,并构造 128 个沙箱用例测试。

HarnessRisk 的 2026 年前沿水平是多少?

在 14 种 model-harness 配置下,攻击成功率 12.6%-80.9%,任务可用性 75.0%-97.6%

HarnessRisk 可信吗?

价值在于它测的是 harness 而非模型:六个阶段(配置、能力扩展、运行时操作、状态持久化、动作控制、事件恢复)、128 个沙箱用例、3 个 harness 与 6 个模型交叉共 14 种配置。12.6% 到 80.9% 的攻击成功率区间是核心结论——同一模型放进不同 harness,就是不同的安全姿态。