Agent Skills 安全准入方案评测

面向第三方 Agent Skills 的安装前安全检查,构建评测数据、比较不同准入方案,并通过运行日志解释漏报、误判与工具链故障。

安装前准入 评测协议 失败归因

把第三方 Skills 的安全检查前移到安装之前

项目首先定义需要检查的风险,再构建人工核验样本,将静态扫描、混合扫描与 Agent 自审放入同一评测框架。除比较检查结果外,还通过运行日志确认样本是否真正进入评测流程。

01
威胁模型与评测数据

覆盖显性代码攻击、隐性文档注入,以及命令执行、文件操作和网络通信等行为风险。

02
检查方案比较

比较静态扫描、混合扫描与 Agent 自审,观察拦截能力、误报控制和工程稳健性。

03
评测链路归因

定位路径解析、运行目录和 JSON 结果读取问题,区分真实漏报、语义误判与工具故障。

01

为什么放在安装前检查

Skills 通常以独立文件包进入系统。来源、脚本和权限组合在安装前已经可见,适合先完成一次明确的准入判断。

把风险拦在运行环境之外

静态文件、指令文本、脚本入口和权限声明可以在技能真正执行前被检查,减少只依赖运行时兜底的压力。

安全方案本身也需要被评测

只看“是否报警”不足以判断方案质量,还需要同时观察漏检、误报、解析失败和长上下文污染。

02

评测设计与数据结构

将样本、风险分类、检查方案和评价维度放在同一套协议中,确保不同方案的结果可以复核和比较。

  1. 01样本筛选

    从 ClawHub 技能中定位正常与高风险候选样本。

  2. 02分类与人工核验

    按文本风险和行为风险标注,确认样本内容与预期标签。

  3. 03运行检查方案

    在统一输入与环境下执行静态、混合和 Agent 自审方案。

  4. 04复核与链路归因

    结合输出和日志区分报警、真实漏报、语义误判与工具故障。

03

数据与结果口径

结果报告同时记录数据基础、评价维度和链路状态,避免把没有真正执行的样本直接计入漏报。

200+ 样本

从 ClawHub 技能中筛选、分类并人工核验 200+ 样本,形成用于安装前准入方案比较的安全评测集。

3 个评价维度

同时观察拦截能力、误报控制与工程稳健性;检出率和误报率需要在相同运行条件下比较。

链路可靠性

样本未进入检查、审计结果丢失或解析失败,都可能在表面上表现为方案漏报,需要结合运行日志复核。

05

从风险定义到分层治理

内容风险与行为风险采用不同的描述方式,经过对应的检测通道形成证据,再进入可组合的四层治理链路。

风险范式 A

内容风险

显性代码攻击与隐性文档注入,通过代码静态分析和文本语义审计识别。

风险范式 B

行为风险

6 大类、30+ 小类,通过检测方法与黑盒场景验证技能的实际能力边界。

  1. L1

    静态规则

    先处理可直接判定的文件、脚本与权限风险。

  2. L2

    语义审计

    再判断复杂指令、文档注入、意图与上下文关系。

  3. L3

    情报纠偏

    结合来源与信誉信息复核异常结果,控制误报。

  4. L4

    隔离审计

    对高风险或难以判定的技能,在独立上下文或受控环境中继续验证。

06

项目结论

安装前检查能够提前发现部分高风险技能,但评测结果仍受到测试场景、工具实现和运行环境影响。

适用范围

结论限定在 OpenClaw 测试场景、对应工具实现和实际运行环境。

指标口径

检出率和误报率只有在样本、模型、实现版本和运行方式一致时才具有可比性。

探索方向

情报校验和隔离审计用于补充静态扫描与 Agent 自审,尚未进入统一协议下的结果比较。

信息披露

高风险攻击样本保留在受控测试范围,不公开反向 Shell、数据外传和持久化等完整执行配方。