Agent AI 安全评测
面向 Agent 工具链和大模型应用中的两类安全问题,形成第三方 Skills 安装前准入方案与大模型越狱攻防测试平台。
01
Agent Skills 安全准入第三方技能安装前治理
围绕技能包中的内容、权限与执行风险,组织风险识别、准入判断和后续治理。
02
大模型越狱攻防自动化红队测试平台
将攻击、模型、防御和评分接入统一平台,支持自动化运行、过程记录与横向比较。
01
项目将 Agent Skills 视为进入系统的第三方能力包,在安装和运行之前完成风险建模、检查决策和治理流程组织。
- 项目对象
- 包含指令、脚本、权限和外部能力的第三方 Agent Skills。
- 核心能力
- 识别技能内容与执行行为中的风险,并给出安装前的准入判断。
- 项目工作
- 构建评测数据、比较检查方案,并结合运行记录定位评测和工具链问题。
02
平台将原本分散的攻击方法、基座模型、防御方法和评分过程组织为可配置、可运行、可记录的测试系统。
- 项目对象
- 多类越狱攻击、开源与闭源模型,以及不同防御方法。
- 核心能力
- 统一配置和调度攻击、模型、防御与评分环节,保留完整运行记录。
- 项目工作
- 完成攻击方法接入、测试流程集成与检测分析,支持后续量化比较。
03
更多信息
快速了解项目方向、页面结构以及其他公开入口。
关注 LLM / Agent 评测中的数据构建、测试协议与错误归因。