Agent AI 安全评测

面向 Agent 工具链和大模型应用中的两类安全问题,形成第三方 Skills 安装前准入方案与大模型越狱攻防测试平台。

01
Agent Skills 安全准入第三方技能安装前治理

围绕技能包中的内容、权限与执行风险,组织风险识别、准入判断和后续治理。

02
大模型越狱攻防自动化红队测试平台

将攻击、模型、防御和评分接入统一平台,支持自动化运行、过程记录与横向比较。

01

Agent Skills 安全准入方案评测

独立研究|2026.01—2026.03|面向第三方技能安装前的风险识别与准入治理。

查看 Skills 评测详情

项目将 Agent Skills 视为进入系统的第三方能力包,在安装和运行之前完成风险建模、检查决策和治理流程组织。

项目对象
包含指令、脚本、权限和外部能力的第三方 Agent Skills。
核心能力
识别技能内容与执行行为中的风险,并给出安装前的准入判断。
项目工作
构建评测数据、比较检查方案,并结合运行记录定位评测和工具链问题。
02

大模型越狱攻防演练平台

核心成员|2025.09—2025.12|面向攻击、模型与防御方法的统一接入和自动化测试。

查看越狱评测详情

平台将原本分散的攻击方法、基座模型、防御方法和评分过程组织为可配置、可运行、可记录的测试系统。

项目对象
多类越狱攻击、开源与闭源模型,以及不同防御方法。
核心能力
统一配置和调度攻击、模型、防御与评分环节,保留完整运行记录。
项目工作
完成攻击方法接入、测试流程集成与检测分析,支持后续量化比较。
03

更多信息

快速了解项目方向、页面结构以及其他公开入口。

项目方向
01 / 02

关注 LLM / Agent 评测中的数据构建、测试协议与错误归因。