LLM / Agent Evaluation

宋海军

北邮网络与信息安全硕士,关注 LLM / Agent 评测中的数据构建、测试协议与错误归因。

01

项目

当前展示 Agent Skills 安全准入与大模型越狱攻防两项工作,以及两者共用的评测方法。

PROJECT 01

Agent AI 安全评测

项目从 Agent Skills 安全准入和大模型越狱攻防两个场景展开,重点处理样本构建、测试流程与结果归因。

Agent 工具链 Agent Skills 准入评测
模型安全 大模型越狱攻防评测
进入安全评测项目
02

更多信息

快速了解项目方向、页面结构以及其他公开入口。

项目方向
01 / 02

关注 LLM / Agent 评测中的数据构建、测试协议与错误归因。