LLM / Agent Evaluation
宋海军
北邮网络与信息安全硕士,关注 LLM / Agent 评测中的数据构建、测试协议与错误归因。
01
项目
当前展示 Agent Memory 评测工具,以及由 Skills 安全准入和大模型越狱攻防组成的 Agent AI 安全评测项目。
PROJECT 01
Agent Memory 评测工具
围绕 Agent Memory 评测链路复杂、最终结果难以归因的问题,组织从 Benchmark 输入到 Memory 处理、模型回答和评分的完整过程证据。
评测过程
端到端证据链
核心价值
可靠性验证与故障归因
PROJECT 02
Agent AI 安全评测
项目从 Agent Skills 安全准入和大模型越狱攻防两个场景展开,重点处理样本构建、测试流程与结果归因。
Agent 工具链
Agent Skills 准入评测
模型安全
大模型越狱攻防评测
02
更多信息
快速了解项目方向、页面结构以及其他公开入口。
关注 LLM / Agent 评测中的数据构建、测试协议与错误归因。