LLM / Agent Evaluation

宋海军

北邮网络与信息安全硕士,关注 LLM / Agent 评测中的数据构建、测试协议与错误归因。

01

项目

当前展示 Agent Memory 评测工具,以及由 Skills 安全准入和大模型越狱攻防组成的 Agent AI 安全评测项目。

PROJECT 01

Agent Memory 评测工具

围绕 Agent Memory 评测链路复杂、最终结果难以归因的问题,组织从 Benchmark 输入到 Memory 处理、模型回答和评分的完整过程证据。

评测过程 端到端证据链
核心价值 可靠性验证与故障归因
进入 Memory 评测项目
PROJECT 02

Agent AI 安全评测

项目从 Agent Skills 安全准入和大模型越狱攻防两个场景展开,重点处理样本构建、测试流程与结果归因。

Agent 工具链 Agent Skills 准入评测
模型安全 大模型越狱攻防评测
进入安全评测项目
02

更多信息

快速了解项目方向、页面结构以及其他公开入口。

项目方向
01 / 02

关注 LLM / Agent 评测中的数据构建、测试协议与错误归因。