Agent Memory Evaluation
Agent Memory 评测工具
面向 Agent Memory 执行过程复杂、结果归因困难的问题,开发可视化评测工具,协助研究者与评测 Agent 理解执行过程,进而辅助技术选型与方法迭代。
端到端证据可视化
以证据流程呈现“Benchmark 输入—Memory 处理—模型回答—评分”的完整链路,并支持从流程节点回溯真实 Context 与原始证据。
- 01Benchmark 输入
原始 Context、Query、参考答案和案例身份
- 02Memory 处理
构造、状态变化、存储以及检索结果
- 03模型回答
模型实际输入、原始响应和调用轨迹
- 04评分与判断
自动指标、Judge 输入输出和复核依据
由实际运行结果生成。页面同时呈现 Benchmark、Memory 方法、证据关系、案例导航与评分;进入案例后可继续查看检索结果、模型实际输入和回答。
展示内容的生产、转换与消费关系,从任意节点追溯上下游。
展示节点绑定的真实内容、状态、Prompt、Trace 与来源。
按照 Benchmark 的真实内容结构进入具体 Query 和案例。
统一评测与选型
通过机器可读的评测语义契约和来源 Adapter,将分散的运行结果组织为统一、可查询、可复核的评测环境。
核验实际保存、更新、检索和进入模型输入的内容。
对齐模型、Prompt、预算、检索深度、数据版本与评估协议。
结合最终表现与过程证据,支持特定条件下的方法选择和配置调整。
Runner、Harness 和 Memory 插件继续产生原生事实;工作台不要求它们重写为统一实现,而是在来源边界完成必要适配和语义组织。
为评测 Agent 提供信息
将分散在代码、Prompt、JSON 和 Trace 中的评测信息组织为结构化、可追溯的环境,减少规则理解、证据定位和结果核对中的重复工作。
- 评测条件
- Benchmark、Memory、模型、配置和版本
- 案例证据
- Context、检索、模型输入、回答和评分
- 证据关系
- 内容的生产、转换、消费和来源
- 判断记录
- 判断结果、引用证据与相应运行信息
围绕保存、更新、检索和注入过程提出可核对判断。
将建议关联到具体运行条件和证据,而不是只依赖总分。
为后续评测 Agent 的证据选择、判断持久化与迭代流程提供信息接口。
人类研究者可以通过关系图和 Card 阅读;评测 Agent 可以消费机器可读的字段、关系与来源信息。具体判断仍需显式记录所见证据和适用条件。
评测可靠性与故障归因
保留失败与不完整过程,区分执行状态、证据状态和运行来源,再沿评测阶段判断问题可能发生在哪里。
避免把明确为空、没有记录、部分记录和执行失败解释成同一种情况。
派生结果引用原始运行,不覆盖原始产物,也不把事后恢复表述为运行当时已经记录。
把最终异常定位到更具体的输入、处理阶段和责任边界。
事实在 Memory Action 前被静默截断
通过跨阶段 Trace 发现目标事实已经抽取,但在进入后续构造前丢失;该问题不会仅从最终分数中直接显现。
移除截断后暴露构造输出不完整
继续追踪发现模型输出预算导致 JSON 截断,说明运行集成问题和 Provider 约束需要与 Memory 方法表现分开判断。
检索有候选,但没有进入模型输入
对照检索日志与真实模型请求后发现 Context 注入未闭合,因此不能只依据召回记录或正确答案判断 Memory 产生了贡献。
项目架构
项目保留 Runner、Harness、Memory 方法和数据源的原生执行方式,在其上组织评测对象、运行记录、案例证据和面向不同消费者的投影。