Agent Memory Evaluation

Agent Memory 评测工具

面向 Agent Memory 执行过程复杂、结果归因困难的问题,开发可视化评测工具,协助研究者与评测 Agent 理解执行过程,进而辅助技术选型与方法迭代。

角色
独立开发
周期
2026.06—至今
项目重点
过程理解 · 统一评测 · 证据归因
01

端到端证据可视化

以证据流程呈现“Benchmark 输入—Memory 处理—模型回答—评分”的完整链路,并支持从流程节点回溯真实 Context 与原始证据。

  1. 01Benchmark 输入

    原始 Context、Query、参考答案和案例身份

  2. 02Memory 处理

    构造、状态变化、存储以及检索结果

  3. 03模型回答

    模型实际输入、原始响应和调用轨迹

  4. 04评分与判断

    自动指标、Judge 输入输出和复核依据

真实运行的 MemoryData 工作台:左侧展示 mem0 证据关系,右侧展示 EventQA 评测结果与案例导航
REAL WORKBENCH · MEM0 × EVENTQA 真实 mem0 评测界面

由实际运行结果生成。页面同时呈现 Benchmark、Memory 方法、证据关系、案例导航与评分;进入案例后可继续查看检索结果、模型实际输入和回答。

查看真实界面截图
关系图

展示内容的生产、转换与消费关系,从任意节点追溯上下游。

Context Card

展示节点绑定的真实内容、状态、Prompt、Trace 与来源。

原生导航

按照 Benchmark 的真实内容结构进入具体 Query 和案例。

02

统一评测与选型

通过机器可读的评测语义契约和来源 Adapter,将分散的运行结果组织为统一、可查询、可复核的评测环境。

Memory 方法mem0 / Letta / RAG / 外部插件
Benchmark不同任务、Context 与评测协议
结果来源本地运行 / 版本化结果包
来源 Adapter提取 Context 片段、原生 Trace 与运行信息
评测语义契约字段角色 · 身份 · 状态 · 来源 · 证据关系
理解方法机制

核验实际保存、更新、检索和进入模型输入的内容。

比较运行条件

对齐模型、Prompt、预算、检索深度、数据版本与评估协议。

辅助选型迭代

结合最终表现与过程证据,支持特定条件下的方法选择和配置调整。

数据生产与评测消费解耦

Runner、Harness 和 Memory 插件继续产生原生事实;工作台不要求它们重写为统一实现,而是在来源边界完成必要适配和语义组织。

03

为评测 Agent 提供信息

将分散在代码、Prompt、JSON 和 Trace 中的评测信息组织为结构化、可追溯的环境,减少规则理解、证据定位和结果核对中的重复工作。

STRUCTURED EVALUATION CONTEXT
评测条件
Benchmark、Memory、模型、配置和版本
案例证据
Context、检索、模型输入、回答和评分
证据关系
内容的生产、转换、消费和来源
判断记录
判断结果、引用证据与相应运行信息
01机制诊断

围绕保存、更新、检索和注入过程提出可核对判断。

02配置调整

将建议关联到具体运行条件和证据,而不是只依赖总分。

03自动化迭代基础

为后续评测 Agent 的证据选择、判断持久化与迭代流程提供信息接口。

同一份证据,不同消费者

人类研究者可以通过关系图和 Card 阅读;评测 Agent 可以消费机器可读的字段、关系与来源信息。具体判断仍需显式记录所见证据和适用条件。

04

评测可靠性与故障归因

保留失败与不完整过程,区分执行状态、证据状态和运行来源,再沿评测阶段判断问题可能发生在哪里。

记录状态
recordedemptyunrecordedpartialfailed

避免把明确为空、没有记录、部分记录和执行失败解释成同一种情况。

运行来源
originalresumereplayrescore

派生结果引用原始运行,不覆盖原始产物,也不把事后恢复表述为运行当时已经记录。

归因阶段
BenchmarkRunnerMemoryProviderScorer

把最终异常定位到更具体的输入、处理阶段和责任边界。

MEM0 / CONSTRUCTION

事实在 Memory Action 前被静默截断

通过跨阶段 Trace 发现目标事实已经抽取,但在进入后续构造前丢失;该问题不会仅从最终分数中直接显现。

PROVIDER / OUTPUT BUDGET

移除截断后暴露构造输出不完整

继续追踪发现模型输出预算导致 JSON 截断,说明运行集成问题和 Provider 约束需要与 Memory 方法表现分开判断。

EXTERNAL HARNESS

检索有候选,但没有进入模型输入

对照检索日志与真实模型请求后发现 Context 注入未闭合,因此不能只依据召回记录或正确答案判断 Memory 产生了贡献。

05

项目架构

项目保留 Runner、Harness、Memory 方法和数据源的原生执行方式,在其上组织评测对象、运行记录、案例证据和面向不同消费者的投影。

BENCHMARKContext · Query · Gold · Protocol
MEMORY / DATA SOURCEMethod · Plugin · Local · Versioned Package
来源适配与身份校验
评测对象与运行条件 Benchmark × Memory × Model × Evaluation Protocol × Configuration
评测运行 / 既有结果来源
CASE / QUERY稳定身份与原始输入
MEMORY构造 · 状态 · 检索
MODEL实际输入 · 回答 · Trace
EVALUATION评分 · Judge · 复核依据
语义契约与证据投影
研究者理解过程 · 比较方法 · 调整配置
评测 Agent选择证据 · 形成判断 · 记录依据
故障归因定位阶段 · 区分责任 · 约束结论