中电信人工智能有限公司 · 星辰通用人工智能实验室 | Agent 评测实习生
面向 TeleAgent 真实业务场景,参与自研及主流模型横向评测、真实业务评测集建设与评测标准完善,为模型能力诊断和迭代提供依据。
场景化模型评测:围绕 TeleAgent 真实业务场景,从线上回流会话中抽取任务,并按代码、Deep Research、系统操作、内容创作、办公等场景分类;参与自研及主流模型横向评测、评分标准制定和人工评审,汇总评分与 rollout 数据,分析模型综合能力及细分场景表现。
评测数据闭环:基于线上回流任务的场景分布与共性特征,批量构造数百条定向评测数据;在后续模型评测中验证并持续完善样本,细化评测维度与评分标准,沉淀真实业务场景下的 Agent 评测集。
评测标准与质控:针对办公类开放式、交互式任务,结合文件与页面产物核验、LLM-as-a-Judge 和人工评审完善评分规则,分析非唯一答案、Judge 评分波动及不同 Agent 追问策略对横向可比性的影响。
MemoryData Workbench · Agent 评测语义可观测与 Benchmark 审计工作台 | 独立开发
面向 Agent Memory 评测中数据来源分散、上下文难以追溯和结果难以解释的问题,开发评测语义可观测与 Benchmark 审计工作台。
证据链可视化:构建 Agent Memory 评测可观测性工作台,以证据流程图呈现“Benchmark 输入—Memory 处理—模型回答—评估”的端到端链路,支持从流程节点回溯真实 Context 与原始证据,辅助定位评测链路中的问题。
统一评测与选型:设计机器可读的评测语义契约,通过 Adapter 接入不同 Memory 方法与 Benchmark 的运行结果,统一登记评测数据的来源、关系与含义;开展端到端评测和受控消融,结合任务效果、检索保真度、长程稳定性与操作时延形成架构选型和配置建议。
为评测 Agent 提供信息:基于语义契约为评测 Agent 提供结构化、可追溯的评测 Context,减少其在规则理解、证据定位和结果核对中的重复工作;关联保存评测判断及其证据依据,为 Memory 机制诊断、配置调整与自动化迭代提供支持。
Benchmark 审计:审计 AMemGym 的 On-policy 评测策略,分析状态披露、Simulator、Validator 与交互轨迹生成对任务构念和结果可比性的影响,通过受控对照提出并验证 Benchmark 策略迭代建议。
实验室 AI 安全评测项目 | 核心成员
围绕 AI 安全,参与安全评测数据集构建、统一评测流程及检测方案验证。