宋 海 军

Agent / 大模型评测 | 2003.04 | 13339114430 (微信同号) | hjs@bupt.edu.cn |个人主页

教育背景

2024.09 - 2027.06 北京邮电大学 网络与信息安全(硕士) Top 10%
2020.09 - 2024.06 北京邮电大学 信息与计算科学(本科) Top 10%

实习与项目经历

中电信人工智能有限公司 · 星辰通用人工智能实验室 | Agent 评测实习生

面向 TeleAgent 真实业务场景,参与自研及主流模型横向评测、真实业务评测集建设与评测标准完善,为模型能力诊断和迭代提供依据。

  • 场景化模型评测:围绕 TeleAgent 真实业务场景,从线上回流会话中抽取任务,并按代码、Deep Research、系统操作、内容创作、办公等场景分类;参与自研及主流模型横向评测、评分标准制定和人工评审,汇总评分与 rollout 数据,分析模型综合能力及细分场景表现。
  • 评测数据闭环:基于线上回流任务的场景分布与共性特征,批量构造数百条定向评测数据;在后续模型评测中验证并持续完善样本,细化评测维度与评分标准,沉淀真实业务场景下的 Agent 评测集。
  • 评测标准与质控:针对办公类开放式、交互式任务,结合文件与页面产物核验、LLM-as-a-Judge 和人工评审完善评分规则,分析非唯一答案、Judge 评分波动及不同 Agent 追问策略对横向可比性的影响。

MemoryData Workbench · Agent 评测语义可观测与 Benchmark 审计工作台 | 独立开发

面向 Agent Memory 评测中数据来源分散、上下文难以追溯和结果难以解释的问题,开发评测语义可观测与 Benchmark 审计工作台。

  • 证据链可视化:构建 Agent Memory 评测可观测性工作台,以证据流程图呈现“Benchmark 输入—Memory 处理—模型回答—评估”的端到端链路,支持从流程节点回溯真实 Context 与原始证据,辅助定位评测链路中的问题。
  • 统一评测与选型:设计机器可读的评测语义契约,通过 Adapter 接入不同 Memory 方法与 Benchmark 的运行结果,统一登记评测数据的来源、关系与含义;开展端到端评测和受控消融,结合任务效果、检索保真度、长程稳定性与操作时延形成架构选型和配置建议。
  • 为评测 Agent 提供信息:基于语义契约为评测 Agent 提供结构化、可追溯的评测 Context,减少其在规则理解、证据定位和结果核对中的重复工作;关联保存评测判断及其证据依据,为 Memory 机制诊断、配置调整与自动化迭代提供支持。
  • Benchmark 审计:审计 AMemGym 的 On-policy 评测策略,分析状态披露、Simulator、Validator 与交互轨迹生成对任务构念和结果可比性的影响,通过受控对照提出并验证 Benchmark 策略迭代建议。

实验室 AI 安全评测项目 | 核心成员

围绕 AI 安全,参与安全评测数据集构建、统一评测流程及检测方案验证。

  • 准入评测:从 0 到 1 推进 Agent Skills 安装前安全准入评测,完成风险维度、200+ 样本与方案对比,并将评测方案和结果交付给公司团队相关人员。
  • 攻防评测:作为实验室安全评测项目的组成部分,参与越狱攻防评测流程建设,集成 GCG、PAIR、FlipAttack 等攻击方法,并开展攻击检测、跨攻击迁移和良性样本误报分析。

技术能力

工程工具:使用 Python、Linux、Git、Docker 与模型 API 开展 Agent 评测任务运行、数据处理和评测产物留存。

评测分析:具备真实业务评测数据构建、rollout 分析、LLM-as-a-Judge 与人工评审经验,关注 Badcase 归因、Benchmark 信效度及结果可比性。