ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

初创实习Agent-LongMemEval

初创实习Agent-LongMemEval

LongMemEval 完整详细技术文档

一、基准概述

论文:https://arxiv.org/pdf/2410.10813
核心定位:面向大模型长期记忆智能体(Long-term Memory Agent)的评测基准,专门衡量模型在多段独立历史会话中检索、时序推理、知识更新、信息冲突处理、无法作答拒认(Abstention)能力。
数据集版本:你本地使用 LongMemEval_S(小规模子集,500条样本)。

关键区分:普通单 Session 评测 VS LongMemEval 跨 Session 评测

这是你核心疑问,先把本质差异讲清楚

  1. 传统单 Session 评测(常规对话/长上下文 QA )

    • 输入:连续一整段对话上下文,所有交互属于同一个会话;不存在会话边界、不存在不同日期、不存在信息新旧冲突。
    • 假设:所有信息在同一个聊天窗口,时序线性,不存在分段隔离的历史。
    • 模型任务:在连续文本里检索信息作答。

    过程:单 Session 中,只需要 Embedding 本次 Session 内的内容即可(Embed Queries),然后算相似度;
    复杂度:较低,单次会话内容是线性的,基本不会有知识冲突的情况; 无需做知识更新的处理;
    成本:较低,只需要对会话内的线性内容进行召回即可;

  2. LongMemEval 跨 Session 评测

    • 输入:大量互相独立、带有独立时间戳的会话(Session)。
      • 每一个Session= 一段历史聊天,会话之间存在时间间隔、互相隔离;
      • 不同Session可能存在事实冲突(旧知识 vs 更新后的新知识);
      • 目标问题发生在所有历史会话之后的新时间点。
    • 模拟真实Agent场景:用户多次开启新对话窗口和助手聊天,助手需要记住分散在多次聊天里的信息。
    • 模型不仅要检索,还必须基于时间先后取舍信息、处理知识更新。

简单类比:

  • 单 Session:你和用户连续聊一下午没有关窗口;
  • LongMemEval 多 Session:用户今天聊一次、三天后新开窗口再聊、一周后又新开窗口提问,助手要整合分散在多次独立聊天的内容。

过程:多会话的内容特别的复杂,而且是无序的,那么无序的会话想compactPrompt中,就需要海量Embedding,这个成本是十分高昂的,因此需要做一些粗筛和精筛,目的是找到相似的会话,然后再在会话中的内容里面进行 Embed,再 compact 到提示词中;
细节:(1)设计表,在识别用户意图的时候对Query进行分类,然后在QA的时候得到五元组(Type,Query,Fact,Time,Conf);(2)新的Query进来的时候直接在大类里面进行进行匹配(向量化、词频规则);(3)匹配得到的五元组变为三元组(QueryFactsTime)注入到提示词中,进行回答;
方法:(1)以会话这种大粒度为基准:会话 summary,构建会话与会话之间的关系,搜索到相似的会话之后先召回会话session_ids(粗筛),再在会话下面搜取相关内容(精筛);(2) 以单轮对话这种细粒度为基准:直接全局检索 Top-k 的单轮对话,召回他们的 QA 和 session_id;
问题:第二种在返回 session_id 的时候,容易出现冗余的情况,即 Top-k 都来源于同一 Session,虽然其余的分数较低,但是依然重要;实验也证明,在单 Session 下指标不错,跨 Session 就不行了;

二、数据集基础统计(LongMemEval_S)

总样本:500条

  • Abstention(信息不足,应当拒答):30条(question_id包含_abs
  • 平均每条样本历史会话数量:47.73 个 Session
  • 平均每条样本总对话轮次:493.5 turns

题型全集与能力目标

题目包含单会话的 QA 和多会话的 QA,还包括找矛盾事件:

<
题型样本数量
返回列表