【导语:检索过往经验是增强LLM Agent决策能力的常见方法,但现有记忆增强Agent很少判断经验是否适配当前上下文,可能导致负面效果。上海AI Lab团队受人类调用记忆方式启发,提出“LLM Agent经验重构”框架MemHarness,性能显著提升且在OOD场景有强鲁棒性,但仍存在一些不足。】
多数现有记忆增强Agent会把检索到的经验当作静态记录,直接注入上下文,很少判断这些经验是否适合当前上下文,可能导致负迁移。而人类调用记忆会结合当前上下文,重新判断以往经验的使用方式。受此启发,上海AI Lab团队及其合作者提出了MemHarness框架,通过在检索与动作之间插入显式的记忆重构环节来主动处理检索到的经验,并通过GRPO端到端地学习这一能力,无需额外人工标注。
MemHarness的设计思路是在“检索”与“动作”之间显式插入“批判”与“重构”两个新环节,将记忆从静态提示片段转变为具有上下文敏感性的指导信息。具体流程包括检索,即根据最近几步的观测和动作判断是否调用历史经验并查询记忆库;重构,负责将检索到的经验改写成当前可用的指导,结合多方面信息比较过去与现在的差异,决定保留、改写还是丢弃;动作生成,模型结合当前历史信息和重构后的指导生成动作,整个流程依赖任务奖励并通过GRPO端到端优化。
研究团队在ALFWorld和WebShop两个具有挑战性的agent决策基准上评估了MemHarness。结果显示,它持续优于纯RL基线以及SOTA静态记忆增强方法。消融实验表明,去除重构阶段会使模型性能退化,证实自适应重构是性能提升的主要驱动因素。在OOD评测中,MemHarness能先判断记忆是否适用,改写或舍弃不匹配内容,具有强大鲁棒性。
目前MemHarness主要在ALFWorld和WebShop两个交互式基准上验证,尚未覆盖更开放、更多样的真实环境,未来需在更大规模模型和更开放环境中进一步验证。此外,冷启动模型本身任务表现有限,真正的重建和决策能力仍需依赖后续的任务级强化学习。
编辑观点:MemHarness框架为LLM Agent决策能力提升带来新思路,实验效果显著,但应用范围和冷启动问题待解决,未来发展值得关注。