
资料展示下面是我整理的AI大模型 学习资料和工具包预览适合收藏后按主题逐步学习11今天我们来聊一个被很多人低估、却决定 AI Agent 成败的核心要素——记忆系统。最近SwirlAI 创始人 Aurimas Griciūnas 在 X 上发了一篇关于 AI Agent 记忆的深度帖配图清晰、框架实用迅速引发社区讨论。这篇文章将基于他的分享结合 CoALA 论文等前沿认知架构系统拆解 AI Agent 的记忆设计帮助你从“提示词堆砌”升级到真正的“上下文工程”。为什么 Agent 需要记忆没有记忆的 Agent 只是金鱼我们与 LLM 的每次对话都是无状态的。而 AI Agent 要自主规划、调用工具、长期执行复杂任务必须记住过去、理解现在、指导未来。Aurimas 把 Agent 记忆定义为通过 Prompt 传递给 LLM 的上下文帮助 Agent 基于过去交互或外部数据更好地规划和行动。简单说记忆让 Agent 从一次性工具变成有经验的伙伴。记忆通常分为长期记忆Long-Term Memory长期记忆又细分为三类情景记忆Episodic语义记忆Semantic程序记忆Procedural。短期/工作记忆Short-Term / Working MemoryAgent 记忆的四大核心类型1.情景记忆Episodic Memory这是 Agent 记录“过去发生了什么”的记忆。包含具体交互、动作、结果和完整上下文。实现方式通常存入向量数据库Vector DB通过语义搜索召回相似经历。作用让 Agent 从历史案例中学习避免重复犯错或复用成功策略。例子用户上周让 Agent 分析销售数据它记住了当时的查询参数、工具调用顺序和最终输出。下次类似任务时它能直接参考避免从零开始。2.语义记忆Semantic Memory这是 Agent 的“百科全书”和外部 grounding 信息。存储事实、领域知识、用户偏好、企业内部文档等。类似 RAGRetrieval-Augmented Generation系统可从海量数据中隔离精准知识。作用减少幻觉提供准确、个性化的响应。例子客服 Agent 记住公司产品规格、退货政策、用户历史偏好研究 Agent 记住特定领域的最新论文摘要。3.程序记忆Procedural Memory这是“知道怎么做”的记忆系统级信息。包括 System Prompt 结构、可用 Tools、Guardrails防护栏、工作流规则等。存储位置Git 仓库、Prompt Registry、Tool Registry。作用定义 Agent 的行为规范和技能让它“熟练”执行任务。例子规定“先检查权限、再调用 API、最后输出 JSON 格式”或不同任务状态下启用不同工具子集。4.短期/工作记忆Short-Term / Working Memory这是 Agent 实时运行时的“内存条”。从长期记忆中动态拉取相关信息 当前对话上下文 中间推理结果。最终编译成完整的 Prompt 喂给 LLM。特点容量有限但高度相关、实时更新。Agent 应用会根据当前任务从持久化存储中“拉取”必要长期记忆放入工作记忆中。记忆架构如何影响 Agent 性能好的架构不是简单把所有历史塞进上下文而是智能检索、过滤、衰减。需要考虑检索策略向量 关键词 图谱混合遗忘/衰减机制老旧信息权重降低一致性维护避免矛盾知识多 Agent 协作时的共享与私有记忆常见挑战上下文膨胀导致 Token 成本爆炸召回不准无关历史干扰当前决策隐私与安全用户数据如何隔离跨会话持久化难题前沿实践参考Mem0开源记忆框架支持多类型记忆、智能提取与衰减。LangChain / LlamaIndex 等框架的记忆模块。企业级结合 Graph Database 做知识图谱 Vector DB 做语义检索。CoALA 框架Princeton 等系统化认知架构参考。如何落地构建 Agent 记忆系统入门建议从简单开始先实现对话历史 向量召回情景 语义。进阶引入 Prompt/Tool Registry 管理程序记忆。生产级设计清晰的记忆生命周期存储 → 检索 → 更新 → 遗忘加上监控与评估。技术栈推荐存储Pinecone / Weaviate / Chroma向量、Neo4j图谱框架LangGraph、CrewAI、AutoGen 等评估记忆相关性、决策准确率、Token 效率随着多模态、长期运行 Agent 的发展记忆系统将越来越像人类大脑分层、分模块、支持遗忘与强化。真正强大的 Agent 不是参数量最大而是“记得住、用得好”。如果你用过智能客服、企业知识库助手或任何多轮对话 AI大概率遇到过这些情况突然失忆聊到第 5 轮它突然忘了你前面提过的关键信息自相矛盾换个问法给出的答案和之前完全矛盾一键清空今天聊完明天打开对话一切从零开始胡编乱造聊到后面它开始编一些你没说过的内容。这不是大模型不够聪明而是记忆系统没有设计好。Agent 记忆陷阱上下文窗口容量 ≠ 记忆大模型的上下文窗口已从早期的几千 Token 扩展到如今的百万级。 但能装下和记得住是两回事。长文本中处于中间位置的信息最容易被忽略即Lost in the Middle现象。 把全部历史无差别塞进 Prompt就像让顾问翻阅公司十年档案。信息过载反而会导致关键事实被淹没。随着对话轮次增加模型对早期信息的召回率呈非线性下降。核心结论上下文窗口解决的是容量问题不是记忆问题。记忆检索噪音大海捞针捞出一堆废铁假设你在图书馆找机器学习的书系统却推了机械学习、机器人教育等。 这就是记忆检索中的噪音问题。向量检索按语义相似度召回Top 50 的结果里真正相关的可能只有 3 条。 如果不做筛选和去重Agent 会被这些看起来有点像的干扰项带偏。记忆污染张三的数据串到了李四身上如果多用户系统没做好数据隔离用户 A 的信息和用户 B 的记录会被一并召回。 Agent 输出的张三李四合并体看似合理实则是数据串台。❌ 严禁操作写入时不隔离写入时不隔离检索时再怎么过滤都补不回来正确做法是把userId、sessionId作为写入路径的硬约束从源头杜绝交叉污染。Embedding 模型不匹配通用词典翻译不了专业术语通用Embedding模型擅长日常语言但在专业领域容易望文生义。 在医疗场景它可能把病理切片和披萨切片判定为相似。如果 Agent 服务于专业领域必须使用领域适配的 Embedding 模型。⚠️隐蔽的坑不同模型的向量空间不兼容。 升级前必须全量重新计算向量并打上版本标记否则新旧记忆会互相串台。记忆系统架构记忆不能一锅炖。三层划分的依据是写入频率、生命周期、检索方式的本质差异层级定位存储介质容量速度持久化检索方式工作记忆当前对话实时上下文Prompt 内小最快不持久滑动窗口短期记忆本会话期间上下文Redis/ 内存中快会话级按 Key / 时间长期记忆用户画像与历史知识向量库 关系库大较慢永久语义检索五种记忆类型与分层规则在写入前需先对信息进行分类类型含义示例FACT用户的事实信息我是企业版用户、订单号是 12345PREFERENCE用户的偏好习惯请用简洁语言、我喜欢表格INSTRUCTION用户的明确指令每次输出前先总结、用中文回答CONTEXT当前会话上下文我们正在讨论 Q3 预算EPISODE具体的交互事件上周咨询过退款流程分层写入规则工作记忆存放当前对话的CONTEXT实时滑动更新。短期记忆存放本会话的CONTEXT和EPISODE按小时/天过期。长期记忆存放FACT、PREFERENCE及高价值的INSTRUCTION永久保存。工作记忆是当前屏幕上的几行字实时窗口短期记忆是本会话的全部聊天记录备份Redis 缓存。超出窗口的早期对话就靠短期记忆找回。为什么FACT和PREFERENCE要进长期记忆用户说我对利率敏感是用户画像不能 7 天就过期。短期记忆更适合放“这次聊了什么”这种会话级信息。记忆流转路径系统对长文本的处理并非简单的线性存储而是一个抽取-分类-双轨流转-融合生成的完整闭环。其核心流转机制可拆解为以下四个阶段解析与分类通过 LLM/NER 将长文本拆解为独立的“记忆原子”并由多标签分类器为其打上独立标签FACT / PREF / INS / CTX / EP。双轨流转系统根据标签属性将数据分流至“写入通道面向未来存储”与“检索通道面向当前调用”分别沉淀至工作记忆、短期记忆与长期记忆中。融合与重排对多路召回的记忆素材进行 MMR 去重与时效性衰减处理确保上下文的高质量与高相关性。构造与生成将重排后的上下文素材精准拼装进 Prompt驱动大模型生成最终回复。核心机制解析工作记忆滑动窗口 摘要压缩只保留最近 N 轮对话。超过上限时将最早消息压缩为摘要而非直接丢弃。工作记忆 最近 N 轮对话 如果 总 Token 数 上限 最早消息 取出最早的一条 摘要 压缩(最早消息) 工作记忆.add(摘要) // 保留精华释放空间 移除原始消息短期记忆会话级缓存相当于 Agent 的 便签本仅在本会话或短时间内有效。短期记忆存储(信息, 类型): 如果 类型 EPISODE: TTL 24小时 如果 类型 CONTEXT: TTL 2小时 存入 RedisKey 带 userId sessionId⚠️注意TTL时间需按照实际业务场景动态调整。长期记忆向量检索与智能治理长期记忆是 Agent 的“专属知识库”。要让它好用必须解决三个核心问题✅ 智能去重拒绝“废话文学”如果 AI 每天听到“老板喜欢吃辣”、“老板爱吃川菜”它不能傻傻记三条。动作每次记新东西前先检索有无相似度 92% 的旧记录。结果有则合并更新无则新建笔记。收益保证知识库干干净净不浪费存储空间。 MMR 检索的“偏科旋钮”传统“最相关”检索容易找回一堆意思重复的废话。引入MMR最大边际相关性机制核心逻辑是“既要相关又要不一样”先海选粗略捞出 30 条相关记忆。再精选计算综合分相关性加分与已选记忆相似度扣分。最终结果挑出的记忆紧扣主题且视角丰富。注公式中有一个多样性旋钮λ。调高相关性则紧扣字眼调高多样性则视角更广。怎么忘—— 记忆衰减机制人的大脑会自动遗忘AI 也一样。我们需要一套“遗忘机制”遗忘公式存活价值 重要程度 × 新鲜度(随时间打折)。定期清理存活价值跌破底线时自动扔进回收站。区别对待客观事实FACT如“公司法人是谁”衰减极慢。事件插曲EPISODE如“上周客户抱怨快递慢”衰减极快。记忆路由三层协同def process_input(user_input): working_memory.add(user_input) short_term_memory.store(session_context) if info_importance 0.7: long_term_memory.store(info) def build_prompt(): context_materials ( working_memory.get(last_5_turns) short_term_memory.get(session_related) long_term_memory.semantic_search(top_10) ) # 按 相关性 时效性 重要性 综合排序 return format_output(context_materials)资料展示下面是我整理的AI大模型 学习资料和工具包预览适合收藏后按主题逐步学习