
背景一般的 Agent 记忆系统应用场景大多是记住上下文、记住偏好、记住上次聊到哪了但记忆系统的本质能力对用户持续建模、把碎片信号沉淀为结构化理解。因为记忆系统其实和做转化链路解决的是同一个问题把用户从ID 行为日志还原成人。区别只是输出端不同——对话里输出的是回复转化里输出的是触达动作。中间那层用户理解是同一份资产可以复用。最典型的落地场景是主动转化。加购不付款、收藏不转化、深夜反复看同一件商品——这些想买又没买的信号每天都在产生。常规做法行为特征 概率圈人 批量触达能用但链路跑深了会发现圈人和推荐商品环节缺的不是一个更好的模型而是一个能把用户状态说清楚的中间层。记忆系统恰好能填这个位置圈人环节用记忆系统做用户筛选双塔推荐商品环节用户塔和商品塔都建在记忆之上中间用 Uplift 模型判断该不该推。核心环节的公式、模型选型和工程实现按落地顺序展开。一、转化触达的常规做法主动转化这事传统触达系统跑的是一条很直的链行为特征 → 概率打分 → 圈人 → 批量触达。它回答的问题很明确谁更可能下单。这套逻辑成熟、好落地到今天依然是绝大多数运营系统的底座对这个目标来说够用。但它有一个天然的天花板它把每个用户压缩成了一组统计特征和一个分数不关心这个人现在卡在哪一步、心里在犹豫什么。同样是加购未付款有人在比价有人在纠结款式有人只是忘了有人其实已经决定只差一个付款提醒——在统计特征里他们是同一个人拿到的触达动作也完全一样。这类信息传统链路没有刻意建模而它恰好是记忆系统每天都在产出的东西。一般的 Agent 记忆系统为了让对话记住人沉淀了一套双层结构长期记忆记录稳定属性品类偏好、消费力、决策习惯短期记忆记录当下状态最近在关注什么、进行到哪一步。而做转化要回答的恰恰是同一组问题——用户处在哪个决策阶段、想要什么、卡在哪个点上。把记忆系统从 Agent 的执行上下文里拿出来当成业务逻辑的公共底座。让它也融合进用户触达转化的流程中。二、实现方案三、记忆系统先看记忆本身。两层记忆的定位完全不同更新频率也不同。长期记忆用户是什么样的人。日级更新剔除偶然行为干扰{ category_preference: 数码/外设, spend_level: mid-high, annual_purchase_frequency: 8, decision_cycle_days: 4, historical_orders: [2025-08 机械键盘 ¥680, 2025-11 游戏鼠标 ¥599] }短期记忆用户此刻在想什么。分钟级聚合近实时刷新09:15 搜索机械键盘 09:18 浏览某款 90 秒 09:30 加购 ¥658 商品未付款 20:15 搜索机械键盘轴体区别 20:18 浏览机械键盘选购指南长期记忆归纳出数码爱好者、中高消费、决策周期 4 天左右。短期记忆提炼成已锁定机械键盘方向、正在比较两款、加购未付款、晚间还在研究轴体差异——价格敏感处于临门一脚。同一堆原始行为统计特征只能得到search3, cart1记忆系统能告诉你决策阶段。这就是它作为链路地基的原因。四、LightGBM 特征打分圈人回答的是谁值得进触达池。常规做法直接拿行为统计做特征而这里中间会多了一步先用记忆把用户翻译成状态再喂给模型。原因前面说过——同样加购未付款背后的决策阶段完全不同。这一步信息不补上模型再调也是在天花板下面做优化。补信息的方式是让 LLM 把两层记忆压成固定 Schema{ intent_score: 9, category: 机械键盘, decision_stage: 3, price_sensitivity: 2, purchase_window: 未来1-3天, hesitation: 已加购但仍在比较价格和轴体, tags: [数码爱好者, 高意愿, 价格敏感] }类别字段转成编码比如决策阶段阶段编码浏览1比较2临门一脚3已决策4散乱的记忆变成统一的状态表后再叠加语义向量整段结构化记忆过 Embedding 得到 768 维向量PCA 压到 62 维。为什么必须降维因为正样本太少——4 万人里下单的只有约 200 人768 维直接进模型过拟合几乎是必然的。62 维是在这个样本量下验证过比较稳的压缩维度。最终每个用户拼成一条固定长度的特征向量62 维语义 Embedding 5 维 LLM 结构化字段 2 维长期画像 6 维行为统计 75 维用户特征[0.23, -0.15, 0.87, ..., 9, 3, 2, 8, 4, 5, 420, 1, 14, 365, 650]特征就绪后模型本身反而不复杂LightGBM 二分类预测目标拆两个窗口再融合——final_score 0.6 × score_1d 0.4 × score_3d权重是调出来的既照顾明天就买的紧迫用户也不漏掉还要犹豫两三天的人。想覆盖更长的唤醒场景可以再加 7 天窗口道理一样。譬如某用户 1 天窗口预测 0.89、3 天窗口预测 0.95融合后0.6 × 0.89 0.4 × 0.95 0.914——两个窗口意愿都高稳稳排进池子。另一个用户 1 天只有 0.3、3 天有 0.8融合后只有 0.5他近两天不会买排不到 Top等行为有变化下一轮再评估。拆多窗口而不是只预测单日意义就在这——别把马上买和会买但还要想想的人挤在同一条赛道上比。由于当前场景正样本占比不到 1%树模型足够表达、训练快、重训成本低。样本这么少还上深度模型不是先进是过拟合。树学出来的东西也直观某棵树学到加购了且 intent_score 7 → 概率显著提高另一棵修正加购超 24 小时未付款 → 可能进入犹豫、概率下调几百棵树叠起来就是用户的购买概率。LightGBM 主要负责将 75 维特征变成分数、排序、切池而在记忆和 Schema 那两层主要负责理解用户。预测完按分数降序排序取 Top 5% ≈ 2000 人。圈人效果随机抽 2000 人 → 约 10 单 ≈0.5% 模型 Top 5% 2000 人 → 约 110 单 ≈5.5% 模型 Top 1% 400 人 → 约 32 单 ≈8%记忆在圈人这一层的贡献是让同样的模型拿到更接近真实决策状态的特征。但圈到人只是第一步——2000 个人里不是都该推而是需要进一步找转换高的客群进行触达五、Uplift Model直觉上概率最高的用户当然最该推。但补上两行信息再看用户 AP(买 | 触达) 0.90P(买 | 不触达) 0.88 → 增量 0.02 用户 BP(买 | 触达) 0.70P(买 | 不触达) 0.25 → 增量 0.45A 不推也有 88% 会买推他只是让利B 才是被推一下就从 25% 跳到 70% 的人。Uplift 的定义公式uplift(user) P(购买 | 触达) − P(购买 | 不触达)预测模型回答谁本来会买Uplift 回答谁会因为我的触达而买。前者把人选进池子后者决定钱花在谁身上。按这两个维度用户可以切成四类Uplift Model预测模型必须有 Treatment / Control 数据也就是得先做 AB 实验。在加购未付款这类高意向人群里随机抽 2000 人一半触达、一半不触达跑一段时间看结果Treatment1000 人 → 55 人购买转化率 5.5% Control 1000 人 → 45 人购买转化率 4.5% 整体增量只有 1 个百分点整体看触达效果很弱。但 1% 不是结论——平均效果弱恰恰说明增量藏在少数人身上无差别触达把它稀释了。Uplift 的意义就是把这 1% 是谁贡献的找出来。实现上用 T-Learner——名字来自 Treatment实验组一个模型、对照组一个模型。思路直白两个模型分开学# 实验组数据训练学到被触达的人里什么样的人会买 model_treat LGBMClassifier() model_treat.fit(X_treat, y_treat) # 对照组数据训练学到没人推的时候什么样的人会自然买 model_ctrl LGBMClassifier() model_ctrl.fit(X_ctrl, y_ctrl)上线后对同一个用户分别预测、再相减uplift model_treat.predict_proba(X)[:, 1] - model_ctrl.predict_proba(X)[:, 1]S-Learner 它只训一个模型把是否触达当成一维普通特征——S-LearnerP(购买 | 用户特征, 是否触达) 同一个用户分别代入 触达1 / 触达0两个概率相减 增量好处是模型少、样本不拆半但不适用1. 弱增量场景里树模型根本用不上这个特征。触达整体提升只有 1%对信息增益来说是否触达几乎不提供分裂收益树不会选它做分裂——S 学出来的两组差异趋近于零。信号不是不存在而是被特征值不值得分裂这道筛选过滤掉了。2. 两组用户遵循的是两套决策规律。被触达后买不买和没人推自然买不买是两种决策逻辑。S 用一棵树的同一套分裂结构同时拟合两套规律两边互相拉扯两头都不够准。T-Learner 的应对是把差异直接建在结构上两个模型各学各的规律输出端相减就是增量不经过任何特征筛选。代价也要交代样本一分为二、模型容量翻倍正样本本来就只有几百个两组会更薄。采用LightGBM、并把 AB 数据持续回流的原因之一——T-Learner 对样本量的胃口比 S 大只能靠时间喂饱。等数据再涨一两个量级可以升级 X-Learner拿 T 的输出当伪标签再做一轮拟合。最后给 2000 个高意向用户算增量分、设阈值过滤留下约 1500 人进触达队列。两个例子收尾这一段。用户 A加购了反复回看还把商品分享给了家人。LightGBM 0.93妥妥进池子。P(买 | 触达) 0.91 P(买 | 不触达) 0.87 uplift 0.04她不是高意向她是已经决定了只是还没付款。推她 给一个必然到来的订单送券Uplift 把她滤掉。用户 B反复搜索、在几款之间比价、还没加购。LightGBM 0.724也进池子。P(买 | 触达) 0.70 P(买 | 不触达) 0.28 uplift 0.42他正处在犹豫的节骨眼上一张对味的券或一次客服沟通可能就改变了决定——Uplift 把他留下来。同样花 100 块营销预算前者买来的是折扣后者买来的是增量订单。补充一个工程细节Uplift 直接复用第五步算好的 75 维特征不再回头读记忆、不再做一次 LLM——记忆系统理解一次用户圈人和增量判断两处都吃到了。六、商品搜推圈人解决推谁商品搜推解决推什么。搜推的链路采用双塔向量召回原理上跟 RAG 是同一个套路——用户是 query商品是 document。差别在于这座双塔的两边都建在记忆系统之上。用户塔。不从原始行为直接做 embedding而是先让 LLM 读用户记忆提炼成一条具体的需求 Query机械键盘茶轴三模500 元以内适合入坑的第一把这句话里茶轴、三模、500 元以内来自短期记忆——他正在比较的两款就是这些配置“适合入坑的第一把来自长期记忆——他是新手不是发烧友。没有记忆Query 只能退化成机械键盘”。商品塔。商品侧也走了同一套流程——LLM 给每个商品建商品记忆档案结构示意{ sku: K870 三模机械键盘, 属性: [87 键, 茶轴, 三模, 热插拔], 卖点: 段落手感办公游戏兼顾入门首选, 适用人群: 第一把机械键盘的新手用户, 典型纠结: 轴体不会选 → 配选购对比内容转化更好 }核心属性、卖点、适用人群、典型口碑归纳成结构化档案再向量化成商品向量。商品在塔里不再是一行数据库字段而是一个能被语义检索的档案。线上检索时用户 Query 向量和商品向量算余弦相似度取 Top N再结合记忆里的犹豫点价格敏感担心质量纠结参数决定权益和话术边界也要交代清楚双塔回答匹配度高不高回答不了会不会买——匹配度高的人可能只是随便逛逛。所以双塔只负责推荐商品这一段圈人不用它。每个模型只在自己擅长的地方出场。七、迭代回流触达不是终点反馈要回到记忆里去这套系统才算闭环。触达之后谁点击、谁下单、谁忽略回流后做两件事短期记忆更新他的犹豫点解除了没有、是买在触达前还是触达后订单沉淀进长期记忆品类偏好、消费力、决策周期都跟着变。记忆里装的是理解理解要靠真实结果不断校准。每天凌晨整套系统自动跑一遍03:00 读取当日活跃用户的记忆 03:30 LLM 批量压缩用户状态特征工程 04:30 生成 75 维特征 04:31 圈人预测 → Top 2000 04:33 Uplift 过滤 → 约 1500 人 04:35 需求 Query 商品召回 09:00 Push / 优惠券 / 客服触达 全天 点击、下单、忽略数据回流 次日 更新记忆新样本进训练集八、小结把整条链路收成四个层层递进的问题如果只做购买预测解决的是谁最可能买如果再加入 Memory解决的是为什么这个用户可能买他现在到底处于什么状态如果再加入 Uplift这个用户到底值不值得触达最后再加入商品匹配如果要触达应该给他推什么这比单纯做一个用户购买预测模型更接近真正的营销系统。因为最终目标从来不是预测得准而是用有限的营销资源把真正有增量价值的用户找出来并给他合适的商品和触达策略。系统上线以后最重要的数据不是模型分数而是谁被触达、谁没被触达、谁点击、谁购买、购买金额多少、用了多少优惠。这些数据重新进入 AB 实验体系随着实验数据越来越多Uplift 模型可以不断更新。与此同时用户订单又会进入 Memory订单发生 → 更新长期偏好 → 更新消费水平 → 更新历史购买 → 更新决策模式于是形成一个长期正循环最终这套系统就不再只是一个圈人模型而变成了一套以 Memory 为用户理解基础以预测模型负责高意向筛选以 Uplift 负责增量决策以商品匹配负责具体推荐以 AB 实验驱动持续优化的主动转化系统。记忆解决理解用户预测模型解决找到可能购买的人Uplift 解决找到值得触达的人商品匹配解决应该推什么——最终通过主动触达把用户意图转化成真实订单。这套架构最大的价值也不在于某一个模型有多复杂而在于它把原本割裂的几个环节——用户记忆、意图识别、精准圈人、增量营销、商品匹配和转化反馈——真正串成了一条可执行、可评估、可持续优化的业务链路。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】