ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Agent持续进化:从运行轨迹获取学习信号,四种更新载体(知识/指令/程序/参数)

Agent持续进化:从运行轨迹获取学习信号,四种更新载体(知识/指令/程序/参数) 17-Agent持续进化从运行轨迹获取学习信号四种更新载体知识/指令/程序/参数做过传统软件的同学都熟悉一个循环上线 → 出 Bug → 修代码 → 再上线。而 Agent 的特殊之处在于它的每一次运行轨迹Trace本身就是一份带标注的训练数据。用户的反馈、环境的报错、任务的成功与失败全都躺在日志里。问题只是——我们有没有一套机制把这些运行经验转化为下一版本的能力。这就是 Agent 持续进化Continual Evolution的核心理念不是让模型权重天天变而是让整个 Agent 系统在运行中不断变好。一、学习信号从哪来运行轨迹里的三种信号源想从经验里学先得回答什么算好、什么算坏。书中把轨迹中的学习信号归为三类1. 环境结果信号Environment Outcome最硬核的一类信号任务最终成了没成。无人售货柜场景Agent 生成的补货计划执行后缺货率从 8% 降到 3% —— 环境直接告诉你这版策略有效。特点客观、可量化但稀疏。一个任务跑完只有一个结果信号中间哪一步走错了并不告诉你。2. 过程规则信号Process Rules人为定义的过程合规性检查相当于给 Agent 加了交规客服 Agent 不得向用户承诺退款金额超过订单实付补货 Agent 调用支付接口前必须先做库存二次校验。轨迹违反规则即产生负样本。这类信号密度高、反馈及时缺点是规则本身要人写且有覆盖盲区。3. LLM Rubric 信号模型评分用一个强 LLM 当阅卷老师按评分量表Rubric对轨迹打分步骤是否冗余有没有忽略用户约束工具调用参数是否合理特点覆盖面广、能评价好不好而不仅是对不对但有主观性和成本通常用于离线批量评估而非在线实时。工程上的常见做法是三层叠加环境结果做最终裁判过程规则做在线熔断LLM Rubric 做离线复盘。二、四种更新载体经验沉淀在哪里拿到学习信号后把学到的经验写到哪里书里给出了四种载体按改造成本从低到高、泛化能力从弱到强排列。载体一沉淀为知识Knowledge改 RAG 知识库把经验写成知识文档进向量库下次遇到类似问题时检索出来。实战例子我们的无人售货柜运维 Agent 某次处理货道电机卡死故障走了一大圈弯路先查网络、再查支付、最后才发现是电机过流。复盘后沉淀一条知识货道日志中motor_current 1.5A且持续 2 秒以上优先排查货道机械卡阻不要先查软件链路。下次同类故障Agent 第一步就直奔机械排查定位时间从 40 分钟缩到 5 分钟。改知识库零代码、当天生效是性价比最高的进化方式。载体二写成指令Prompt 与 Skills如果说知识是参考资料指令就是操作规程。把高频经验固化成 Prompt 规则或独立 Skill可复用的提示词流程包补货决策 Skill若某 SKU 周转天数 1.5 且缺货率 5%触发紧急补货流程。指令比知识更强约束Agent 必须遵循但 Prompt 空间有限塞太多规则反而互相干扰需要定期做规则的合并与淘汰。载体三写成程序Harness / 工具当一类经验反复出现、逻辑足够稳定就该从告诉模型怎么做升级为替模型做好。把经验写成确定性代码一个校验函数、一个专用的补货求解器、一个新的 MCP 工具。例如把补货量计算的经验写成一个带约束的优化函数挂进工具列表Agent 只需调用不必每次现场推理。程序载体可验证、可测试、零幻觉是工程团队最爱的进化终点——能用 if-else 解决的事就别劳驾大模型现场发挥。载体四写入参数后训练把轨迹数据蒸馏进模型权重SFT 微调、DPO/RLHF 偏好对齐。优点泛化能力最强学到的直觉不依赖检索和规则缺点成本最高、周期最长、且可能带来灾难性遗忘。实践中只有当某类能力沉淀足够多几千条高质量轨迹、且前三种载体都兜不住时才值得走后训练。四种载体的权衡速查载体更新成本生效速度泛化能力可验证性知识极低即时弱依赖检索命中中指令低即时中中程序中需发版强限定域内强可单测参数高需训练最强弱黑盒递进逻辑很清晰经验出现的频率和稳定性决定它该沉淀到哪一层。偶发经验进知识库高频经验进指令稳定经验进程序规模化经验进参数。三、更进一步更新更新方法本身元学习单条经验的沉淀是学习而优化沉淀流程本身就是元学习了——让 Agent 自己总结我这条经验为什么有效应该写到知识库还是固化为工具比如运维 Agent 复盘时不仅输出结论还输出结构化建议本次经验触发 3 次以上、逻辑可枚举建议固化为校验函数。人从写经验的人退位成审经验的人沉淀效率提升一个量级。四、无人售货柜 Agent 的线上问题沉淀流程把我们团队的实际流程串一遍轨迹采集每次 Agent 运行记录完整 Trace输入、思考、工具调用、结果、用户反馈写入 ClickHouse信号提取线上每日跑批环境信号工单是否重开 规则信号SLA 违规 每周 LLM Rubric 复盘经验候选生成对失败轨迹用 LLM 归因生成候选经验条目知识/指令/程序建议各打标签人工审核运维工程师审核合并防止错误经验污染知识库——经验也有假阳性审核不可省灰度生效新知识先对 5% 柜子生效对比指标无回退再全量。上线三个月客服 Agent 的一次解决率从 71% 提到 89%其中 80% 的提升来自知识库和指令层的更新——大部分进化根本轮不到微调出手。小结Agent 持续进化的本质是一条转换链运行轨迹 → 学习信号 → 经验条目 → 四种载体之一 → 下一版本能力。新手最容易犯的错是拿到学习信号后只想着微调模型忽略了知识、指令、程序这三个便宜又好用的台阶。进化的阶梯要从低往高爬先把经验写清楚再写进规则再固化成代码最后才是动参数。
返回列表