ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

拆解再复用:大模型智能体的跨任务技能迁移

拆解再复用:大模型智能体的跨任务技能迁移 拆解再复用大模型智能体的跨任务技能迁移论文来源arXiv:2608.20274v1摘要大语言模型智能体可以从已经完成的任务中归纳技能存入技能记忆库后续任务复用这些技能实现随经验不断提升能力。但实践中智能体归纳得到的技能跨任务迁移效果很不稳定甚至会损害后续任务表现。智能体归纳的技能在什么条件下可以可靠地跨任务复用是一个尚未被充分解答的问题。本文开展一套全面、受控的对照研究分析技能归纳方式如何影响跨任务迁移性能。重点对比两大设计维度归纳层级任务级 vs 子任务级、技能存储格式文本格式 vs 代码格式。实验发现任务级归纳得到的技能平均来看会拉低智能体性能低于无记忆基线而子任务级归纳的技能平均可以带来性能增益。同等归纳层级下文本格式技能迁移效果优于代码格式技能。为解释实验现象本文解析技能的两项互补属性**特异性specificity**衡量技能与真实任务的匹配紧密程度抽象性abstractness衡量技能相关性可以均匀覆盖多少不同任务。单一维度无法预测任务成功率将二者相乘得到技能效用分数skill utility score该分数可以稳定预测技能迁移带来的任务收益子任务级、文本格式的技能普遍拥有更高的技能效用分数。计算该分数仅需要技能文本与任务描述不需要实际运行任何任务可以在执行新任务之前作为技能记忆库的轻量诊断指标。关键词大语言模型智能体技能记忆跨任务迁移子任务分解技能归纳智能体评测1 引言LLM智能体被广泛应用于个人助手、办公自动化、科研仿真等场景。原生智能体每一个任务都从零开始求解无法从过往经验中获得能力增长。越来越多研究让智能体从已完成轨迹中归纳技能存入技能记忆遇到新任务检索并复用。如果技能可以良好跨任务迁移智能体就能够随经验积累变得越来越强。但是现实场景下从完整任务轨迹归纳出的技能迁移可靠性很差基于完整任务轨迹归纳的技能高度绑定源任务泛化到新任务表现不佳不相关、错位匹配的技能会成为噪声上下文干扰模型还会把源任务中的错误传播到新任务。因此技能能不能带来收益很大程度取决于技能是如何被归纳出来的。核心研究问题智能体归纳的技能在什么条件下可以可靠实现跨任务迁移已有部分工作提出子任务层级的技能归纳复杂任务拆解成多个子过程从每一个子任务子轨迹分别生成技能而不是对整条任务轨迹只生成一个技能。现有结果显示该方案效果更好但实验局限在少量领域、少数模型并且大多只使用文本格式技能缺少系统对照。本文在严格控制变量条件下对比归纳层级任务级 / 子任务级、**技能存储格式文本 / 代码**两个核心维度。实验使用3个长时序智能体基准、11个闭源开源模型。主要实验发现归纳层级决定技能能否带来收益子任务级技能平均高于无记忆基线任务级技能大多会损害性能。存储格式决定收益幅度同一归纳层级下文本格式技能迁移整体优于代码格式技能。提出技能效用分数由特异性与抽象性相乘得到仅使用文本信息即可计算无需运行任务分数越高技能迁移带来任务成功率提升越明显子任务级、文本技能的效用分数整体更高。本文给工程实践者三条启示将任务拆解为子任务从子任务轨迹做技能归纳可以改善跨任务迁移同等条件下文本形式技能比代码形式迁移效果更好技能效用分数可以作为轻量化诊断工具无需运行任务即可评估技能记忆库质量。图1不同任务共享子任务的示例。任务X把购物车全部举重凳下单任务Y把购物车里全部食品加工机移入愿望清单。任务级技能是对整条轨迹做总结高度绑定源任务难以复用到另一个任务子任务级归纳为每个子过程生成独立技能登录、查看购物车这类共享子任务的技能可以在两个任务之间迁移复用。表1现有技能归纳相关工作调研汇总对比归纳层级、存储格式、评测领域、提示词组件指令、示例、抽象规则工作技能归纳层级技能格式领域指令演示示例抽象规则AutoManual规则级Text家居、网页✓✓✓DynaSaurStep步骤级Code助手、数学QA✓✓✓ReflexionTask任务级TextQA、家居、代码✓✓×ExpeLTask任务级TextQA、家居、网页✓×✓CLINTask任务级Text科学仿真、家居✓×✓AWMTask任务级Text网页✓✓✓MempTask任务级Text旅行、家居✓✓×VoyagerTask任务级Code游戏✓✓✓TroVETask任务级Code数学、表格、视觉✓✓×ASITask任务级Code网页✓✓✓SSOSubtask子任务级Text科学仿真、游戏✓×✓MUSESubtask子任务级Text生产力✓×✓Shen et al.2026Subtask子任务级Text软件工程n/rn/rn/r本文工作Task / SubtaskText / Code助手、办公、数据科学✓✓✓n/r论文未公开提示词✓代表包含该组件×代表不包含。2 相关工作2.1 智能体中的技能记忆研究大量工作将智能体的历史经验整理成显式技能记忆库。主要存在三个设计轴归纳层级从完整任务轨迹、单步step、规则、子任务子轨迹做归纳技能存储格式自然语言文本、可执行代码函数归纳提示包含指令、演示样例、用于去除实例细节的抽象规则。部分工作使用强化学习训练记忆操作与技能增强策略另一类方案不做归纳直接检索原始交互片段。本文在统一提示词模板下只改变归纳层级、存储格式两个变量隔离二者的影响。2.2 跨任务技能迁移研究大量任务级技能迁移工作在网页、GUI、具身仿真、软件智能体开展实验。但是子任务层级迁移的研究还比较有限现有子任务相关实验大多局限少数领域端到端指标掩盖了每一条技能本身的贡献部分论文展示增益也有论文指出无关记忆会降低模型性能、错误会传播。本文系统对比任务级/子任务级、文本/代码跨多个基准、多个模型同时提出单技能层面的效用打分指标。2.3 长时序智能体的子任务分解很多长时序智能体会把复杂问题拆解为原子子问题以此缩短上下文、分块求解长任务。但多数工作分解只服务于当前任务不把子过程产出可以跨任务复用的技能少数子任务技能迁移论文领域覆盖狭窄。本文对比两套归纳层级横跨两种技能格式、三个基准、十一个模型。3 跨任务技能迁移形式化图2两套智能体架构示意图。1任务级智能体完整任务生成一条交互轨迹从整条轨迹归纳得到一条技能存入记忆2子任务级智能体任务被拆解成若干子任务每个子任务生成子轨迹从每一条子轨迹分别归纳一条技能存入记忆后续新任务执行前检索记忆中相关技能注入上下文。实验对比条件无记忆、任务级文本、任务级代码、子任务级文本、子任务级代码。3.1 两类智能体实现智能体在部分可观测环境求解任务。任务给出自然语言目标和初始环境状态每一步大模型策略π\piπ生成动作ata_tat​环境返回观测oto_tot​智能体标记完成或者到达最大步数后评估器给出奖励r∈([0,1])r\in([0,1])r∈([0,1])。任务级智能体标准ReAct循环。把全部动作、观测追加进上下文得到完整任务轨迹τ\tauτ任务结束后从整条轨迹归纳生成单一技能。子任务级智能体使用三类角色循环执行规划器Planner读取目标与运行时摘要提出下一个子任务或者宣布任务完成执行器Executor对当前子任务运行ReAct循环产出子轨迹τk\tau_kτk​摘要器Summarizer把子轨迹压缩成运行摘要交给下一轮循环。循环直到规划器判定任务结束得到完整任务轨迹τ(τ1,…,τK)\tau(\tau_1,\dots,\tau_K)τ(τ1​,…,τK​)。任务级智能体等价于子任务智能体的特例整个任务作为唯一一个子任务只运行执行器。3.2 技能记忆模块技能记忆库MMM保存智能体历史经验产出的技能供后续任务检索复用。包含归纳算子、检索算子。技能格式每个技能包含简短自然语言描述用于检索嵌入主体内容分两种格式文本技能工作流笔记记录操作流程与环境注意事项代码技能Python函数实例相关数值设置为参数环境注意事项写进注释。技能归纳任务级归纳从完整任务轨迹τ\tauτ生成1条技能子任务级归纳每一条子轨迹τk\tau_kτk​生成1条技能。两套层级使用完全相同的归纳提示词保证变量隔离完整提示词见附录A。技能示例见附录C。技能检索使用all‑MiniLM‑L6‑v2做嵌入用任务/子任务查询文本做相似度匹配取top‑k相关技能注入上下文。文本、代码技能使用完全一致的检索逻辑只匹配技能描述字段。任务级智能体使用任务指令作为查询检索一次子任务级智能体每一个子任务使用子任务描述做一次检索。代码技能除注入描述与函数文本还会加载进执行命名空间可以直接调用。记忆模块还会清理加载失败的代码技能对高相似度的重复描述做合并/丢弃附录B完整描述记忆处理逻辑。附录E.6验证不同条件性能差异来源于技能本身质量而不是检索效果差异。3.3 跨任务技能迁移定义智能体依次求解任务序列T1,T2,…,TnT_1,T_2,…,T_nT1​,T2​,…,Tn​共享同一份技能记忆库。完成一个/子任务之后写入技能执行新任务之前检索技能。从早期任务归纳的技能被后续任务检索使用称为跨任务技能迁移。本实验控制变量归纳层级任务级 / 子任务级技能格式无记忆 / 文本 / 代码。两套智能体仅在归纳层级、子任务规划‑摘要模块存在区别提示词、记忆检索全部保持一致。评估时每个开启记忆的智能体和它自身关闭记忆的版本做对照消除智能体架构本身带来的影响只看技能带来的增益。4 实验设置4.1 评测基准选用3个长时序智能体基准覆盖不同应用领域AppWorld多应用工具调用仿真9个模拟应用API接口测试集417条任务OfficeBench办公文档工作流包含邮件、Word、Excel、PDF等300条任务KramaBench数据科学流水线来自6个真实科学领域文件92条确定性评分任务。全部任务使用基准自带官方评估器输出分数范围([0,1])([0,1])([0,1])。4.2 测试模型共11个模型包含MoE稠密开源模型与一个商用模型MoEQwen3‑235B‑A22B、GPT‑OSS‑120B、Nemotron‑Super‑120B稠密Qwen3‑4B / 8B /14B /32BGemma‑3‑4B /12B /27B商用Gemini‑3.1‑Pro部署MoE模型使用Amazon BedrockGemini‑3.1‑Pro使用谷歌云API稠密模型使用vLLM运行在单张96GB GH200显卡。保持服务商默认采样参数单轮生成上限8192token全部模型使用同一套提示词。消融对3个MoE模型、Qwen3‑32B使用两套精简归纳提示L1最简指令、L2指令示例对比完整提示L3。附录A完整提示。4.3 实验对比条件两个变量做全组合共6组实验条件Task(无记忆)、TaskText、TaskCode、Subtask(无记忆)、SubtaskText、SubtaskCodeText存储自然语言工作流笔记Code存储Python函数约束任务级智能体单任务最多50步ReAct子任务级智能体最多15个子任务整体ReAct执行预算上限同样50步。4.4 评估指标任务成功率官方评估器给出([0,1])([0,1])([0,1])平均分效率指标单任务墙钟延迟latencydependency指标用来衡量上下文带来的计算开销附录D。5 技能归纳层级与格式如何影响迁移效果核心结论子任务层级归纳的技能平均带来性能提升任务级归纳大多会损害性能。同一层级文本技能迁移效果优于代码技能。表2三大基准下11个模型的任务成功率(%)括号95%任务bootstrap置信区间。任务级None无记忆 / Text / Code子任务级None / Text / Code。绝大多数模型与基准下最优结果出现在子任务‑技能列开启记忆后任务级大多性能下降子任务级大多上升。5.1 子任务层级的技能可以带来收益性能任务成功率对比同一个智能体开启/关闭记忆任务级开启文本技能平均下降1.2个百分点开启代码技能平均下降4.1个百分点全部三个基准都观察到下降。子任务级开启文本技能平均提升1.9个百分点开启代码技能平均提升0.5个百分点。文本技能在全部三个基准都正向增益代码在两个基准提升KramaBench小幅下降‑1.4。补充验证把子任务归纳产出的技能拿给任务级智能体使用性能同样优于任务级自己归纳的技能附录E.2效果来源于技能本身而不是智能体架构。源任务本身是否成功完成对归纳出来技能质量影响不大附录E.3。不同提示词配置下该结论依然成立。效率延迟与dependency开销在相同计算开销预算下小预算场景任务级无记忆方案占优可以低成本解决简单任务中等、大预算区间开启记忆的子任务级智能体在同等开销下可以解决更多任务该优势不是靠消耗更多算力换来。同等开销对比子任务记忆的曲线始终高于自身无记忆基线任务级记忆低于自身无记忆基线。任务难度分层验证将任务划分为简单、中等、困难使用基准自带难度标签。在几乎全部难度分层任务级开启记忆普遍降低成功率子任务级开启记忆普遍提升成功率同一层级文本≥代码。5.2 文本格式技能迁移整体优于代码格式同一归纳层级内部对比子任务层级文本技能相比代码技能平均高出2.9个百分点任务层级文本技能相比代码技能平均损失少1.4个百分点。无论看成功率、延迟/dependency开销、任务难度分层文本技能整体表现都等于或者优于代码技能。6 什么样的技能才具备良好迁移能力把视角从智能体转向技能本身。本文提出一个可迁移技能需要同时具备特异性和抽象性二者单一维度无法预测任务表现二者乘积定义技能效用分数Skill Utility。该分数仅依赖技能描述、任务文本不需要运行任务可以作为预诊断指标。图5可视化结果(a) 检索得到技能平均效用分数越高任务成功率越高(b) 只看单一维度特异性/抽象性成功率先上升后下降单一维度无法预测(c‑e)子任务级、文本格式的技能中位数效用分数整体更高。6.1 技能效用分数定义令cjc_jcj​为技能sss与第jjj个任务指令的嵌入余弦相似度。特异性 specificity(s)衡量技能和最匹配任务的贴近程度。计算概率该技能与最接近任务的相似度大于随机抽取两个任务互相之间的相似度。特异性惩罚完全不匹配任何任务的技能奖励至少匹配部分真实任务的技能。specificity(s)Pr⁡[max⁡jcj≥cos⁡(ti,tk)] \mathrm{specificity}(s)\Pr\big[\max_{j}c_{j}\geq\cos(t_{i},t_{k})\big]specificity(s)Pr[jmax​cj​≥cos(ti​,tk​)]抽象性 abstractness(s)衡量技能相关性可以均匀分布在大量任务而不是只集中少数任务。对相似度分布做softmax计算熵再归一化。τ0.1\tau0.1τ0.1温度系数。abstractness(s)exp⁡(H(softmax(c/τ)))N \mathrm{abstractness}(s)\frac{\exp\big(H(\mathrm{softmax}(c/\tau))\big)}{N}abstractness(s)Nexp(H(softmax(c/τ)))​技能效用分数Skill Utility技能需要同时兼顾和真实任务足够相关特异性同时可以适配足够多不同任务抽象性。单一维度高没有意义。utility(s)specificity(s)⋅abstractness(s) \boldsymbol{\mathrm{utility}(s)\mathrm{specificity}(s)\cdot \mathrm{abstractness}(s)}utility(s)specificity(s)⋅abstractness(s)6.2 技能效用分数可以预测任务收益将任务按照检索到技能的平均效用分桶随着效用分数升高任务成功率单调上升单一维度只看特异性 / 只看抽象性成功率呈现先升后降只靠其中任意一个指标不能预测成功必须二者乘积子任务层级、文本格式归纳得到技能中位数效用分数普遍高于任务级、代码格式技能和实验性能结果完全对应。附录E.4因果验证把同一个技能库按照效用中位数切分高效用子集运行得到更高任务成功率。6.3 技能效用分数与真实复用行为对齐定义迁移密度Transfer Density把任务流切分为50个时间bin统计“在更早bin归纳出的技能被后面bin检索复用”的配对占比。D1(n2)∑ijrij D\frac{1}{\binom{n}{2}}\sum_{ij}r_{ij}D(2n​)1​ij∑​rij​rij1r_{ij}1rij​1代表i bin产出的技能被j bin任务复用否则0。图6三大基准迁移密度热力图。蓝色三角子任务级绿色三角任务级。子任务级的迁移密度全部高于任务级。效用分数更高的技能集合真实跨任务复用频次也更高指标和真实行为匹配。7 结论本文在3套基准、11个模型下系统研究大模型智能体跨任务技能迁移。归纳层级至关重要子任务层级归纳技能平均带来性能增益任务级从完整轨迹归纳往往会降低智能体表现。技能格式有明显影响同等归纳层级文本格式技能整体迁移优于代码格式。提出技能效用分数由特异性 × 抽象性构成仅依靠文本信息计算无需运行任务分数越高对应任务成功率越高子任务级、文本技能效用整体更高可以作为技能记忆库的轻量化诊断指标。局限性实验局限AppWorld、OfficeBench、KramaBench这三套基准计算机GUI操作、代码智能体、网页浏览等其他场景行为可能不一样本研究的记忆模块使用固定的归纳、检索、去重逻辑部分前沿系统允许智能体在运行过程修改迭代技能库这类动态记忆需要进一步单独研究评测只看最终环境状态得分没有子步骤级别的真值细粒度中间行为分析需要依赖模型裁判。伦理说明本研究探究智能体如何复用自己过往经验生成的技能。该机制同样存在被注入恶意技能、引导智能体执行有害行为的风险。本实验全部技能均由智能体在沙盒基准内部生成没有引入外部恶意样本。如何检测、拒绝恶意技能留给未来研究。附录A 提示词模板A.1 子任务级智能体提示A.2 任务级智能体提示A.3 文本技能归纳提示A.4 代码技能归纳提示包含AppWorld / OfficeBench / KramaBench三套环境的系统提示、用户提示、角色块任务级是子任务智能体去掉规划器、摘要器把完整任务当作唯一子目标。归纳提示在两个归纳层级之间完全一致只有读取的轨迹跨度不一样。附录B 技能记忆完整处理逻辑嵌入模型all‑MiniLM‑L6‑v2检索取top‑5相似度阈值0.3代码技能加载失败直接删除级联删除依赖被删函数的其他代码技能文本技能描述相似度0.85判定重复做内容合并代码技能函数名重复覆盖描述相似度0.85丢弃重复项。附录C 归纳得到的技能样例AppWorld购物车任务示例对比任务级生成一条大而全的技能对比子任务级拆分为登录、筛选购物车、下单三条独立可复用技能。附录D 评测指标D.1 性能打分AppWorld状态单元测试全部通过得1否则0OfficeBench沙盒应用状态检查器全部通过得1KramaBench官方确定性评分器连续分数排除需要LLM裁判的样本。D.2 开销指标latency单任务墙钟时间dependency衡量上下文注意力计算开销公式dependency∑c(2pcoc),oc2 \mathrm{dependency}\sum_{c}\frac{(2p_co_c),o_c}{2}dependencyc∑​2(2pc​oc​),oc​​pcp_cpc​输入token长度oco_coc​输出token长度单位109 token210^9\ \mathrm{token}^2109token2。附录E 补充分析E.1 全部11模型完整数值结果表E.2 将子任务技能给到任务级智能体的对照实验E.3 源任务成功/失败对归纳技能质量的影响E.4 技能效用分数的因果对照按中位数切分库E.5 复用频次与技能格式统计E.6 检索质量有效性验证排除检索差异带来的混淆
返回列表