ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

【行业前沿报告】AgentRefine:让智能体学会从错误中恢复

【行业前沿报告】AgentRefine:让智能体学会从错误中恢复 摘要智能体在收到报错后重复执行同一命令常被归因于“模型不够聪明”但更可能的原因是训练数据几乎只展示成功路径模型很少见过走错后如何改变判断。ICLR 2025 的 AgentRefine 针对这一缺口用 Persona Hub 人物设定合成多样化的可交互环境让强模型扮演环境主持者与玩家生成包含失败、反馈与恢复的轨迹再通过规则核验筛选合格样本。训练时保留完整错误上下文同时屏蔽错误助手轮的监督目标使模型学会从反馈中生成正确动作。主实验显示相较 Agent-FLANAgentRefine 在 SciWorld 成功率提升 13.3 个百分点但在 ALFWorld 等任务上仍低于同环境训练基线消融实验表明正确的恢复动作值得训练而错误轮不宜作为模仿目标。文章还讨论了接口改写鲁棒性、Best-of-N 采样潜力、推理迁移与教师模型影响并给出把该想法迁移到实际智能体的工程建议。这篇解读要回答三个问题错误为什么有保留价值保留错误又怎样避免模型模仿错误实验究竟证明了哪些能力一个智能体收到了报错又把刚才的命令执行了一遍。环境继续报错它继续重试。这类失败很容易被归因于“模型还不够聪明”。但另一种可能是训练数据几乎只展示成功路径模型很熟悉下一步应该怎么走却很少见过走错以后该怎样改变判断。ICLR 2025 的AgentRefine: Enhancing Agent Generalization through Refinement Tuning由 Dayuan Fu、Keqing He、Yejie Wang 等作者提出把“根据环境反馈纠正动作”放进了微调数据。它合成不同的任务环境让轨迹包含失败与恢复再选择性地训练其中的正确轮次。[1][2]1. 熟悉一个环境与适应新环境是两种要求先看一个简化例子。旧工具接受take tomato from countertop。新工具要求from countertop take tomato。目标没有改变物品没有改变参数也没有改变只是接口规定了另一种词序。如果模型真正使用了当前动作说明它应当调整输出。如果它主要依赖训练中熟悉的字符串旧命令就可能一直出现。更难察觉的失败是模型的解释已经说“上一步无效”动作却仍然照旧。论文用 Agent-FLAN 展示了这类现象也比较了模型在已见环境和未见环境上的表现。这里的held-in指微调数据来自同一任务环境并不等于使用了测试集的同一条题目held-out指对应任务环境没有作为该方法的微调数据来源。这个划分依赖具体方法不能给一列任务统一贴标签。[1, §2、§4.1]方法论文列出的同环境训练任务环境与轨迹的来源特点Agent-FLANALFWorld在人工定义的环境中采集轨迹AgentGymALFWorld、BabyAI、SciWorld覆盖多个已有环境AgentGen无对应的 AgentBoard 同环境任务合成环境再采集轨迹AgentRefine无对应的 AgentBoard 同环境任务合成环境与轨迹加入错误及纠正过程表 1依据论文附录 E 整理。这里的“未见”只描述论文列出的微调环境关系不能用来断言基础模型预训练阶段从未接触过相关知识。成功轨迹能教模型执行任务却可能缺少一个训练信号当前动作与当前环境不相容时应该利用哪条反馈改变下一步。AgentRefine 针对这个缺口设计数据。[2]先看它怎样把数据构建接到模型训练上。图 1依据论文 §3 与图 4 整理的原创示意。动作规则用于约束和核验轨迹错误反馈在轨迹内部出现泛化评测位于训练之后。2. 先合成可以交互的环境如果训练环境始终不变模型可能只是记住另一套动作模板。因此AgentRefine 的第一步是扩大环境差异。它使用 Persona Hub 中的人物设定作为合成条件。Persona Hub 的基本思路是从不同人物的职业、兴趣和背景出发激活不同的问题视角。这里的人物设定是合成种子不能理解为收集真实用户的身份档案。[7]例如下面这两个人物可以引出不同任务。这是本文构造的说明例子。合成种子可能的任务需要明确的状态与约束刚入职的系统管理员修改服务配置并验证生效当前目录、配置文件位置、可用编辑命令、验证条件博物馆的藏品管理员找到正确展柜并核对藏品编号展厅连接、展柜内容、访问条件、编号记录一个“场景故事”还不足以成为训练环境。智能体需要知道可见对象有哪些、对象在哪里、自己能执行什么动作以及任务何时结束。AgentRefine 的脚本包含环境、目标、完成条件和动作定义。地点与物品通过 JSON 层级表达动作带有名称、正则格式检查和合法参数。生成时还会加入干扰地点或物品让轨迹有机会遇到错误。[1, §3.1附录 L]这里有两个设计点容易在通俗解读中丢失。首先玩家可见的信息与环境持有的信息有区别。例如文件内容应当在读取文件之后进入观察不能在任务开头全部泄露。否则模型只是在根据完整答案写故事。其次完成条件需要可辨别。“把系统修好”太模糊“指定配置项已改变验证命令返回目标结果”才能区分完成与未完成。这也是把训练迁移到实际工具环境时应保留的要求。3. 轨迹怎样同时包含失败、反馈和恢复环境脚本准备好以后强模型扮演两个角色Dungeon MasterDM环境主持者和 Player玩家。DM 给出观察并判断上一动作Player 以 ReAct 形式产生推理与动作。[1, §3.1]ReAct 将推理、动作和外部观察交替组织。推理帮助更新计划动作获取或改变外部信息观察为下一轮提供依据。它规定了信息怎样流动但使用这种格式本身并不能保证模型会认真处理报错。[5]AgentRefine 的两个角色由同一个模型在一次调用里共同模拟。这是一种轨迹合成方式。把角色命名为“环境”和“玩家”并不会自动获得两个独立系统之间的验证。DM 会判断参数错误、位置错误和逻辑错误。它的输出包括错误标记和任务进度玩家的输出则包括推理与动作。最终进入训练的用户轮是 DM 的观察助手轮是玩家的推理与动作DM 的内部推理不会整体作为玩家可见反馈输入。[1, §3.1、§3.3附录 M]用一个原创文件操作例子把恢复过程展开。任务将服务配置中的模式设为on并通过检查。当前目录为/home/user工具只允许编辑文件的绝对路径。智能体最初认为配置位于/srv/app/config.ini但这只是待验证的位置假设。轮次玩家动作或环境观察本轮改变了什么玩家edit config.ini modeon使用相对路径违反当前接口约定环境路径格式错误编辑命令要求绝对路径给出失败原因配置尚未改变玩家edit /srv/app/config.ini modeon根据反馈修正参数表达环境文件不存在配置位于/etc/app/config.ini新证据推翻原先的文件位置假设玩家edit /etc/app/config.ini modeon修正目标位置环境编辑成功状态已改变但任务尚需验证玩家check /etc/app/config.ini用检查动作确认完成条件环境模式为on任务完成获得终止依据这个例子区分了两次恢复先修正命令格式再修正关于环境的知识。如果删掉报错只保留最后的命令读者就看不出为什么要使用绝对路径也看不出文件位置是怎样被更新的。“模型会说自己错了”也不是充分条件。可以让两段轨迹都写一句相同的反思再比较下一步动作是否真的使用了新增证据。恢复能力最终要落在动作和状态上。数据中的恢复也不一定是“错一步下一步就成功”。附录 N 包含连续错误超过三轮的情况。保留这些过程可以区分立即修正与经过探索才恢复它们同时会增加上下文和训练成本。[1, 附录 N]4. 验证器筛选的是训练样本合成轨迹可能格式坏掉、任务没有结束或者错误动作被 DM 错标为正确。AgentRefine 在生成之后增加规则核验并要求保留下来的轨迹有足够的错误与纠正过程。[1, §3.1附录 O]先看不同失败怎样触发不同的重生成。图 2依据论文 §3.1 与附录 O 整理的原创示意。侧边回路是有条件的重生成不是每条轨迹都要经过的步骤合格样本的任务需结束并至少包含两次被标记的错误及后续纠正过程。规则核验主要处理结构和能够枚举的动作约束JSON 字段是否满足要求动作是否匹配格式与合法参数DM 的错误标记是否与这些规则冲突。结束检查确认任务完成、最后一轮没有错误纠正过程不足时要求从头重生成。某些结构或动作问题则保留已通过检查的前缀让模型接着生成。[1, §3.1附录 O]这里的任务结束与部分逻辑判断仍然依赖 DM 的输出不能把“通过规则核验”理解为整个虚拟世界已由独立模拟器验证。原文脚注还有一个明确边界代码编辑、回答和搜索等动作的参数空间接近无限生成过程不对这类动作进行同样的规则验证。正则检查也不能证明一次编辑真的修复了程序或一个搜索答案在事实层面正确。[1, p.4 脚注 1]因而把这套流程接到真实工具上时还需要另一个验证层。文件操作可以检查文件系统和测试结果数据库操作可以检查事务与约束规划任务可以检查模拟器状态。文本中的“完成”应当和外部状态一致。这个区分也解释了合成成本。论文主要用gpt-4o-2024-05-13生成数据只保存能在四次模型调用以内通过核验的轨迹这个预算包括脚本与轨迹生成。脚本生成使用三个示例轨迹生成使用一个示例。[1, §3.2]四次是生成预算上限不是每条样本都需要四次更不是推理时允许智能体执行四步。若要估算自己的数据成本还要记录尝试次数、通过率、输入输出 token 和每条合格轨迹长度。5. 保留错误上下文屏蔽错误轮的模仿目标现在来到训练方法最关键的一步。如果把整条轨迹中所有助手回答都作为监督目标模型既会被训练去生成正确纠正也会被训练去生成前面的错误命令。AgentRefine 保留完整交互历史同时屏蔽错误助手轮的损失让后续的正确推理与动作获得监督。[1, §3.3][3]看下面四类信息的不同用途。图 3依据论文 §3.3 与图 4 整理的原创示意。屏蔽的是错误轮的监督目标错误文本仍在上下文中侧边卡片标注训练用途不代表删除或替换中间轮次。信息保留在上下文中作为要模仿的输出任务说明与环境观察是否错误助手轮推理与动作是否纠正后的正确助手轮是是其他正确助手轮是是令 Yᵢ 表示第 i 个助手轮的推理与动作I 表示任务说明Hᵢ 表示该轮之前的完整交互历史。mᵢ 为监督掩码正确助手轮取 1错误助手轮取 0。按论文对损失屏蔽的文字说明可以把训练目标写成下面的负对数似然形式L(θ) − Eₓ [ Σᵢ mᵢ log pθ(Yᵢ | I, Hᵢ) ]θ 为待训练的模型参数x 为一条训练轨迹Eₓ 对训练数据分布取期望求和遍历该轨迹的助手轮。轮级概率可以展开为该轮各 token 的条件概率乘积。实际训练时只计算被选中助手 token 的预测损失。这个表达是本文为解释机制重新整理的写法不是逐字复制原文式 1。[1, §3.3]关键区别在 Hᵢ 和 mᵢHᵢ 决定模型能看到什么mᵢ 决定哪些输出被直接监督。将错误轮的 label 设为忽略值应当保留它的输入 token 及正常的历史可见性。若把它从上下文删掉纠正动作就失去了错误原因若把它当成正确目标模型又会学习生成错误。这也没有主动惩罚错误动作的概率。它是一种选择性监督微调不等同于给错误动作负奖励或用偏好优化显式拉开正确与错误输出的概率。还有一个实现陷阱数据里有loss字段并不意味着任意训练器都会按它屏蔽损失。公开数据预览包含这类轮级标记接入时需要确认数据转换和 labels 构造真正使用了标记。论文称其修改了 LLaMA-Factory 的 SFT 损失不能直接用默认配置声称复现了方法。[4][1, 附录 D]它与推理时反思有什么区别Reflexion 使用反馈生成反思文本把它放入记忆供后续尝试使用原始框架不通过这一步更新模型权重。[6]AgentRefine 则在训练阶段更新参数让模型学习从历史反馈生成新的正确动作。部署时仍然需要环境反馈但论文的主评测不需要 GPT-4 充当在线裁判。[1, §4.1]两者可以结合。论文附录 G 测试了加入 Reflexion 的版本AgentRefine 的 ALFWorld 成功率从主表中的 44.8% 变为 90.3%这一变化来自增加推理框架后的设置不能写成原始单次策略本身达到 90.3%。同一附录中它在 BabyAI 和 SciWorld 上也没有超过所有比较方法。[1, 附录 G]6. 主实验泛化收益需要带着基线读论文使用 LLaMA-3 的 8B、70B 基础模型和 Mistral-v0.3 进行微调。默认 AgentRefine 数据规模为 32,000 条训练十个 epoch学习率为 5×10⁻⁶批大小为 647B/8B 的最大长度为 819270B 为 4096。[1, §4.1附录 D]主评测使用 AgentBoard 的五种环境最大交互轮数为 30并将提示与历史组织改为 ReAct 和多轮聊天。成功率要求任务完成进度率反映是否到达任务关键节点。部分完成不能直接算成功。[1, §4.1]下表选取 LLaMA-3-8B 相关结果所有数值为百分比每格按“成功率 / 进度率”排列。方法ALFWorldBabyAISciWorldPDDLJerichoLLaMA-3-8B-Instruct22.4 / 46.145.5 / 56.57.8 / 41.110.0 / 38.40.0 / 24.3Agent-FLAN67.2 / 79.725.0 / 35.31.1 / 10.98.3 / 25.50.0 / 10.1AgentGym61.9 / 76.947.3 / 61.418.9 / 47.51.7 / 16.60.0 / 12.9AgentRefine44.8 / 63.837.5 / 50.414.4 / 42.616.6 / 37.810.0 / 32.3表 2论文表 1 的 8B 子集。Agent-FLAN 在 ALFWorld、AgentGym 在 ALFWorld/BabyAI/SciWorld 上具有同环境训练关系见表 1。不同训练来源和预算不能被这一张表自动消除。相较 Agent-FLANAgentRefine 在 SciWorld 的成功率从 1.1% 提高到 14.4%差值是13.3 个百分点。但在 ALFWorld 上它低于 Agent-FLAN在 BabyAI 上它也低于 LLaMA-3-8B-Instruct。这里没有一个可以脱离任务的“全局最强”结论。[1, 表 1]扩大模型也没有消除所有反例。70B 的 SciWorld 成功率中AgentRefine 为 17.7%LLaMA-3-70B-Instruct 为 42.2%Mistral 系列中AgentRefine 为 4.4%原 Instruct 为 6.7%。所以论文支持的是相对若干 agent 微调基线的迁移收益不能扩大为“纠正微调一定胜过通用 Instruct”。[1, 表 1]还有三条口径影响复现判断附录 A 的 held-out 汇总按 BabyAI、SciWorld、PDDL、Jericho 的测试数量 112、90、60、20 加权总分母为 282这不是四项分数的简单平均。对 AgentGym这个统一汇总还包含其同环境训练任务不能全部称为该方法的陌生环境。正文 §4.1 说 AgentGym 当时未开源结果取自 AgentGen表 1 图注又提到重现 AgentGym 的结果。来源说明存在不一致因此不能将主表描述成全部基线在完全相同流程下独立复现。附录 D 说训练十个 epoch 后选择平均结果最好的 checkpoint但未清楚交代这个选择是否使用独立验证集。评估泛化时应把 checkpoint 选择与最终测试分开。以上说明依据论文 §4.1、附录 A/D 与表 1这些条件不否定结果但限制了结果可以支撑的比较范围。7. 消融错误与纠正不能混成一种数据主表回答“方法整体怎样”消融更接近“哪种训练信号在起作用”。论文表 2 使用8,000 条数据不是主表的 32,000 条。以下保留 SciWorld 和 PDDL 的成功率以及 Jericho 的进度率用来同时观察收益和例外。[1, 表 2]训练变体SciWorld 成功率PDDL 成功率Jericho 进度率完整 AgentRefine7.7%21.7%26.2%屏蔽纠正轮损失4.4%20.0%16.1%重生成无错误、无纠正的数据5.5%11.7%13.8%将错误助手轮也纳入损失3.3%8.3%18.4%表 3论文表 2 的关键子集。完整五任务结果见素材包数据文件正文不把不同数据规模的两张表拼成同一组消融。屏蔽纠正轮SciWorld 从 7.7% 降到 4.4%相对降幅约为 42.9%。把错误轮也当监督目标降到 3.3%相对降幅约为 57.1%。原文关于后一变体写了“接近 75%”的下降与表中这组成功率无法直接对应这里按可核对的表值计算。[1, §4.2]这组消融支持两项设计正确的恢复动作值得训练错误助手轮不宜直接作为正确输出模仿。但它不支持每个指标都必须下降。例如无纠正数据的 ALFWorld 成功率为 49.3%略高于完整方法的 48.5%学习错误轮的 Jericho 成功率仍为 5.0%与完整方法相同。[1, 表 2]如果恢复与普通执行本来就是不同子能力这种不均匀结果并不难理解。更好的工程实验应分别统计首次执行成功、遇错后的恢复成功、重复错误和总预算才能知道数据究竟改变了什么。8. 鲁棒性、多样性与更多尝试分别说明什么动作改写最直观的迁移测试论文在 ALFWorld 改写动作表达并同步调整环境接口。下面选出其中两种改写展示成功率。[1, §4.3附录 K]方法原始接口改写移动动作改写取物词序LLaMA-3-8B-Instruct22.4%24.6%17.9%Agent-FLAN67.2%51.4%27.6%AgentRefine44.8%51.5%54.5%表 4论文表 3 的原始接口、扰动 2 与扰动 3。移动动作由go to改成move to取物动作由take {obj} from {recep}改成from {recep} take {obj}。这些是接口语义保持的改写。Agent-FLAN 在取物词序改写后下降 39.6 个百分点AgentRefine 在这组设置中保持了表现。不过表 3 的综合平均包含原始设置、四种接口改写以及第五项“删除同环境训练数据后重新训练”。最后一项改变了训练集不是纯粹的提示扰动。将整个平均降幅归因于“改几个词”会夸大实验的单一含义。附录 I 还有一条反证在 8,000 条数据的变体中无纠正数据的扰动平均成功率为 48.78%完整方法为 48.48%对应标准差为 5.47 和 5.78 个百分点。两者很接近。[1, 表 11]因此完整 AgentRefine 的接口鲁棒性有实验支持鲁棒性全部来自纠正轨迹则没有被这组消融充分隔离出来。环境多样性、数据量和核验质量同样值得关注。论文的 4K–64K 扩展实验总体呈上行但中间并非严格单调16K 到 32K 有回落。[1, 图 5附录 I]附录 I 的未核验变体平均成功率为 25.66%明显低于完整方法的 48.48%。不过该变体混入了缺少纠正、错误标注等不同样本这个差距反映样本筛选的整体影响不能当作独立验证器对每个样本的纯因果贡献。[1, 表 11]多样性有线索尚不能当因果证明论文将 8,100 条推理文本嵌入后用 t-SNE 展示AgentRefine 的分布更广另对合成与测试环境说明做相似性分析。[1, §4.4]这类图能帮助发现数据覆盖差异却不能直接衡量所有推理是否有效。二维投影的形状受嵌入方法与降维参数影响文本相似度较低也不能证明没有内容重叠或预训练污染。真正需要验证的是新增的数据差异是否让模型在受控的新条件下产生更有效的动作。十次尝试潜力与单次可靠性要分开论文的 Best-of-N 将温度设为 1每个任务执行十次。只要一次成功就记成功进度取十次中的最高值。AgentRefine 的 SciWorld 成功率从贪心解码的 14.4% 变为 40.0%ALFWorld 从 44.8% 变为 93.3%。[1, §4.4表 4]这是一个关于多次采样潜力的结果。它同时增加了完整任务尝试次数并改变了解码方式不能直接解释成一次调用更可靠。若成功状态能够外部验证可以围绕验证器设计重试若候选答案没有可靠判据事后知道哪次最好与系统能够自动选出最好是两件不同的事。也不能说 AgentRefine 的 Best-of-N 在所有任务上最好AgentGym 的 SciWorld 该项成功率为 58.9%但它使用了同环境训练数据。预算与训练暴露关系仍然要带着读。[1, 表 4]附录 H 的均值和标准差来自固定模型在温度 1 下的十次采样不是十次独立训练。Jericho 只有 20 个测试任务一条任务就对应 5 个百分点。这些统计有助于观察采样波动还不能替代训练种子复验或更大规模的泛化测试。[1, 附录 A/H]推理迁移与教师模型论文另用随机抽取的 300 个 HotpotQA 问题测试多跳问答最多八轮环境是 Wikipedia 搜索。AgentRefine 的精确匹配率EM与 F1 为 37.0% / 44.6%LLaMA-3-8B-Instruct 为 29.3% / 36.6%。这为搜索与推理任务中的迁移提供了补充证据范围仍是这一组问题与检索设置。[1, §4.1、§6]换用 DeepSeek-v2.5 合成 4,000 条数据也能获得收益但不是所有任务都与 GPT-4o 合成版接近两者的 SciWorld 成功率为 2.2% 与 11.1%BabyAI 则为 36.6% 与 33.9%DeepSeek 版本在这一项更高。教师能力与任务关系都影响结果不能把“更强教师”写成每项指标的必然排序。[1, §5表 5]通用指令数据也仍然有价值。论文混入 ShareGPT 后继续得到收益MT-Bench 分数从 3.96 变为 5.91。恢复训练与通用指令能力可以互补专门训练纠错不等于已经解决一般对话和指令遵循。[1, §9附录 J]9. 怎样把这个想法用到实际智能体论文值得迁移的部分是如何组织训练信号与验证。以下是基于前文机制的工程建议不是论文已经完成的生产验证。先固定任务再改变接口和失败条件才能看清模型究竟适应了什么。图 4本文原创的工程验证建议。依据论文的接口改写与消融问题设计不代表原论文中新增的一项实验无扰动基线应与扰动版本使用同一任务集合。第一步把失败绑定到可检查的状态。路径不存在、参数非法、资源被占用、工具返回空结果、结果未通过测试可以各自形成失败类型。反馈应提供真实可获得的信息不能为了帮助模型恢复而泄露它本不该知道的答案。第二步同时保留正常任务与恢复任务。正常任务用于观察首次执行能力恢复任务用于观察遇错后是否利用反馈。只比较最终成功率容易把恢复能力与更长的重试预算混在一起。第三步对齐监督处理。建议比较正确轨迹、完整错误与纠正轨迹加损失屏蔽、完整轨迹不屏蔽三种数据处理。使用同一基础模型、相近的有效训练 token、固定训练预算和独立验证集。删除轮次后轨迹更短单纯对齐样本条数不足以保证训练量相同。第四步验证反馈确实改变了动作。可以固定失败前的历史在环境合理且可执行的条件下替换反馈路径无效、文件不存在、权限不足应导向不同的恢复操作。记录模型是否检查了对应条件而不是所有报错都触发同一条重试。要观察的能力可记录的指标需要防止的误解基本执行无故障任务的成功率恢复训练可能损害正常执行失败恢复进入可恢复失败状态后的成功比例分母应为这类失败任务不是全部任务反馈使用对有效反馈变化的动作响应更换了话术不代表更新了策略重复错误相同无效动作的连续出现次数多次尝试可能只是重复同一失败执行成本工具调用、token、耗时、完整重跑次数Best-of-N 的收益附带更大预算最后训练标签自身也需要审核。论文从 50 条合成轨迹中抽取共 100 个轮次与人类判断比较。图 10 的对角计数为 47 和 41对应这批样本总体一致率 88%这是小规模、经过抽样的标签核对不能作为全部数据的保证。正文的分组百分比与图中行列标注还有解释歧义因此本文不把它们作为可直接复用的自动审核准确率。[1, §8图 10]截至本次核对作者公开仓库提供论文说明和数据链接可见的根目录为 README 与图片目录并仍提示后续提供推理代码和模型。公开资料支持理解和获取训练数据本文没有声称完整复现原论文的训练及评测。[3][4]回到开头那个反复执行错误命令的智能体更有用的改进是让它在收到新证据后改变动作并用外部结果确认改变是否奏效。AgentRefine 为这种能力提供了一个训练方案它留下的实验问题也很具体——在相同数据、预算与验证条件下恢复训练能带来多少独立于环境多样性的收益参考文献与阅读范围Dayuan Fu、Keqing He、Yejie Wang 等. AgentRefine: Enhancing Agent Generalization through Refinement Tuning. ICLR 2025 会议版20 页。已阅读正文、图表与附录 A–O本文实验数字以这一版本为准。作者项目页AgentRefine。核对方法总览和作者信息。作者公开仓库Fu-Dayuan/AgentRefine。核对 README、目录和公开资源范围访问日期 2026-10-03。作者数据集AgentRefine-gpt4o-32000。核对数据页面与字段预览没有逐条审核 32,000 条样本。Shunyu Yao 等. ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023。已阅读作者项目页本文仅用其交互格式说明不转述其效果排名。Noah Shinn 等. Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023。已阅读论文摘要本文仅用其“不更新权重、通过反思记忆影响后续尝试”的机制定义。腾讯 AI LabPersona Hub 官方仓库。已阅读 README本文只使用人物条件驱动合成的基本方法不评估其全部数据质量。
返回列表