ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

谷歌RSI新作,让Agent Harness自进化不跑偏!

谷歌RSI新作,让Agent Harness自进化不跑偏! Agent越来越强但真正决定一个Agent能不能把任务做好的并不只有底层大模型。模型外面的提示词、工具、工作流、记忆和上下文管理同样会直接影响Agent的执行效果这些部分被称为 Agent Harness。最近Google Cloud AI Research联合北卡罗来纳大学教堂山分校、斯坦福大学等高校研究者提出了 RRSIRegularized Recursive Self-Improvement of Agent Harnesses发布当天就登上了Hugging face 日榜第二。研究的就是一个越来越重要的问题Agent Harness自己不断进化会不会也“学过头”论文发现现有的Harness自动进化方法很容易在自己反复优化的任务上获得明显提升但换到没见过的任务和基准后效果却大幅下降。RRSI的思路很直接不限制Harness能改什么而是限制它“怎么改”。最终在8个基准、3类任务上的实验中RRSI在进化任务上最高提升14.1个百分点在未参与进化的OOD基准上最高提升4.7个百分点同时相比未加正则化的进化方法策略Token消耗明显降低。论文题目RRSI: Regularized Recursive Self-Improvement of Agent Harnesses01Agent Harness自己进化也会过拟合既然Agent的执行能力不仅取决于模型那么一个自然的问题能不能让Agent自己不断修改Harness从而获得更强的任务能力RRSI关注的正是这一方向。它让Agent根据任务执行结果和反馈持续调整自己的Prompt、工具调用方式、控制流程、Memory等组件并通过“提出修改—测试效果—保留有效修改”的循环让Harness逐步完成自我进化。但问题也随之出现。如果每一轮修改都只盯着当前的进化数据集Agent很容易学会一些只对当前任务有效的技巧。在有限的测试集上分数可能不断上涨但换到新的任务或未见过的基准后性能却可能下降。这其实和模型训练中的过拟合类似Harness不是学会了更通用的解决方法而是在“记住”当前的评测环境。因此RRSI并没有单纯追求让Harness“改得更多”而是进一步约束哪些修改值得提出、哪些修改值得保留让Harness的自我进化能够真正迁移到新的任务上。02RRSI给Harness进化加上两道“门”RRSI把正则化放在了Harness进化过程的两个位置Proposal端 Selection端。前者控制“怎么改”后者控制“哪些修改能留下”。第一道门是限制一次修改到底能改多少东西。在进化早期允许模型进行相对大范围的修改用来探索新的机制随着进化轮次增加修改预算逐渐下降让后面的更新越来越小、越来越容易判断究竟是哪一个改动带来了效果。也就是说前期大胆探索后期精细修改。同时RRSI还会记录之前每次修改改了什么、测试了什么假设、最终得分和Token成本发生了什么变化。如果某个方向已经被证明没有效果后续就不会反复在同一个方向上浪费搜索资源。当搜索长期没有明显进展时RRSI还会主动把一部分搜索预算转向之前没有尝试过的Harness组件。这样可以避免Agent一直反复修改同一个Prompt却忽略工具、Memory或者控制流程等其他部分。第二道门则负责判断一个看起来有效的修改到底值不值得留下。RRSI首先使用critic检查候选修改过滤掉直接写入任务名称、实体名称、答案或者其他Benchmark特定信息的方案。随后它还会考虑评测噪声。如果一次成绩提升可能只是随机波动RRSI不会轻易接受。同时如果一个修改虽然提高了成绩却带来了大量额外Token消耗也需要证明这部分成本是值得的。对于长期没有带来正向收益的组件RRSI还会进一步进行结构化裁剪。所以RRSI并不是简单地让Agent“改得更多”。它真正做的是让每一次修改都更有依据让留下来的机制更可能具有可迁移性。03进化集涨得少了OOD反而涨得更多RRSI最终在三个领域、8个Benchmark上进行了测试包括Coding、Agentic Workspace和Engineering Design。其中Coding包括Terminal-Bench 2.1和SWE-bench VerifiedAgentic Workspace包括Harvey LAB、JobBench、GDPval和APEX-AgentsEngineering Design则包括EngDesign和Frontier-Eng。实验结果非常有意思。在Terminal-Bench 2.1上RRSI从基础Harness的74.2%提升到80.2%提高6.0个百分点但真正没有参与进化的SWE-bench Verified上也从82.0%提升到了83.8%。在Agentic Workspace任务中RRSI在Harvey LAB进化集上提升1.1个百分点而在JobBench、GDPval和APEX-Agents三个OOD基准上分别提升4.7、3.5和3.7个百分点。在Engineering Design中EngDesign进化集提升4.9个百分点完全没参与进化的Frontier-Eng则提升4.3个百分点。更值得注意的是RRSI并没有追求进化集上的最高分。在Agentic Workspace实验中未加正则化的进化方法可以把Harvey LAB的成绩做到92.8%而RRSI只有90.5%。但到了OOD平均成绩未正则化方法只有40.3%RRSI则达到43.6%。同时未正则化进化每次试验平均需要3.80M个Policy Tokens而RRSI只需要2.42M。这恰恰体现了RRSI的目标不只是让Harness在“练习题”上拿到最高分而是让它学到真正可以迁移的Agent机制。论文还进一步测试了不同模型。使用Gemini 3.5 Flash进行Harness进化时Terminal-Bench 2.1从64.6%提升到78.7%并在从未参与进化的SWE-bench Verified上获得2.2个百分点提升。即使把进化得到的Harness换到从未参与搜索的Gemini 3.1 Flash Lite上Terminal-Bench 2.1也从11.2%提升到14.6%。这说明RRSI学到的并不完全是某个特定模型的“使用技巧”。至少在论文测试范围内一部分Harness机制可以跨任务、跨Benchmark甚至跨模型迁移。04Agent自我进化下一步不是“改得更多”从RRSI的实验来看Agent Harness的自动进化正在从简单的“试一个修改看分数涨不涨”走向更加系统的搜索过程。如果Harness不断根据同一批任务反馈修改自己那么它同样可能出现过拟合。因此真正需要解决的问题已经变成怎样让Agent从自己的执行反馈中学到可复用的机制而不是记住某个Benchmark。RRSI给出的答案是把传统机器学习中的正则化思想引入Harness进化限制单轮修改规模、记录历史证据、鼓励探索未尝试方向同时过滤任务泄漏、控制评测噪声、限制额外成本并删除长期没有贡献的组件。这也意味着未来Agent的自我改进可能不只是“让Agent自己改代码”。如何控制它的搜索空间、如何判断一次改进是否真的有效以及如何让改出来的能力迁移到没见过的任务可能会成为Agent自我进化的重要问题。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表