ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

综述 | 递归自改进智能体之路:当 Agent 开始学习“如何改进自己”

综述 | 递归自改进智能体之路:当 Agent 开始学习“如何改进自己”

综述 | The Path to Recursive Self-Improving Agents: Foundation, Framework, and Future Directions

作者|Shuaiqi Liu*, Zhengkai Lin*, Yuxiang Zhang*, Yuanyi Ren*, Yue Wu, Yongbin Li, Zheng Wang, Zhihang Fu*, Jieping Ye — Alibaba Group

论文下载:

论文 GitHub 项目:

项目主页:递归自改进智能体之路

 


 

目前基于大模型的智能体系统已经能完成越来越复杂的任务,但有个关键瓶颈:这些智能体系统的改进仍依赖人类专家。


诊断问题、重新设计、实现修改、验证效果,每一轮对智能体系统的迭代改进都需要投入大量人力和时间。这限制了对智能体系统改进的效率和覆盖范围。

这就引出了一个自然的问题:能不能让智能体系统自己改进自己?

更进一步 —— 能不能让智能体系统连「改进自己的方法」也一起改进?

这篇综述 《The Path to Recursive Self-Improving Agents: Foundation, Framework, and Future Directions》, 围绕以上两个问题展开,主要研究自改进智能体系统,以及其更强形式:递归自改进智能体系统

 

这篇综述主要有四方面的贡献

1)给出自改进 Agent 系统和递归自改进 Agent 系统的形式化定义,并提出衡量自改进能力的分级标准(五级 L1–L5);

2)提出了一个研究框架,对智能体系统的自改进进行统一建模,包含改进的对象和改进的过程;

3)系统性地总结了现有相关工作,并归纳出了一套分类体系;

4)归纳总结了关键的开放问题,可作为未来的研究方向。

 


统一研究框架

论文提出了一个研究框架,统一地建模智能体系统的自改进

自改进 Agent 系统的统一研究框架:

 

截屏2026-08-09 下午6.11.26

 

这个框架回答两个核心问题:

- 改进的对象(改进什么?) —— 模型 Mt、Agent Harness Ht、Agent 数据系统 Dt、Trainer Tt ,乃至改进机制本身 Impt,都可以是改进的目标, x= {Mt, HtDt, Tt, Impt

- 改进的过程(怎么改进?)—— 改进过程可以抽象总结为: 诊断瓶颈(Diagnose)→ 提出修改(Propose)→ 评估修改(Evaluate)→ 整合修改(Integrate)四个阶段。自改进过程表示为: xt+1 = Imp(xt)

 

这个框架的价值在于:

1)它把原本分散在不同子方向(Prompt 优化、记忆系统、Skills、数据合成……)的研究纳入统一的研究框架下。相关的其他范式可作为该研究框架中的特殊形式。

2)对整个系统进行统一建模,而不只是改进固定的组件,有利于识别系统中动态变化的瓶颈,实现可持续的改进,并更加全面地审视改进带来的效果。

3)对整个系统进行统一建模时,不仅建模各个组件本身,还建模各组件间的依赖关系;这有利于评估改进一个组件对其他组件的影响,也有利于研究各组件间的协同改进。

 


自改进能力分级

论文提出了衡量自改进能力的分级标准(五级 L1–L5)

文中按以下标准对相关的工作进行了分级:

  • L1: 人工改进 Manual Improvement
  • L2: 辅助改进 Assisted Improvement
  • L3: 固定机制的自改进 Programmatic Self-Improvement
  • L4: 受限领域的递归自改进  Bounded Recursive Self-Improvement
  • L5: 通用递归自改进 General Recursive Self-Improvement

 

截屏2026-08-09 下午6.31.45

 

 


文献分类体系

基于这个框架,论文对相关工作进行了系统的梳理,按改进的对象来划分现有工作:

  • Agent Harness自改进(第 3 节)
  • Agent数据系统自改进(第 4 节)
  • Agent Trainer自改进(第 5 节)
  • 跨组件协同改进(第 6 节)

 

相关工作的分类体系(Taxonomy)总结如下图所示:

截屏2026-08-09 下午6.17.56

 

 

 
Agent Harness 自改进
截屏2026-08-09 下午9.39.05

 

Agent 数据系统自改进

 截屏2026-08-09 下午9.39.22

 

Agent Trainer 自改进

截屏2026-08-09 下午9.39.37

 


开放研究问题

1)在贴近真实生产的任务上对改进效果进行长周期的评测

2)对Agent友好的可观测、可扩展、可修改的训练和推理基础设施

3)从受限递归自改进到通用递归自改进

4)递归自我修改下的安全与可控

5)人类专家与智能体协同改进

(第 7 节)

 

 


 

如果本文对您有所帮助,欢迎引用:

@article{202608.0051,doi = {10.20944/preprints202608.0051.v1},url = {https://doi.org/10.20944/preprints202608.0051.v1},year = 2026,month = {August},publisher = {Preprints},author = {Shuaiqi Liu and Zhengkai Lin and Yuxiang Zhang and Yuanyi Ren and Yue Wu and Yongbin Li and Zheng Wang and Zhihang Fu and Jieping Ye},title = {The Path to Recursive Self-Improving Agents: Foundation, Framework, and Future Directions},journal = {Preprints}
}
 

欢迎交流探讨

 

论文下载:

论文 GitHub 项目:

项目主页:递归自改进智能体之路

返回列表