RSI Paper
All PapersRESEARCH NOTE / 2507.21046

A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence

Self-Evolving Agent 综述:改什么、何时改、如何改、在哪里改

Huan-ang Gao 等

Submitted Verified Version · v4Note Updated
THE QUESTION WORTH READING

以更新对象、更新时机、学习机制和应用环境建立多轴分类,并把适应、保留、generalization、效率和安全纳入评价。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Framework / Protocol

Update Target
No persistent system target in this setting
Loop Role
Not Applicable
Persistence
Not Applicable
Recursive Reuse
Not Applicable
Evidence
Conceptual Synthesis
System Boundary
Models, Context, Tools & Architecture;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
文本、内部/外部 reward、示范与 population selection
Evidence Scope
本条核读摘要及定义、分类和评测结构,未逐页通读 77 页全文。文中通向 ASI 的描述属于研究愿景;框架覆盖范围比严格 RSI 更广,不能因论文被收录就判断它已经具备 Recursive Self-Improvement 能力。 已核验固定版本的相关方法与主要结果;未独立复现。

编者归类:为 RSI 阅读提供多轴坐标。model、memory、工具或架构的变化属于更新对象,任务内与跨任务属于时间尺度;是否进一步改善了负责更新的机制,仍需逐项检查独立证据。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

model 训练、memory 管理、prompt optimization 和 multi-Agent collaboration 常被分散研究,但部署后的系统需要连续适应新任务。论文要解决的是如何为这些不同形式的演化建立共同定义,并明确自主性发生在哪个环节。

Inference

Self-Evolving Agents 同时涉及模型、Context、工具和协作流程,若按方法名称堆叠,很难找到共同问题。这篇 Survey 用 What、When、How 和应用场景组织研究,让读者分开思考更新对象、发生时机与驱动机制。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

STaR 改变 Model,Voyager 累积 Skill,ADAS 搜索 Agent 结构。这些已有工作说明适应不只发生在参数层。Survey 将它们放入更宽的 Self-Evolution 框架,涵盖训练及测试时适应;它的覆盖范围比严格要求 Improver 被持续更新的 RSI 更宽。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

同一 Agent 可以在训练阶段学参数,在部署后积累记忆,在单次任务内调整 Context。若把这些工作放入互斥桶,时间尺度与对象会混淆。先问改哪里,再问何时改、用何种反馈改,就能保留多种方法的共同点,同时解释同一技术为何出现在不同场景。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

self-evolution 不能只由是否使用 reinforcement learning 来定义,还应检查谁决定学习内容与更新时间。作者将“改什么、何时改、如何改”分开,再补充应用领域,使单次任务内适应与跨任务积累能够被区分。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

通过统一定义和多轴文献分类,整理 reward feedback、示范学习、population 演化等机制;按静态、短期适应和长期 continual learning 梳理评测范式,并分析跨领域迁移、成本比较及 multi-Agent collaboration 的研究缺口。

Inference

用 Voyager 作具体分类:What 涉及可执行 Skill 与经验记录,When 发生在持续交互过程中,How 使用环境反馈、代码生成和检索,Where 是 Minecraft。再看 ADAS,主要变化是目标 Agent Architecture。这里是按 Survey 视角进行的教学映射;是否证明 Recursive Gain 仍要回到各论文的实验。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

综述的形式化将 Agent 放进部分可观测环境,并区分组成模块与其状态。无需为这篇 Survey 学习一个新的优化推导。更实用的是把每个方法表示为多轴记录,而非一个数值等级;例如 Target 集合、Timing、Feedback 和 Domain 可以独立变化。分类向量仅表示描述,不表示越多轴被勾选就越先进。

Method record = (Targets, Timing, Mechanisms, Feedback, Domain)
Coverage across axes is descriptive, not a capability score
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:领域中的适应机制有哪些共性与差异?→ Validation:系统整理代表工作、评价目标与应用,比较组件与适应阶段。→ Answer:提供文献地图和研究议程;标题中的 ASI 路径属于愿景,不是本综述通过实验建立的因果结论。

Paper Claim

论文提供的是方法谱系与评价框架,包含适应性、保留性、generalization、效率、安全等目标,而非一个可直接部署的新算法。更新版题名加入 Where 维度,适合作为按机制检索论文的入口。

08

Takeaways

这篇论文改变了哪些判断?

Inference

最值得继承的是独立维度。本站将 Context 中的 Prompt 与 Memory 分开浏览,并再记录 Role、Persistence 与 Evidence,使读者能问“同样更新 Model 的方法,究竟更新了 Solver 还是 Judge”。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是不同论文的 self-evolving 标签对应相近的状态生命周期。Task-local Context 与跨任务 Memory 都可能被称为适应,如果缺少时间尺度,就会误读证据。

Inference

本条核读摘要及定义、分类和评测结构,未逐页通读 77 页全文。文中通向 ASI 的描述属于研究愿景;框架覆盖范围比严格 RSI 更广,不能因论文被收录就判断它已经具备 Recursive Self-Improvement 能力。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:选取六篇不同对象的代表论文。Day 3–5:先仅根据摘要分类,再阅读全文重新分类。Day 6–7:记录哪些判断被方法细节改变,形成可复用的分类问题清单。核心检验是框架是否降低误标率。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

选一个只在当前 Prompt 中检索只读资料的系统,再选一个会修改长期检索策略的系统。如果两者得到完全相同的 Evolution 描述,就说明对象分类之外还缺少提交状态和更新角色。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究不同适应时间尺度之间的干扰:同一系统的短期修订何时应该进入长期 Memory,何时应该被遗忘,再何时应转成 Weight Update。相对 STaR、Voyager 和 ADAS 各自的单层设计,问题转向跨层信用分配与稳定性,需用可控环境识别必要条件。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence · v4 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] STaR: Bootstrapping Reasoning With Reasoning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Voyager: An Open-Ended Embodied Agent with Large Language Models ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  4. [4] Automated Design of Agentic Systems ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2507.21046 · v4 / REVIEWED 2026.09.13
返回全部论文