RSI Paper
All PapersRESEARCH NOTE / 2607.13104

Self-Improvements in Modern Agentic Systems: A Survey

现代 Agent 如何实现 self-improvement:model 与 scaffold 的统一视角

Zhe Ren 等

Submitted Verified Version · v1Note Updated
THE QUESTION WORTH READING

用“更新什么、凭什么更新”组织 self-improvement 研究,将 model parameters 与 prompt、memory、工具、control logic 放入同一个系统框架。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Framework / Protocol

Update Target
No persistent system target in this setting
Loop Role
Not Applicable
Persistence
Not Applicable
Recursive Reuse
Not Applicable
Evidence
Conceptual Synthesis
System Boundary
Model Parameters & Scaffolds;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
综合内生生成、评价 feedback 与环境经验
Evidence Scope
本条核对了 arXiv 摘要与正文框架,未逐页通读 97 页全文。综述覆盖 self-improvement 的广义家族,不意味着每篇收录论文都实现了改进机制自身通过 recursion 获得提升,也不提供通用 RSI 已实现的实证。 已核验固定版本的相关方法与主要结果;未独立复现。

该综述从 model 与 scaffold 组成、更新对象及 feedback 信号分析 Agent self-improvement,帮助区分经验保留、系统更新和能力测量。作为定义与框架研究收录,不把分类方案本身当作 recursive optimization 系统的实证。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

同样被称为 self-improvement 的系统,实际可能只修改一次回答,也可能积累 memory 或更新 model parameters。缺少统一的系统描述,会让机制、学习信号和评测结果难以比较,也难以判断能力是否被持续保留。

Inference

Self-improvement 被用于描述权重训练、记忆更新、代码搜索和当前答案修订,导致同一词指向不同过程。这篇 Survey 从系统状态与更新算子出发,试图建立可比较的描述语言。其价值在于帮助读者判断什么被保留、由什么信号改变、证据支持到哪一步。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

较早的 Self-Evolving Agents Survey 用 What、When、How 组织领域;DGM 与 Self-Rewarding 分别展示代码和 Model 层的闭环。本文更强调 Foundation Model 与 Operational Scaffold 的组合,以及系统自身执行所产生的信号如何被提交成持久更新。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

如果只按应用领域分组,同一更新机制会散落在多个栏目;只按是否更新 Weights,又会漏掉工具和 Memory。可以先将系统写成可变状态,再追踪一次执行产生什么信号、哪个算子提交修改。由此自然得到 Update Target 与 Feedback 两条独立轴,并留下对 Improver 自身变化的进一步问题。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

作者把 Agent 表示为 foundation model 与 scaffold 的组合,并用自主产生且提交更新的算子描述改进。这一视角将关注点放在经验如何转化为保留的系统变化,而不只看最终回答是否更好。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

综述先建立系统层面的形式化,再按更新对象和驱动信号梳理方法,将 model 改进与 scaffold 改进分成两大分支,并另设评测与 benchmark 入口。各类方法与代表论文之间建立了可追踪的索引。

Inference

用库中的 Self-Rewarding 做分类演示:θ 表示会更新的 Model,Scaffold 包含固定 Rubric 和生成流程;Model 生成回答及判断,训练将偏好反馈变成下一版 θ。再用 DGM 对照:θ 固定,Agent Code 属于 Scaffold,修改后继续参与后续工作。输入是论文实验描述,输出是系统边界、状态与更新角色的分类记录,而非一个新算法。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

原文将 Agent 表示为 A_t=(θ_t,Σ_t),Σ 包括 Prompt、Memory、Tools 和控制结构。执行过程 E 产生轨迹、Critique 或候选修改,U 将它们变成下一状态。符号的作用是清楚区分“产生反馈”与“提交更新”。仅有 A_(t+1)=U(…) 的写法,没有给出质量单调上升的定理,也没有说明 U 一定随轮数变化。

A_t = (θ_t, Σ_t)
Σ_t = (prompt_t, memory_t, tools_t, control_t)
A_(t+1) = U(A_1:t, E(policy_t, context_t))
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:分散方法能否在共同系统框架中比较?→ Validation:综述将已有工作按组件、信号、应用与评价组织,讨论持久更新及开放问题。→ Answer:它提供概念综合与文献证据,未通过一个新受控实验验证所有 Self-improvement 机制有效。

Paper Claim

主要产出是组织文献的框架与研究地图,而非新的性能纪录。其价值在于把 prompt evolution、memory 积累、工具创建和参数学习放到可比较的坐标中,并连接应用、评测与尚未解决的问题。

08

Takeaways

这篇论文改变了哪些判断?

Inference

这篇 Survey 最适合作为阅读检查表:先写系统状态,再写更新与证据。本站五个 Evolution Targets 借助这种组件视角组织,但额外把 Loop Role 和 Recursive Gain 分开,以便避免把状态更新当作效果证明。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是论文描述足够详细,让读者辨认实际提交的状态。Many-agent 系统里,日志、缓存、Prompt 与参数的生命周期可能不同;缺少实现证据时,分类应保留 Unclear。

Inference

本条核对了 arXiv 摘要与正文框架,未逐页通读 97 页全文。综述覆盖 self-improvement 的广义家族,不意味着每篇收录论文都实现了改进机制自身通过 recursion 获得提升,也不提供通用 RSI 已实现的实证。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:选取十篇横跨权重、记忆和代码的论文。Day 3–5:由两位读者独立标注 Boundary、Target、Persistence 和 Role,并定位原文证据。Day 6–7:统计分歧,检查规则能否解决边界案例。此处复现的是分类可操作性,不是算法性能。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

找一篇在同一报告中同时包含单题 Refinement 和跨任务 Prompt Learning 的论文。若框架只能给整个论文一个互斥标签,就无法准确表达两个实验,说明需要 Variant 级记录。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究可执行的 Self-improvement 证据规范:让系统导出状态差分、更新来源和后续调用关系,由工具自动检查是否发生持久更新及 Recursive Reuse。相对已有 Survey 的文本分类,这将定义转为可复核的实验对象。真正难点是让不同实现共享功能语义,而非只统一字段名字。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] Self-Improvements in Modern Agentic Systems: A Survey · v1 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  4. [4] Self-Rewarding Language Models ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2607.13104 · v1 / REVIEWED 2026.09.13
返回全部论文