RSI Paper

RECURSIVE SELF-IMPROVEMENT

理解进化,
从一篇论文开始。

探索 AI 如何改进自身。
梳理问题、方法与证据,连接每一次研究进展。

THE IDEA BEHIND RSI

01
ExecuteModel · Agent · Tools
02
FeedbackEnvironment · Verifier
03
UpdateWeights · Memory · Code

再进一步,改进产生改进的机制。
Persistent update 与 recursive improvement,需要分别验证。

46篇论文解析
05个 Evolution Targets
Explore Self-Improvement

最近整理

PAPER COLLECTION

All Papers

按 Update Target 浏览,独立筛选 Paper Type、Loop Role 与 Evidence。跨对象研究可出现在多个主题;外部产物与基础研究同样保留。

跨轴筛选匹配同一个 Variant
找到 46 篇论文 / 本页 1–1212 个问题,逐层理解论文

DAILY DISCOVERY

arXiv Feed0

Paper Collection

追踪 Recursive Self-Improvement、Self-Evolving Agents 及相关研究。这里先收录原始 Abstract 与 provisional classification;完成原文核验和结构化解析后,进入 Paper Collection。

Daily · 09:00 SGTAwaiting first successful syncSource · arXiv
0 papers · Awaiting Analysis

首次成功检索后,将在这里显示新论文及最后检查时间。

A WORKING DEFINITION

什么发生了变化,
谁在改进下一代?

01 / METHODOLOGY
RECURSIVE SELF-IMPROVEMENT

在明确的 System Boundary 内,系统利用 Feedback,持续修改承担后续改进功能的组件;修改后的组件再次参与生成学习经验、提出、评价、选择或整合后续版本。

这是本站用于整理文献的 Operational Definition。不同论文对 RSI 的范围仍有分歧;本定义区分机制成立与效果成立,不预设无限进步、加速增长或 ASI。

01

Persistent Update

先确认更新能否进入后续 Attempts、Tasks 或 Improvement Rounds。一次回答的改写、只读检索和临时 Context 变化,需要与持久系统更新分开。

02

Recursive Mechanism

追踪被更新组件在下一轮的功能。Weights、Prompt、Memory 与 Code 都可能承担 Improver;修改代码或重复循环本身不足以证明 Recursive Reuse。Model 生成下一轮训练数据可形成结构性反馈;这不代表训练算法本身被改写。

03

Demonstrated Recursive Gain

进一步检验更新后的 Improver 是否更善于产生有效的后继版本。固定起始 Solver、候选预算和 Evaluator,比较后继质量,比只看最终 Task Score 更有辨识力。

Evolution Target

五个可重叠主题:Model、Prompt & Context、Memory、Tool & Skill、Architecture。它们回答“改了什么”。没有持久更新的工作仍可从 All Papers 找到。

Paper Type

Method、Survey、Theory、Benchmark、Empirical Analysis 独立标注。Survey 讨论 Model Evolution,不等于该 Survey 训练了一个会自我改进的 Model。

Loop Role

Solver、Experience Generator、Evaluator、Proposer、Selector、Integrator 回答“变化影响了循环中的什么功能”。同一组件可以有多个 Role。

Persistence & Evidence

记录更新保留范围、Recursive Reuse,以及 Task Gain、Transfer、Improver Quality Gain、Controlled Successor Gain 等证据。Evidence 是观察类型,不是统一能力阶梯。

用边界案例检查分类

Self-Refine
修改当前任务的回答,通常属于 Ephemeral Refinement;该循环本身没有证明跨任务的系统更新。
STaR · Self-Rewarding
更新后的 Model 分别重返 Experience Generator 与 Evaluator。两者都有 Recursive Reuse;Self-Rewarding 还测量了 Judge Quality,但这仍需与受控的后继增益区分。
TextGrad
Instance Optimization 与可复用 Prompt Optimization 分开记为 Variant。不能把前者的 Persistence 和后者的 Evidence 拼成一个虚构实验。
DGM · HyperAgents
检查哪些 Agent 组件实际被改写、哪些外层规则保持固定。局部 Recursive Mechanism 可以成立,开放式能力增长仍需额外证据。

每个 Variant 记录 System Boundary、Feedback、更新角色和 Evidence Scope。保留固定 Base Model、测试集或人工 Gate 不会自动否定局部 Recursion;扩大边界也不能代替实际的更新证据。分类是基于原文的 Editorial Assessment,可随新证据修订。

Primary Sources:A Survey of Self-Evolving Agents · Self-Improvements in Modern Agentic Systems · HyperAgents · The Last AI Built by Humans。以上文献提供不同视角;本页的判定规则是综合后的工作标准。

READING PATHS

沿着问题,深入研究。

02 / READING PATHS

从代表论文开始,逐步比较 Method、适用范围与 Evidence。每篇解析附 arXiv 原文和实际核验范围。