Metaⁿ: Recursive Self-Improvement through Emergent Depth
Metaⁿ:固定 meta-operator,以 recursion 扩展求解层级
保持 meta-operator Ω 固定,让它持续读取先前层级的代码与轨迹、生成下一层 strategy;recursion 发生在输入与求解层级上。
THE IDEA BEHIND RSI
再进一步,改进产生改进的机制。
Persistent update 与 recursive improvement,需要分别验证。
最近整理
PAPER COLLECTION
按 Update Target 浏览,独立筛选 Paper Type、Loop Role 与 Evidence。跨对象研究可出现在多个主题;外部产物与基础研究同样保留。
Metaⁿ:固定 meta-operator,以 recursion 扩展求解层级
保持 meta-operator Ω 固定,让它持续读取先前层级的代码与轨迹、生成下一层 strategy;recursion 发生在输入与求解层级上。
AI4AI-Bench:Agent 能否改进 model 的学习算法?
把训练算法本身设为优化目标,借助固定任务、独立重跑与隐藏评测,区分改变 model 学习方式和只改运行流程。
PAST-Bench:保留的经验,真的改善了下一次任务吗?
在新会话任务中控制是否保留经验,同时检查成绩变化与保存、检索、更新路径,衡量 memory 是否真正带来后续收益。
RSIBench-Data:数据 strategy 迭代为何仍会退步?
固定训练与评测基础设施,考察 Agent 能否从 model 失败中改进数据 strategy,并区分过程中最优成绩和最终成绩。
现代 Agent 如何实现 self-improvement:model 与 scaffold 的统一视角
用“更新什么、凭什么更新”组织 self-improvement 研究,将 model parameters 与 prompt、memory、工具、control logic 放入同一个系统框架。
Self-Rewarding 为何有效?理解 Iterative Alignment 的理论边界
从单次更新的限制到多轮迭代的 error bound,研究 self-rewarding 为何能逐渐减弱对初始 model 质量的依赖。
ACE:让 context 成为持续演化的经验手册
把 context 管理为可增量更新的 strategy 条目,由生成、reflection 和整理三类角色积累经验,缓解反复整体重写造成的信息流失。
Self-Evolving Agent 综述:改什么、何时改、如何改、在哪里改
以更新对象、更新时机、学习机制和应用环境建立多轴分类,并把适应、保留、generalization、效率和安全纳入评价。
GEPA:从 execution trace 中提炼 reflection 并演化 prompt
让 model 阅读 reasoning 和工具 execution trace,用自然语言诊断失败,再通过候选 population 与 Pareto 选择积累互补的 prompt strategy。
AlphaEvolve:用可验证 feedback 演化算法与计算基础设施
LLM 生成程序变体,自动 evaluator 执行并验证,程序数据库保留可用于后续 search 的候选,覆盖数学发现与工程优化。
Darwin Gödel Machine:让 Agent 改写自己
通过修改自身代码、在编程 benchmark 上验证效果,并保留多样化的 Agent 档案,探索开放式 self-improvement。
Absolute Zero:从自我出题到自我学习
同一个 model 提出并解决代码 reasoning 任务,以 executor 提供可验证 feedback,让训练 curriculum 与 reasoning 能力共同演化。
DAILY DISCOVERY
追踪 Recursive Self-Improvement、Self-Evolving Agents 及相关研究。这里先收录原始 Abstract 与 provisional classification;完成原文核验和结构化解析后,进入 Paper Collection。
首次成功检索后,将在这里显示新论文及最后检查时间。
A WORKING DEFINITION
在明确的 System Boundary 内,系统利用 Feedback,持续修改承担后续改进功能的组件;修改后的组件再次参与生成学习经验、提出、评价、选择或整合后续版本。
这是本站用于整理文献的 Operational Definition。不同论文对 RSI 的范围仍有分歧;本定义区分机制成立与效果成立,不预设无限进步、加速增长或 ASI。
先确认更新能否进入后续 Attempts、Tasks 或 Improvement Rounds。一次回答的改写、只读检索和临时 Context 变化,需要与持久系统更新分开。
追踪被更新组件在下一轮的功能。Weights、Prompt、Memory 与 Code 都可能承担 Improver;修改代码或重复循环本身不足以证明 Recursive Reuse。Model 生成下一轮训练数据可形成结构性反馈;这不代表训练算法本身被改写。
进一步检验更新后的 Improver 是否更善于产生有效的后继版本。固定起始 Solver、候选预算和 Evaluator,比较后继质量,比只看最终 Task Score 更有辨识力。
五个可重叠主题:Model、Prompt & Context、Memory、Tool & Skill、Architecture。它们回答“改了什么”。没有持久更新的工作仍可从 All Papers 找到。
Method、Survey、Theory、Benchmark、Empirical Analysis 独立标注。Survey 讨论 Model Evolution,不等于该 Survey 训练了一个会自我改进的 Model。
Solver、Experience Generator、Evaluator、Proposer、Selector、Integrator 回答“变化影响了循环中的什么功能”。同一组件可以有多个 Role。
记录更新保留范围、Recursive Reuse,以及 Task Gain、Transfer、Improver Quality Gain、Controlled Successor Gain 等证据。Evidence 是观察类型,不是统一能力阶梯。
每个 Variant 记录 System Boundary、Feedback、更新角色和 Evidence Scope。保留固定 Base Model、测试集或人工 Gate 不会自动否定局部 Recursion;扩大边界也不能代替实际的更新证据。分类是基于原文的 Editorial Assessment,可随新证据修订。
Primary Sources:A Survey of Self-Evolving Agents · Self-Improvements in Modern Agentic Systems · HyperAgents · The Last AI Built by Humans。以上文献提供不同视角;本页的判定规则是综合后的工作标准。
READING PATHS
从代表论文开始,逐步比较 Method、适用范围与 Evidence。每篇解析附 arXiv 原文和实际核验范围。
先理解一次回答如何被修订,再看 experience 和 model parameters 如何进入下一轮。
分清 optimization target 与 optimizer,追踪哪一部分变化真正接管了后续改进。
关注 feedback 可靠性、experience 保留的作用和独立 evaluation,检查结果能否持续。