RSI Paper
All PapersRESEARCH NOTE / 2608.24735

Metaⁿ: Recursive Self-Improvement through Emergent Depth

Metaⁿ:固定 meta-operator,以 recursion 扩展求解层级

Zae Myung Kim、Young-Jun Lee、Seungyeon Jwa、Dongyeop Kang

Submitted Verified Version · v1Note Updated
THE QUESTION WORTH READING

保持 meta-operator Ω 固定,让它持续读取先前层级的代码与轨迹、生成下一层 strategy;recursion 发生在输入与求解层级上。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
Prompt & Context Evolution · Tool & Skill Evolution · Architecture Evolution
Loop Role
Solver
Persistence
Across Tasks
Recursive Reuse
Unclear
Evidence
Task Gain
System Boundary
Solver Stack, Strategies & Auxiliary Code;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
solver stack 的 execution trace、产生轨迹的代码与 benchmark 任务 feedback。
Evidence Scope
Ω 在设计中保持固定,不应把论文对稳定性的动机直接当作一般形式化安全证明。仅核验摘要,尚未逐表检查成本或重复试验;更多层级、更多 search 与真正改进效率提高之间还需严格区分。 已核验固定版本的相关方法与主要结果;未独立复现。

Ω 固定,生成的新层、Context Conditioning 与 Helpers 持久进入 Solver Stack。输入与结构增长有实验证据,Improver 功能是否因此被持久更新仍需更明确的功能干预,保留 Unclear。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

多数系统只修订答案,或者把新增的元层固定在预设深度。论文研究能否让后续层读取此前系统的代码和行为,从中构造新的 strategy 层,使改进的层级深度通过运行过程形成。

Inference

允许 Agent 修改自身会产生稳定性问题,固定改进器又可能限制可调整范围。Metaⁿ 选择保留 Meta-operation Ω,递归扩展它读取的 Solver Stack、代码与轨迹。核心问题是增加层次与条件信息是否能产生更有效、可迁移的系统。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

DGM 通过代码自修改与 Archive 探索,Gödel Agent 允许动态修改运行逻辑。Metaⁿ 的差异是 Ω 固定,新增层在 Build-time 生成、Run-time 包装下层 Solver。固定算子与越来越丰富的输入可以产生复杂变化,但是否构成 Improver 的持久更新,需要根据功能与边界分析。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

上层若只能看最终答案,就难以判断错误来自策略还是工具。让它同时看下层代码与轨迹,便可以针对控制结构提出新包装。每层又能为下一层提供更多失败案例与可调用函数。这个推理支持层次化搜索的可能价值,不能预先假设层数越多就代表更高能力。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

把固定的生成操作与持续增长的操作对象分开,是理解该方法的关键。本站解读:通过 recursion 复用既有层级能够增加 strategy 组合空间,但不能仅因层级增长,就推断生成这些层级的元算法本身已经被改写。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

固定 meta-operator 读取底层 solver stack 的运行轨迹及其代码,再生成战略预处理过程与可调用的辅助函数库。对这一过程反复应用,并通过收敛决定深度、使用进化档案 search 不同层级链。

Inference

原文 LawBench 示例中,第二层产生 fuzzy_match_label,第三层加入 reconcile_labels,却附带过度规定的分析指令而退步;第四层撤回该指令,同时保留有用 Helper。Build-step 的 Ω 读取旧代码与轨迹后生成新层;Run-step 将层间 Context 向内传递并合并 Helpers。输出是 Solver Stack,而 Ω 的模板保持固定。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

若每层有 k_d 种行为,条件组合最多可表达乘积 ∏k_d 种配置,平面独立集合则只有相加的行为数量。原文明确这是表达配置的上界,非测得的有效策略数。层间干扰会让许多组合无效。把组合数、实际搜索到的方案数和隐藏任务增益分开,才能正确理解层次价值。

Stack S_d = M_d ∘ … ∘ M_2 ∘ S_1
Potential joint configurations ≤ ∏_(d=2…n) k_d
Expressibility does not imply discoverability or improvement
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:收益来自层数、Helper 还是层间 Conditioning?→ Experiment:比较多任务和不同 Backbone,移除 Code Library、Outer Context 或层叠机制,并检查预算对齐。→ Answer:作者报告层间 Conditioning 是重要贡献,同时记录单任务退步;这些结果支持其架构设计,未自动识别 Ω 的改进能力发生变化。

Paper Claim

作者在两个 foundation model、八类 benchmark 上报告优于所比较的 self-improvement 方法,并用 ablation 分析层间条件传递的作用。摘要中的比较受 foundation model、benchmark 和对照方法限制,此处不把它改写成领域通用排名。

08

Takeaways

这篇论文改变了哪些判断?

Inference

Metaⁿ 最值得读的是 Build-step 与 Run-step 的分离,以及失败指令被后层撤销的案例。递归组合和递归改进机制相关,但不能只凭层数给 RSI 能力排名。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是更丰富的历史持续提供有效信息。代码与轨迹增长也会引入冗余、冲突和 Context 压力,固定 Ω 未必能可靠识别应保留或撤销的部分。

Inference

Ω 在设计中保持固定,不应把论文对稳定性的动机直接当作一般形式化安全证明。仅核验摘要,尚未逐表检查成本或重复试验;更多层级、更多 search 与真正改进效率提高之间还需严格区分。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:实现固定 Ω 与最多三层包装器。Day 3–5:对比真实层间 Conditioning、同量无关 Context 和平面 Helper 集合。Day 6–7:在隐藏任务统一成本重测,检查收益是否来自有用结构而非额外调用。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

构造下层已正确处理例外、上层却根据平均轨迹加入过强规则的任务族。若层数增加提高开发均值但破坏罕见正确行为,就能检验条件组合中的覆盖与干扰。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究层次是否可被功能性压缩:将深层 Stack 蒸馏为同预算平面程序,再比较未见任务与产生下一层的能力。相对 DGM 的版本演化,这直接检验 Meta-depth 是否包含不可约的改进结构。若平面程序完全保留收益,层数应被解释为搜索历史的表示,而非能力层级。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] Metaⁿ: Recursive Self-Improvement through Emergent Depth · v1 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Gödel Agent: A Self-Referential Agent Framework for Recursive Self-Improvement ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2608.24735 · v1 / REVIEWED 2026.09.13
返回全部论文