Metaⁿ: Recursive Self-Improvement through Emergent Depth
Metaⁿ:固定 meta-operator,以 recursion 扩展求解层级
保持 meta-operator Ω 固定,让它持续读取先前层级的代码与轨迹、生成下一层 strategy;recursion 发生在输入与求解层级上。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Main Method
- Update Target
- Prompt & Context Evolution · Tool & Skill Evolution · Architecture Evolution
- Loop Role
- Solver
- Persistence
- Across Tasks
- Recursive Reuse
- Unclear
- Evidence
- Task Gain
- System Boundary
- Solver Stack, Strategies & Auxiliary Code;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- solver stack 的 execution trace、产生轨迹的代码与 benchmark 任务 feedback。
- Evidence Scope
- Ω 在设计中保持固定,不应把论文对稳定性的动机直接当作一般形式化安全证明。仅核验摘要,尚未逐表检查成本或重复试验;更多层级、更多 search 与真正改进效率提高之间还需严格区分。 已核验固定版本的相关方法与主要结果;未独立复现。
Ω 固定,生成的新层、Context Conditioning 与 Helpers 持久进入 Solver Stack。输入与结构增长有实验证据,Improver 功能是否因此被持久更新仍需更明确的功能干预,保留 Unclear。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Core Intuition
用一个清楚的视角抓住方法本质。
把固定的生成操作与持续增长的操作对象分开,是理解该方法的关键。本站解读:通过 recursion 复用既有层级能够增加 strategy 组合空间,但不能仅因层级增长,就推断生成这些层级的元算法本身已经被改写。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
固定 meta-operator 读取底层 solver stack 的运行轨迹及其代码,再生成战略预处理过程与可调用的辅助函数库。对这一过程反复应用,并通过收敛决定深度、使用进化档案 search 不同层级链。
原文 LawBench 示例中,第二层产生 fuzzy_match_label,第三层加入 reconcile_labels,却附带过度规定的分析指令而退步;第四层撤回该指令,同时保留有用 Helper。Build-step 的 Ω 读取旧代码与轨迹后生成新层;Run-step 将层间 Context 向内传递并合并 Helpers。输出是 Solver Stack,而 Ω 的模板保持固定。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
若每层有 k_d 种行为,条件组合最多可表达乘积 ∏k_d 种配置,平面独立集合则只有相加的行为数量。原文明确这是表达配置的上界,非测得的有效策略数。层间干扰会让许多组合无效。把组合数、实际搜索到的方案数和隐藏任务增益分开,才能正确理解层次价值。
Stack S_d = M_d ∘ … ∘ M_2 ∘ S_1 Potential joint configurations ≤ ∏_(d=2…n) k_d Expressibility does not imply discoverability or improvement
Experiments & Claims
Research Question → Experiment → Answer
Question:收益来自层数、Helper 还是层间 Conditioning?→ Experiment:比较多任务和不同 Backbone,移除 Code Library、Outer Context 或层叠机制,并检查预算对齐。→ Answer:作者报告层间 Conditioning 是重要贡献,同时记录单任务退步;这些结果支持其架构设计,未自动识别 Ω 的改进能力发生变化。
作者在两个 foundation model、八类 benchmark 上报告优于所比较的 self-improvement 方法,并用 ablation 分析层间条件传递的作用。摘要中的比较受 foundation model、benchmark 和对照方法限制,此处不把它改写成领域通用排名。
Takeaways
这篇论文改变了哪些判断?
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:实现固定 Ω 与最多三层包装器。Day 3–5:对比真实层间 Conditioning、同量无关 Context 和平面 Helper 集合。Day 6–7:在隐藏任务统一成本重测,检查收益是否来自有用结构而非额外调用。
Counterexample Design
如何构造有辨识力的反例?
构造下层已正确处理例外、上层却根据平均轨迹加入过强规则的任务族。若层数增加提高开发均值但破坏罕见正确行为,就能检验条件组合中的覆盖与干扰。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] Metaⁿ: Recursive Self-Improvement through Emergent Depth · v1 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] Gödel Agent: A Self-Referential Agent Framework for Recursive Self-Improvement ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
