RSI Paper
All PapersRESEARCH NOTE / 2608.20318

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

AI4AI-Bench:Agent 能否改进 model 的学习算法?

Yizhe Chi 等

Submitted Verified Version · v1Note Updated
THE QUESTION WORTH READING

把训练算法本身设为优化目标,借助固定任务、独立重跑与隐藏评测,区分改变 model 学习方式和只改运行流程。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Framework / Protocol

Update Target
No persistent system target in this setting
Loop Role
Not Applicable
Persistence
Not Applicable
Recursive Reuse
Not Applicable
Evidence
Benchmark Measurement
System Boundary
Independent Evaluation of Learning Algorithm Design;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
固定开发预算内的实验 feedback;最终由隐藏 evaluator 对从头重跑的候选算法评分。
Evidence Scope
一次算法设计评测不包含改进后的 model 成为下一代研究者的完整闭环。固定任务与归一化尺度的选择影响汇总解释,search 预算也限制结论范围;此条目核验摘要,未审计全部提交或复现训练。 已核验固定版本的相关方法与主要结果;未独立复现。

Benchmark 测量固定研究仓库中的算法设计,源码重新运行后由独立最终协议评分。未在该 Protocol 中把结果闭合为下一代研究者再改进自身。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

自动研究任务的收益可能来自数据收集、超参数或运行优化,而不是更好的学习规则。论文尝试单独衡量 Agent 能否设计训练目标或参数更新方法,从而改善后续 model 训练过程。

Inference

自动研发 Benchmark 的高分可能来自数据选择、Hyperparameter Tuning 或更高效执行,难以隔离 Training Algorithm Design。AI4AI-Bench 研究在固定仓库与资源下,Agent 能否改变 Model 的学习方式,并通过从源码重新运行验证。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

MLE-bench 测端到端工程,RE-Bench 测多种研发任务。AI4AI-Bench 更聚焦训练算法族,区分执行效率与学习规则。其对 RSI 的算法中心解释是作者立场;本站仍将数据、Memory 和系统层改进纳入更广的研究范围。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

若只交出最终 Checkpoint,无法确定收益来自算法、运气或缓存状态。只允许源码进入最终验证,再从初始化执行,可以减少这种混淆。把快速 Proxy 与最终评分分开,进一步限制直接针对最终指标选择;但还要核查两者的数据是否独立。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

应把候选算法从 search 过程分离,再在固定条件下重新训练并评分。本站解读:这种隔离有助于区分工程提速和学习机制的改变;两者都可能有用,但对 recursive optimization 研究回答的是不同问题。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

在十个冻结的研究任务中,给 Agent 固定开发时间与计算资源修改训练算法;随后从头重跑候选,由 Agent 不可见的固定 evaluator 打分。不同任务指标被映射到同一归一化尺度后再汇总比较。

Inference

原文给 Agent 四小时和一块 B300 修改固定研究仓库。提交后仅源码保留;八个训练任务重新训练,两个非训练任务直接执行产生模型,最终由固定评分器检查。训练任务的验证阶段上限为十二小时。这里是原文协议说明,非一周复现所需的最低资源配置。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

各任务先用单调变换 φ 统一“越大越好”的方向,再分段映射:无信息模型对应 0,原算法对应 0.1,任务最优参考对应 1。原算法以上的进度占 0.9 区间。这是一项人为设计的可比坐标,不能将平均 0.2 解释成完成了 20% 的通用智能。

If φ(x) ≤ φ_b: score = 0.1·(φ(x)−φ_⊥)/(φ_b−φ_⊥)
Otherwise: score = 0.1 + 0.9·(φ(x)−φ_b)/(φ*−φ_b)
Inference

φ(x) 表示把指标方向统一后的候选表现;φ_⊥、φ_b、φ* 分别是归一化的底部、基准与目标锚点。公式把不同任务的原始指标放到共同刻度:代入 φ_b,前后两段都得到 0.1;代入 φ*,第二段得到 1。两段斜率不同,因此同样的原始指标变化可能带来不同的分数变化。解释结果时要先回到具体任务的原始指标与资源预算。这里列出主要映射,实际无效提交与边界处理应按 Benchmark 实现检查。

07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:Agent 是否能提出可重跑的算法改动?→ Experiment:在十个冻结仓库、多种系统配置下提交源码,统一重新执行并按隐藏最终评价比较基线。→ Answer:作者报告部分算法改进与明显任务差异。原文明确 Proxy 与最终评估是访问和时间隔离,部分任务可能使用同一语料,不能称为完全 Sample-disjoint。

Paper Claim

摘要报告六种系统共 29 个配置的平均归一化分数为 0.166,最好系统为 0.250;原算法在该尺度上为 0.1。这里是论文定义的归一化得分,不是准确率,也不是已经实现 recursive optimization 的比例。

08

Takeaways

这篇论文改变了哪些判断?

Inference

源码重跑与冻结评价器提高了结果可审查性。Benchmark 测的是算法设计能力;要证明 RSI,还需要把改进算法用于产生后继研究者,并测它下一轮的能力。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是任务规范能把真正算法变化与执行层捷径区分开。相同源码在固定硬件上的收益,仍可能来自特定算子或 Proxy 适配。

Inference

一次算法设计评测不包含改进后的 model 成为下一代研究者的完整闭环。固定任务与归一化尺度的选择影响汇总解释,search 预算也限制结论范围;此条目核验摘要,未审计全部提交或复现训练。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:选小型分类仓库,冻结数据、训练预算和最终评分。Day 3–5:允许 Agent 只改 Objective 或 Update Rule,源码提交后从零训练。Day 6–7:多种子与第二数据分布重跑,并对代码逐项审计。只验证协议,不复刻 B300 全套规模。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

让 Proxy 奖励早期收敛,最终任务需要更长训练保持泛化。若 Agent 的改动只改善前几步而降低最终结果,就能检验 Proxy 对算法质量的误导。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Prior Work

后续相关工作 HyperAgents 已研究可编辑 Meta-Agent,并用受控的 Improvement@k 比较产生更好后继的能力。因此,仅增加 Improver 评测不足以支撑新颖性。

Hypothesis

研究算法改进的可继承性:用发现的 Update Rule 训练小型研究 Agent,再在全新算法设计任务上比较其后继提案。相对 RE-Bench 的一次研发产物评价,这直接测闭环中的能力传递。关键是固定下一轮搜索预算与起始任务,避免把一次更好的模型分数当作更强研发能力。 相对 HyperAgents,待检验的缺口是改进机制在何种条件下可分解、移植与继承;需要同起点、同预算的组件交叉实验,识别机制作用及交互项。这个缺口尚未完成穷尽式检索,不能宣称已确认 Novelty。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement · v1 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  4. [4] HyperAgents ↗Follow-up 的相关工作核查;晚于原论文的研究仅用于评估提案,不作为作者当时的知识或动机。
arXiv:2608.20318 · v1 / REVIEWED 2026.09.13
返回全部论文