AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement
AI4AI-Bench:Agent 能否改进 model 的学习算法?
把训练算法本身设为优化目标,借助固定任务、独立重跑与隐藏评测,区分改变 model 学习方式和只改运行流程。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Framework / Protocol
- Update Target
- No persistent system target in this setting
- Loop Role
- Not Applicable
- Persistence
- Not Applicable
- Recursive Reuse
- Not Applicable
- Evidence
- Benchmark Measurement
- System Boundary
- Independent Evaluation of Learning Algorithm Design;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 固定开发预算内的实验 feedback;最终由隐藏 evaluator 对从头重跑的候选算法评分。
- Evidence Scope
- 一次算法设计评测不包含改进后的 model 成为下一代研究者的完整闭环。固定任务与归一化尺度的选择影响汇总解释,search 预算也限制结论范围;此条目核验摘要,未审计全部提交或复现训练。 已核验固定版本的相关方法与主要结果;未独立复现。
Benchmark 测量固定研究仓库中的算法设计,源码重新运行后由独立最终协议评分。未在该 Protocol 中把结果闭合为下一代研究者再改进自身。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Research Problem & Background
问题为什么重要,解决它有什么价值?
自动研究任务的收益可能来自数据收集、超参数或运行优化,而不是更好的学习规则。论文尝试单独衡量 Agent 能否设计训练目标或参数更新方法,从而改善后续 model 训练过程。
自动研发 Benchmark 的高分可能来自数据选择、Hyperparameter Tuning 或更高效执行,难以隔离 Training Algorithm Design。AI4AI-Bench 研究在固定仓库与资源下,Agent 能否改变 Model 的学习方式,并通过从源码重新运行验证。
Core Intuition
用一个清楚的视角抓住方法本质。
应把候选算法从 search 过程分离,再在固定条件下重新训练并评分。本站解读:这种隔离有助于区分工程提速和学习机制的改变;两者都可能有用,但对 recursive optimization 研究回答的是不同问题。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
各任务先用单调变换 φ 统一“越大越好”的方向,再分段映射:无信息模型对应 0,原算法对应 0.1,任务最优参考对应 1。原算法以上的进度占 0.9 区间。这是一项人为设计的可比坐标,不能将平均 0.2 解释成完成了 20% 的通用智能。
If φ(x) ≤ φ_b: score = 0.1·(φ(x)−φ_⊥)/(φ_b−φ_⊥) Otherwise: score = 0.1 + 0.9·(φ(x)−φ_b)/(φ*−φ_b)
φ(x) 表示把指标方向统一后的候选表现;φ_⊥、φ_b、φ* 分别是归一化的底部、基准与目标锚点。公式把不同任务的原始指标放到共同刻度:代入 φ_b,前后两段都得到 0.1;代入 φ*,第二段得到 1。两段斜率不同,因此同样的原始指标变化可能带来不同的分数变化。解释结果时要先回到具体任务的原始指标与资源预算。这里列出主要映射,实际无效提交与边界处理应按 Benchmark 实现检查。
Experiments & Claims
Research Question → Experiment → Answer
Question:Agent 是否能提出可重跑的算法改动?→ Experiment:在十个冻结仓库、多种系统配置下提交源码,统一重新执行并按隐藏最终评价比较基线。→ Answer:作者报告部分算法改进与明显任务差异。原文明确 Proxy 与最终评估是访问和时间隔离,部分任务可能使用同一语料,不能称为完全 Sample-disjoint。
摘要报告六种系统共 29 个配置的平均归一化分数为 0.166,最好系统为 0.250;原算法在该尺度上为 0.1。这里是论文定义的归一化得分,不是准确率,也不是已经实现 recursive optimization 的比例。
Takeaways
这篇论文改变了哪些判断?
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:选小型分类仓库,冻结数据、训练预算和最终评分。Day 3–5:允许 Agent 只改 Objective 或 Update Rule,源码提交后从零训练。Day 6–7:多种子与第二数据分布重跑,并对代码逐项审计。只验证协议,不复刻 B300 全套规模。
Counterexample Design
如何构造有辨识力的反例?
让 Proxy 奖励早期收敛,最终任务需要更长训练保持泛化。若 Agent 的改动只改善前几步而降低最终结果,就能检验 Proxy 对算法质量的误导。
Follow-up Research
从缺陷与需求推导新的研究问题。
后续相关工作 HyperAgents 已研究可编辑 Meta-Agent,并用受控的 Improvement@k 比较产生更好后继的能力。因此,仅增加 Improver 评测不足以支撑新颖性。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement · v1 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [4] HyperAgents ↗Follow-up 的相关工作核查;晚于原论文的研究仅用于评估提案,不作为作者当时的知识或动机。
