RSI Paper
All PapersRESEARCH NOTE / 2607.25886

RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement

RSIBench-Data:数据 strategy 迭代为何仍会退步?

Fanqing Meng 等

Submitted Verified Version · v1Note Updated
THE QUESTION WORTH READING

固定训练与评测基础设施,考察 Agent 能否从 model 失败中改进数据 strategy,并区分过程中最优成绩和最终成绩。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Framework / Protocol

Update Target
No persistent system target in this setting
Loop Role
Not Applicable
Persistence
Not Applicable
Recursive Reuse
Not Applicable
Evidence
Benchmark Measurement
System Boundary
Data Research under Fixed Post-Training;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
固定训练流程得到的 model checkpoint 评测,以及各轮数据 strategy 和研究轨迹。
Evidence Scope
这些实验支持数据研究存在可获得的收益,也显示轨迹回退,但不能证明任意数据 strategy 或 model 都能改善。基础设施与目标 model 固定,此条目仅核验摘要,不能据此判断每类错误的精确因果贡献。 已核验固定版本的相关方法与主要结果;未独立复现。

统一训练与服务后端,使数据策略成为主要研究变量。Checkpoint 的提升测量目标 Model;研究者根据反馈改数据不等于其自身 Model 或 Improver 配置已训练更新。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

自动 post-training 研究常把数据判断和系统工程混在一起,难以单独辨认 Agent 的数据研究能力。论文考察在训练工具与预算固定后,Agent 能否诊断能力缺口、设计数据并根据 model feedback 继续改进。

Inference

Data-centric Research 的难点是从 Model 失败诊断训练数据缺口,再决定生成、过滤和混合什么数据。若允许同时修改训练服务与推理栈,很难知道收益来自研究策略还是实现技巧。RSIBench-Data 固定基础设施,隔离数据研究决策。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

Self-Instruct 展示合成 Instruction Data,The AI Scientist 展示自动实验,MLE-bench 测端到端工程。RSIBench-Data 让 Agent 多轮提交数据策略,用统一 SFT 与 Evaluation 服务返回反馈,从而更集中地测量数据选择如何改变目标 Model。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

一个 Model 失败可能来自知识缺失、轨迹格式或训练覆盖;研究者应能选择不同数据干预。要比较研究者,就应统一训练后端和资源,把变化限制在可提交的数据及有限配置中。这样每轮 Checkpoint 的变化才能更直接地关联到数据策略。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

迭代中的最好成绩和最后一次成绩应分开记录。本站解读:若选择与保留机制不能守住较好版本,即使 search 曾发现有用数据 strategy,也无法把研究收益稳定转化成可持续的系统改进。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

固定目标 model、post-training 流程、服务与评测环境,让 Agent 在相同预算下迭代调整数据 strategy。对 model checkpoint feedback 和完整研究轨迹进行比较,从而把数据研究决策与底层训练工程尽可能分离。

Inference

原文 Pipeline:Agent 获得任务描述、允许的公共 Seed、工具 Schema 和预算,提交符合数据契约的训练产物;统一服务从固定 M₀ 训练 LoRA Checkpoint,固定环境评价后返回允许信号;Agent 决定是否继续及怎样修订策略。Filtering、Curriculum 和 Mixing 是研究者的可选决策,原文没有规定每轮必须依次执行这些步骤。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

可将一轮看成 D_t→Train(M₀,D_t)→M_t→Eval(M_t)。每次从同一 M₀ 训练,减少前轮参数累积的混淆;研究者通过反馈改变下一轮 D。目标 Model 改善与研究者自身 Policy 更新仍是不同事件,数据策略多轮变化不能自动证明研究者的 Model 已学习。

M_t = FixedTrain(M₀, D_t, bounded config_t)
feedback_t = FixedEval(M_t)
D_(t+1) = Researcher(history, feedback_t)
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:Agent 能否根据 Checkpoint Feedback 改善数据策略?→ Experiment:在多个任务和研究 Agent 上固定训练、服务与资源,比较初次有效尝试和后续结果。→ Answer:作者报告部分设置有迭代收益,同时存在策略失效与任务差异;结果测的是受约束的数据研究能力。

Paper Claim

四种 Agent 在六项 benchmark 上的实验中,58.33% 的设置优于首个有效尝试。在达到最好成绩后仍继续 search 的轨迹中,78.26% 最终低于该最好成绩;后一个比例的分母不是全部实验设置。

08

Takeaways

这篇论文改变了哪些判断?

Inference

这项 Benchmark 的价值在于固定服务边界。判断改进要保存每轮数据、配置、Checkpoint 和反馈,而不能只展示最佳最终分数。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是允许的诊断反馈足以指出可由数据修复的瓶颈。真实问题也可能来自 Model Capacity 或训练算法,固定后端下再优化数据可能无法解决。

Inference

这些实验支持数据研究存在可获得的收益,也显示轨迹回退,但不能证明任意数据 strategy 或 model 都能改善。基础设施与目标 model 固定,此条目仅核验摘要,不能据此判断每类错误的精确因果贡献。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:固定一个小 Model 与 LoRA 配置,准备诊断和隐藏任务。Day 3–5:允许三轮数据生成,每轮从 M₀ 重训,限制相同训练 Token。Day 6–7:比较首轮、最终轮和合并数据策略,检查反馈是否被违规转成测试标签。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

构造一个超过目标 Model 表达能力的任务,同时让诊断表面上像数据不足。若 Agent 持续生成更多相似样本而无收益,就能检测其是否知道何时应停止数据研究。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究数据干预的可解性判据:Agent 通过少量对照训练区分数据不足、优化失败和能力限制,只有在证据支持时继续生成数据。相对 Self-Instruct 的数据扩展,这将研究目标转成瓶颈识别与资源决策,关键结果是避免无效训练并预测跨任务干预收益。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement · v1 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  4. [4] Self-Instruct: Aligning Language Models with Self-Generated Instructions ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2607.25886 · v1 / REVIEWED 2026.09.13
返回全部论文