RSI Paper
All PapersRESEARCH NOTE / 2305.17493

The Curse of Recursion: Training on Generated Data Makes Models Forget

Model Collapse:Recursive Training 如何丢失 Distribution Tails

Ilia Shumailov 等

Submitted Verified Version · v3Note Updated
THE QUESTION WORTH READING

分析后代 model 不断学习前代 synthetic data 时的分布退化,展示低概率事件信息逐渐丢失,为 self-generated data 训练提供必要的边界视角。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Recursive Sampling / Refitting Analysis

Update Target
Model Evolution
Loop Role
Experience Generator
Persistence
Across Improvement Rounds
Recursive Reuse
Demonstrated
Evidence
Negative Result · Theoretical Guarantee · Recursive Reuse
System Boundary
Training Distribution & Multigeneration Learning;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
前代 synthetic data;研究独立真实分布信息缺失的影响
Evidence Scope
理论结果依赖采样与近似 model 假设,实验也有具体的数据替换及训练配置。本条核读定义、理论动机和实验概览,未逐项验证定理;不能将结果扩大为所有 self-training、蒸馏或带执行验证的方法都会坍缩。 已核验固定版本的相关方法与主要结果;未独立复现。

递归生成数据并再训练确实存在,但结果可以退化;Recursive Reuse 是结构证据,不能被展示为正向能力等级。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

如果后续 model 越来越多地学习前代 model 生成的内容,原始数据分布还能被保持吗?论文关注即便任务本身没有变化,重复生成、抽样和拟合也可能造成的代际信息损失及长尾行为退化。

Inference

当训练数据越来越多来自上一代 Model,真实分布中的罕见事件是否还能保留?Model Collapse 研究递归生成和重新拟合如何积累采样与近似误差。它关注信息保真,不能被简化成所有 Synthetic Data 都无效。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

STaR 与 Self-Instruct 展示有筛选、有 Seed 或外部目标的合成训练收益。Model Collapse 研究的关键条件包括代际采样、数据替换和近似误差。保留真实数据、加入外部验证或改变采样方式,会改变问题,因此两类结论并不直接矛盾。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

即使每代都完美拟合当前样本,有限样本也可能漏掉稀有事件。若下一代只能从这次拟合出的分布采样,已经消失的事件就没有恢复来源。反复进行后,误差会沿代际传播。这个最简单的采样现象足以提示风险,再加入函数近似与学习误差,情况可能更复杂。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

有限样本和近似拟合会遗漏低概率事件;当下一代把上一代的输出当作现实样本时,这些误差可能被继承和放大。因此训练损失下降或常见模式保持,并不足以说明整体分布被忠实保留。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

先利用离散分布、单维高斯和带噪近似 model 建立理论直觉,再执行多代 synthetic data 训练实验,观察分布与原始数据的偏离。方法重点是跟踪生成—采样—再学习链条,而非提出一种提高 model 成绩的训练算法。

Inference

用论文离散分布分析作教学演示:真实分布有三类事件,其中稀有类概率为 0.01。每代只抽 100 个样本,再精确拟合类别比例;若某代没有抽到稀有类,其估计概率就变成 0,后代纯合成采样再也不会出现它。输入是初始分布与代际规则,输出是概率分布随代数的变化。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

独立抽一次未见稀有事件的概率是 1−q,抽 M 次都未见就是 (1−q)^M。q=0.01、M=100 时约为 0.366,说明平均只期待一个样本并不意味着每代一定看到一个。若完全替换且零概率不可恢复,丢失会成为吸收状态。这个教学计算解释一种机制,不能代替原文对 Gaussian、VAE 和 LLM 的全部分析。

P(no rare event in M samples) = (1−q)^M
For q=0.01, M=100: probability ≈ 0.366
No fresh support + zero fitted mass → no recovery
Inference

若真实分布中一类事件的概率 q=0.01,那么一次抽样没遇到它的概率是 0.99;独立抽 100 次都没遇到,概率就相乘为 0.99¹⁰⁰≈0.366。假如下一代只拟合这 100 个样本,并把未出现事件的概率设为 0,它以后也生成不出该事件。这展示了一条不可恢复的信息丢失路径。它依赖独立抽样、替换训练集与零概率拟合等教学假设;保留真实数据、平滑或外部信息会改变结论,不能据此断言所有 Synthetic Data 都会导致 Collapse。

07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:递归训练是否会丢失原分布信息?→ Validation:先分析离散和 Gaussian 等简化模型,再在生成模型与语言模型设置中观察代际变化。→ Answer:作者展示分布尾部丢失与退化现象;发生条件与速度依赖数据、模型和采样机制。

Paper Claim

论文展示特定 recursive training 设置下的分布退化,指出尾部覆盖和原始数据的重要性。这为无筛选地反复使用 synthetic data 提供了反例,但没有证明经过验证、保持多样性或保留真实数据的合成训练必然失败。

08

Takeaways

这篇论文改变了哪些判断?

Inference

关注的对象应是分布覆盖与信息来源,而非只看生成文本流畅度。平均质量可以暂时稳定,罕见模式却已经消失;外部锚点的作用需要被显式记录。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的广义解释是假定纯合成替换过程代表所有自训练。现实方法可能累积真实数据、重加权稀有样本或利用可执行真值,这些干预会改变恢复信息的可能性。

Inference

理论结果依赖采样与近似 model 假设,实验也有具体的数据替换及训练配置。本条核读定义、理论动机和实验概览,未逐项验证定理;不能将结果扩大为所有 self-training、蒸馏或带执行验证的方法都会坍缩。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1:实现三类离散分布和 Gaussian 拟合。Day 2–4:比较完全替换、真实数据混合与累积样本,运行多随机种子。Day 5–7:绘制稀有类保留率、分布距离和均值误差,检查平均指标是否掩盖尾部损失。普通 CPU 即可完成。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

若有人声称“任何合成训练都必然坍塌”,可在每代固定保留覆盖所有类别的真实样本,或从已知真值生成平衡数据。若分布稳定,这反驳的是无条件表述,并不否定原文在特定递归替换条件下的分析。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Prior Work

后续研究已在其分析和实验设置中表明,保留原始数据并累积各代 Synthetic Data 可以避免所考察的 Model Collapse。因此,保留真实数据已有先例,原论文的替换式结论不能直接推广到所有混合训练。

Hypothesis

研究最小信息补充预算:在有限外部样本下,应何时、向哪些低概率区域补充信息,才能阻止不可恢复的支持集丢失?相对 Self-Instruct 的一般多样性过滤,这要求给出可测的必要信息量与恢复阈值。核心是稀有但重要能力的可持续性,而非平均得分再提高一点。 新的问题应限定为严格受限的信息预算:允许遗忘与分布漂移时,能否由可观测的稀有事件覆盖率决定最低补充量,并给出无法恢复的判据。需要与持续累积数据的已有方案直接比较。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] The Curse of Recursion: Training on Generated Data Makes Models Forget · v3 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] STaR: Bootstrapping Reasoning With Reasoning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Self-Instruct: Aligning Language Models with Self-Generated Instructions ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  4. [4] Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data ↗Follow-up 的相关工作核查;晚于原论文的研究仅用于评估提案,不作为作者当时的知识或动机。
arXiv:2305.17493 · v3 / REVIEWED 2026.09.13
返回全部论文