The Curse of Recursion: Training on Generated Data Makes Models Forget
Model Collapse:Recursive Training 如何丢失 Distribution Tails
分析后代 model 不断学习前代 synthetic data 时的分布退化,展示低概率事件信息逐渐丢失,为 self-generated data 训练提供必要的边界视角。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Recursive Sampling / Refitting Analysis
- Update Target
- Model Evolution
- Loop Role
- Experience Generator
- Persistence
- Across Improvement Rounds
- Recursive Reuse
- Demonstrated
- Evidence
- Negative Result · Theoretical Guarantee · Recursive Reuse
- System Boundary
- Training Distribution & Multigeneration Learning;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 前代 synthetic data;研究独立真实分布信息缺失的影响
- Evidence Scope
- 理论结果依赖采样与近似 model 假设,实验也有具体的数据替换及训练配置。本条核读定义、理论动机和实验概览,未逐项验证定理;不能将结果扩大为所有 self-training、蒸馏或带执行验证的方法都会坍缩。 已核验固定版本的相关方法与主要结果;未独立复现。
递归生成数据并再训练确实存在,但结果可以退化;Recursive Reuse 是结构证据,不能被展示为正向能力等级。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Core Intuition
用一个清楚的视角抓住方法本质。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
先利用离散分布、单维高斯和带噪近似 model 建立理论直觉,再执行多代 synthetic data 训练实验,观察分布与原始数据的偏离。方法重点是跟踪生成—采样—再学习链条,而非提出一种提高 model 成绩的训练算法。
用论文离散分布分析作教学演示:真实分布有三类事件,其中稀有类概率为 0.01。每代只抽 100 个样本,再精确拟合类别比例;若某代没有抽到稀有类,其估计概率就变成 0,后代纯合成采样再也不会出现它。输入是初始分布与代际规则,输出是概率分布随代数的变化。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
独立抽一次未见稀有事件的概率是 1−q,抽 M 次都未见就是 (1−q)^M。q=0.01、M=100 时约为 0.366,说明平均只期待一个样本并不意味着每代一定看到一个。若完全替换且零概率不可恢复,丢失会成为吸收状态。这个教学计算解释一种机制,不能代替原文对 Gaussian、VAE 和 LLM 的全部分析。
P(no rare event in M samples) = (1−q)^M For q=0.01, M=100: probability ≈ 0.366 No fresh support + zero fitted mass → no recovery
若真实分布中一类事件的概率 q=0.01,那么一次抽样没遇到它的概率是 0.99;独立抽 100 次都没遇到,概率就相乘为 0.99¹⁰⁰≈0.366。假如下一代只拟合这 100 个样本,并把未出现事件的概率设为 0,它以后也生成不出该事件。这展示了一条不可恢复的信息丢失路径。它依赖独立抽样、替换训练集与零概率拟合等教学假设;保留真实数据、平滑或外部信息会改变结论,不能据此断言所有 Synthetic Data 都会导致 Collapse。
Experiments & Claims
Research Question → Experiment → Answer
Question:递归训练是否会丢失原分布信息?→ Validation:先分析离散和 Gaussian 等简化模型,再在生成模型与语言模型设置中观察代际变化。→ Answer:作者展示分布尾部丢失与退化现象;发生条件与速度依赖数据、模型和采样机制。
论文展示特定 recursive training 设置下的分布退化,指出尾部覆盖和原始数据的重要性。这为无筛选地反复使用 synthetic data 提供了反例,但没有证明经过验证、保持多样性或保留真实数据的合成训练必然失败。
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1:实现三类离散分布和 Gaussian 拟合。Day 2–4:比较完全替换、真实数据混合与累积样本,运行多随机种子。Day 5–7:绘制稀有类保留率、分布距离和均值误差,检查平均指标是否掩盖尾部损失。普通 CPU 即可完成。
Counterexample Design
如何构造有辨识力的反例?
若有人声称“任何合成训练都必然坍塌”,可在每代固定保留覆盖所有类别的真实样本,或从已知真值生成平衡数据。若分布稳定,这反驳的是无条件表述,并不否定原文在特定递归替换条件下的分析。
Follow-up Research
从缺陷与需求推导新的研究问题。
后续研究已在其分析和实验设置中表明,保留原始数据并累积各代 Synthetic Data 可以避免所考察的 Model Collapse。因此,保留真实数据已有先例,原论文的替换式结论不能直接推广到所有混合训练。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] The Curse of Recursion: Training on Generated Data Makes Models Forget · v3 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] STaR: Bootstrapping Reasoning With Reasoning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] Self-Instruct: Aligning Language Models with Self-Generated Instructions ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [4] Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data ↗Follow-up 的相关工作核查;晚于原论文的研究仅用于评估提案,不作为作者当时的知识或动机。
