RSI Paper
All PapersRESEARCH NOTE / 2308.08998

Reinforced Self-Training (ReST) for Language Modeling

ReST:交替生成与筛选的 reinforced self-training

Caglar Gulcehre、Tom Le Paine、Srivatsan Srinivasan 等

Submitted Verified Version · v2Note Updated
THE QUESTION WORTH READING

把候选生成与 model 更新分开,重复利用经过 reward 筛选的数据,并明确呈现多轮 reward 上升与人类评价之间的差距。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
Model Evolution
Loop Role
Solver · Experience Generator
Persistence
Across Improvement Rounds
Recursive Reuse
Demonstrated
Evidence
Task Gain · Recursive Reuse
System Boundary
Model Weights & Sampled Data;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
reward model 为自生成候选打分;递增阈值选择训练数据,人工评价用于独立检查自动 reward 与真实偏好是否一致。
Evidence Scope
实验依赖机器翻译领域已有的 reward model,任务覆盖有限。固定 reward 作为人类偏好的代理会被反复优化所放大,候选探索范围又受当前 policy 约束;reward 阈值越严格,也不意味着留下的数据覆盖越全面。 已核验固定版本的相关方法与主要结果;未独立复现。

更新后的 Policy 在新的 Grow 阶段生成训练样本,构成 Generator 的 Recursive Reuse。固定 Reward 与 Grow / Improve 算法不影响这一局部机制判定,但没有 Controlled Successor Gain 证据。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

online reinforcement learning 需要反复采样,language model 训练成本高且数据利用率有限。论文研究能否先离线生成候选,再多次筛选和训练,以更少的采样改进 model,并考察这种 self-training 循环是否真正提高人类感知的输出质量。

Inference

Online RLHF 在生成、评价与更新之间频繁切换,成本较高。ReST 研究将数据生成与策略改进拆成 Grow 和 Improve 阶段,使一批已评分样本可被重复使用。论文主要用 Machine Translation 检查质量与样本效率。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

STaR 筛选自生成成功轨迹,Constitutional AI 用反馈训练策略。ReST 将相关思想放进 Growing-batch RL:先从当前 Policy 采样,再利用固定 Reward 对离线数据进行多次改进。训练混合中保留原始数据,以约束策略漂移。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

生成高质量训练样本常比多跑一次 Gradient Update 更昂贵。如果一批候选已经评分,就有理由分阶段提高筛选阈值,反复利用其中较好的样本。等收益接近饱和后,再用更新后的 Policy 生成新数据。这个过程希望把数据刷新成本与参数优化成本分开控制。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

生成新数据和学习已有数据不必以相同频率发生。把昂贵采样放在外层,内层逐步提高筛选标准,可以复用同一批候选;但收益首先受 reward model 衡量,因此必须区分 reward 增长与真实质量增长这两个问题。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

Grow 阶段用当前 policy 为输入生成多个候选;Improve 阶段依据 reward 阈值筛选数据并更新 policy,逐步提高阈值且复用样本。完成若干 Improve 后,再用更新后的 policy 生成下一批数据,形成跨轮保留 weights 的闭环。

Inference

沿用翻译任务:输入源语言句子,当前 Policy 生成多个译文;Reward Model 评分,Grow 阶段把生成样本与原始平行语料合并;Improve 阶段按奖励过滤或加权训练,之后再 Grow。输出是更新后的翻译 Policy,原 Reward Model 和原始语料仍提供固定锚点。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

最直观的 Improve 形式是 Reward-Filtered SFT:奖励超过阈值 τ 的译文进入负对数似然训练。提高 τ 会提升样本平均奖励,同时减少覆盖。原文讨论多种 Offline RL 更新,下面仅用过滤形式解释信息流。更高 Proxy Reward 不能直接推出更忠实的翻译。

D_τ = {(x,y)∈D_g : r(x,y) > τ}
L = −E_(x,y∈D_τ) log πθ(y|x)
Inference

D_g 表示当前生成的数据,r 是评分器,τ 是筛选阈值。先把每个样本当作过筛的候选:只有 r>τ 的样本进入 D_τ。随后把这些回答作为训练目标,增大它们的 Log-Probability。阈值提高通常让样本更少、筛选更严格,但严格不等于可靠:评分器若偏爱固定措辞,高阈值也可能只保留这种措辞。应同时检查样本覆盖、真实任务效果与评分器分数,而不能只看被筛选样本的平均 Reward。

07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:离线复用数据是否能高效改善翻译?→ Experiment:比较 Grow / Improve 配置及相关训练方法,使用自动指标与人类评价。→ Answer:作者报告质量与效率收益,结论依赖 Reward 与翻译分布;原文并未证明任意任务都能靠提高过滤阈值持续增长。

Paper Claim

作者在机器翻译 benchmark 上报告自动指标与人工评价改善,并展示离线数据复用的效率收益。进一步迭代能继续提升所用 reward,却未持续改善人工评价;结果支持有限有效的 self-training,而非单调、无上限的质量增长。

08

Takeaways

这篇论文改变了哪些判断?

Inference

ReST 的两个时间尺度很重要:同一批数据上的更多训练,与新 Policy 带来的新样本分布变化。判断 Recursive Reuse 时看更新后的 Policy 是否重新生成数据,判断收益时看独立翻译质量。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是 Reward 的排序在策略变强后仍可靠。固定 Reward 可能偏爱某种翻译风格,持续筛选会放大偏差并减少罕见表达的覆盖。

Inference

实验依赖机器翻译领域已有的 reward model,任务覆盖有限。固定 reward 作为人类偏好的代理会被反复优化所放大,候选探索范围又受当前 policy 约束;reward 阈值越严格,也不意味着留下的数据覆盖越全面。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:准备小型平行语料及独立测试。Day 3–5:比较等 Token Budget 的普通 SFT、一轮 Grow 多次 Improve、两轮 Grow。Day 6–7:人工核验否定、数字和实体翻译,区分 Reward 提升与语义保真。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

加入看起来流畅但遗漏否定词的译文,让 Proxy Reward 错误给高分。若重复 Improve 强化这类错误,便可检验奖励筛选在固定盲区下的脆弱性。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究 Reward Blind Spot 如何随数据复用扩大:把罕见语义现象作为可控变量,推导或测量何时必须刷新外部反馈。相对 Constitutional AI 的原则监督,这关注迭代优化中的反馈失效阈值。目标是可预测的停止或校验条件,而非再换一个 Reward Model。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] Reinforced Self-Training (ReST) for Language Modeling · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] STaR: Bootstrapping Reasoning With Reasoning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Constitutional AI: Harmlessness from AI Feedback ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2308.08998 · v2 / REVIEWED 2026.09.13
返回全部论文