RSI Paper
All PapersRESEARCH NOTE / 2601.22513

Why Self-Rewarding Works: Theoretical Guarantees for Iterative Alignment of Language Models

Self-Rewarding 为何有效?理解 Iterative Alignment 的理论边界

Shi Fu 等

Submitted Verified Version · v2Note Updated
THE QUESTION WORTH READING

从单次更新的限制到多轮迭代的 error bound,研究 self-rewarding 为何能逐渐减弱对初始 model 质量的依赖。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Formal Model

Update Target
No persistent system target in this setting
Loop Role
Not Applicable
Persistence
Not Applicable
Recursive Reuse
Not Applicable
Evidence
Theoretical Guarantee
System Boundary
Theoretical Analysis;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
形式化 self-rewarding 来自当前 policy 的对数概率;下一轮 policy 通过论文定义的 DPO 类目标更新。
Evidence Scope
论文的 best response 与 self-rewarding 由 model 内部概率定义;内部一致性保证不能直接推出外部事实正确性或人类 preference alignment,也不等于无限改进。 已核验固定版本的相关方法与主要结果;未独立复现。

Formal Model 分析迭代自奖励的稳定性与有限样本条件;Theoretical Guarantee 限于其定义的事件和假设,不属于已运行的全系统 RSI 实验。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

没有持续的 external feedback,self-rewarding 训练为什么还可能带来改善?

Inference

Self-Rewarding 的经验增益留下一个理论问题:没有持续外部反馈,系统为什么不会只是强化已有偏差?这篇论文建立一个可分析的迭代模型。其价值在于指出结论依赖哪些初始条件、样本量和稳定性条件;读者需要同时看被界定的误差究竟是什么。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

Self-Rewarding Language Models 已报告有限轮的生成与判断改进。Model Collapse 研究则显示,在特定递归数据替换设置中,训练于合成数据可能遗失真实分布信息。两类研究的目标与假设不同,不能仅由“使用自身输出”推断成功或失败;理论分析需要明确更新算子和误差定义。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

可以先把复杂 LLM 简化为对有限回答分配概率的策略。一次更新若过度依赖很差的初始化,误差可能很大;多轮是否缓解这个问题,取决于更新是否让某种不稳定量收缩。接着把误差拆为有限样本带来的噪声,以及初始状态留下的影响,就得到可以分别研究 n 和 T 的理论路线。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

理解 self-rewarding 要同时追踪 policy 与 reward 如何变化:本轮 model 产生的监督,又会影响下一轮的 policy。作者以 policy condition number 刻画这一耦合过程,把迭代的作用解释为内部稳定性的改善,为区分单轮训练与多轮循环提供了分析工具。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

分析单步更新的下界与多轮训练的 finite-sample error,并在线性 softmax model 类中给出具体实例。

Inference

这是 Theory,Worked Example 使用教学模型:一个问题有三个可能回答,Policy 为它们分配概率。按论文设定生成自反馈并更新分布,然后检查 Model 是否对其自身最优响应集中足够概率。输入是初始 Policy、样本数和更新规则,输出是误差上界。若 Model 一开始偏好的回答恰好是外部事实错误,这个例子也说明内部集中与客观正确之间还缺少一道论证。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

Theorem 5.3 的上界可读成“统计项乘以稳定项与暂态项之和”。n 是每轮样本量,T 是轮数,c 是跨轮最小置信度,γ 是最优响应与竞争响应的 Log-Probability Margin,κ₀ 描述初始化条件。暂态项随 T 增大衰减,统计项按 1/√n 缩小。结论还依赖 Realizability 及正的 c、γ。下面保留主要项、略去对数因子;它界定的是对自身最优响应置信度不足的概率,不能替换成所有真实任务的错误率。

Pr[π_T(y*_T(x)|x) ≤ 1−δ]
 ≲ [1/(γ·δ·√n)] · [1/√c + √κ₀/(1+√(n·c))^((T−1)/2)]
Assumptions: realizability, c > 0, γ > 0; β ≲ 1/√n
Inference

先拆左边的事件。π_T(y|x) 是第 T 轮 Model 给回答 y 的概率,y*_T(x) 是该 Model 在这个输入下最偏好的回答;δ 是允许偏离 1 的程度。取 δ=0.1,括号内就在问:最偏好回答的概率是否仍不超过 0.9。外层 Pr 衡量这种事件出现的概率。右边则是一条上界,不是精确预测。固定其他量,把 n 增至四倍,显式的 1/√n 缩至一半;增加 T 只衰减暂态项,稳定项仍在。最后要区分 Concentration 与 Correctness:一个 Model 可以以 0.99 的概率坚持错误答案,所以这条不等式不能独自证明外部任务变得更正确。

07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:单步限制与多轮收益能否被形式化?→ Validation:先给出单步下界,再推导有限样本的多轮上界,并在 Linear Softmax Model Class 中具体化条件。→ Answer:论文在所给假设下得到初始化影响衰减的保证。这主要是一条理论验证链,不能当成大规模真实 Agent 的对照实验结果。

Paper Claim

作者在所设定的理论条件下,得到随样本量下降的 error bound,以及对初始化依赖随迭代减弱的结论。

08

Takeaways

这篇论文改变了哪些判断?

Inference

最有用的阅读动作是把“证明了什么”写成精确事件:哪个分布、哪个响应、哪个概率。内部稳定性可以是研究目标,但需要额外证据才能连接到外部正确性或人类偏好。一个带条件的界比无条件的“自奖励有效”更有信息。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱之处在于跨输入、跨轮次保持正 Margin 与置信度,以及目标 Policy 可被模型类表达。平均置信度高无法替代最坏情况条件;接近决策边界的少数任务,可能使界中的常数变得很大。

Inference

论文的 best response 与 self-rewarding 由 model 内部概率定义;内部一致性保证不能直接推出外部事实正确性或人类 preference alignment,也不等于无限改进。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:实现有限回答的 Linear Softmax 玩具问题。Day 3–5:分别扫描样本量、初始偏差和 Margin,多随机种子记录内部集中度与外部正确率。Day 6–7:画出随轮数变化的两条曲线,检查它们何时分离。这个实验检验理论现象及条件敏感性,不声称复现完整 LLM Alignment。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

给 Model 一个高度自信但错误的初始偏好,让两个正确候选接近并列,再令更新强化自身偏好。若内部误差下降而外部正确率下降,就能反驳对定理的过度外推;这并不构成对原定理的反例,除非所有假设及其评价事件都满足。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究将内部收缩与外部正确性连接起来所需的最小信息条件:每隔若干轮只允许少量独立核验,问这些核验应覆盖什么结构才能避免稳定地走向错误固定点。Self-Rewarding 展示经验过程,Model Collapse 展示信息丢失风险;新的理论目标应是可识别性阈值和必要条件,而非再换一组更宽松的收敛常数。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] Why Self-Rewarding Works: Theoretical Guarantees for Iterative Alignment of Language Models · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] Self-Rewarding Language Models ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] The Curse of Recursion: Training on Generated Data Makes Models Forget ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2601.22513 · v2 / REVIEWED 2026.09.13
返回全部论文