Why Self-Rewarding Works: Theoretical Guarantees for Iterative Alignment of Language Models
Self-Rewarding 为何有效?理解 Iterative Alignment 的理论边界
从单次更新的限制到多轮迭代的 error bound,研究 self-rewarding 为何能逐渐减弱对初始 model 质量的依赖。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Formal Model
- Update Target
- No persistent system target in this setting
- Loop Role
- Not Applicable
- Persistence
- Not Applicable
- Recursive Reuse
- Not Applicable
- Evidence
- Theoretical Guarantee
- System Boundary
- Theoretical Analysis;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 形式化 self-rewarding 来自当前 policy 的对数概率;下一轮 policy 通过论文定义的 DPO 类目标更新。
- Evidence Scope
- 论文的 best response 与 self-rewarding 由 model 内部概率定义;内部一致性保证不能直接推出外部事实正确性或人类 preference alignment,也不等于无限改进。 已核验固定版本的相关方法与主要结果;未独立复现。
Formal Model 分析迭代自奖励的稳定性与有限样本条件;Theoretical Guarantee 限于其定义的事件和假设,不属于已运行的全系统 RSI 实验。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Core Intuition
用一个清楚的视角抓住方法本质。
理解 self-rewarding 要同时追踪 policy 与 reward 如何变化:本轮 model 产生的监督,又会影响下一轮的 policy。作者以 policy condition number 刻画这一耦合过程,把迭代的作用解释为内部稳定性的改善,为区分单轮训练与多轮循环提供了分析工具。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
这是 Theory,Worked Example 使用教学模型:一个问题有三个可能回答,Policy 为它们分配概率。按论文设定生成自反馈并更新分布,然后检查 Model 是否对其自身最优响应集中足够概率。输入是初始 Policy、样本数和更新规则,输出是误差上界。若 Model 一开始偏好的回答恰好是外部事实错误,这个例子也说明内部集中与客观正确之间还缺少一道论证。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
Theorem 5.3 的上界可读成“统计项乘以稳定项与暂态项之和”。n 是每轮样本量,T 是轮数,c 是跨轮最小置信度,γ 是最优响应与竞争响应的 Log-Probability Margin,κ₀ 描述初始化条件。暂态项随 T 增大衰减,统计项按 1/√n 缩小。结论还依赖 Realizability 及正的 c、γ。下面保留主要项、略去对数因子;它界定的是对自身最优响应置信度不足的概率,不能替换成所有真实任务的错误率。
Pr[π_T(y*_T(x)|x) ≤ 1−δ] ≲ [1/(γ·δ·√n)] · [1/√c + √κ₀/(1+√(n·c))^((T−1)/2)] Assumptions: realizability, c > 0, γ > 0; β ≲ 1/√n
先拆左边的事件。π_T(y|x) 是第 T 轮 Model 给回答 y 的概率,y*_T(x) 是该 Model 在这个输入下最偏好的回答;δ 是允许偏离 1 的程度。取 δ=0.1,括号内就在问:最偏好回答的概率是否仍不超过 0.9。外层 Pr 衡量这种事件出现的概率。右边则是一条上界,不是精确预测。固定其他量,把 n 增至四倍,显式的 1/√n 缩至一半;增加 T 只衰减暂态项,稳定项仍在。最后要区分 Concentration 与 Correctness:一个 Model 可以以 0.99 的概率坚持错误答案,所以这条不等式不能独自证明外部任务变得更正确。
Experiments & Claims
Research Question → Experiment → Answer
Question:单步限制与多轮收益能否被形式化?→ Validation:先给出单步下界,再推导有限样本的多轮上界,并在 Linear Softmax Model Class 中具体化条件。→ Answer:论文在所给假设下得到初始化影响衰减的保证。这主要是一条理论验证链,不能当成大规模真实 Agent 的对照实验结果。
Takeaways
这篇论文改变了哪些判断?
最有用的阅读动作是把“证明了什么”写成精确事件:哪个分布、哪个响应、哪个概率。内部稳定性可以是研究目标,但需要额外证据才能连接到外部正确性或人类偏好。一个带条件的界比无条件的“自奖励有效”更有信息。
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:实现有限回答的 Linear Softmax 玩具问题。Day 3–5:分别扫描样本量、初始偏差和 Margin,多随机种子记录内部集中度与外部正确率。Day 6–7:画出随轮数变化的两条曲线,检查它们何时分离。这个实验检验理论现象及条件敏感性,不声称复现完整 LLM Alignment。
Counterexample Design
如何构造有辨识力的反例?
给 Model 一个高度自信但错误的初始偏好,让两个正确候选接近并列,再令更新强化自身偏好。若内部误差下降而外部正确率下降,就能反驳对定理的过度外推;这并不构成对原定理的反例,除非所有假设及其评价事件都满足。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] Why Self-Rewarding Works: Theoretical Guarantees for Iterative Alignment of Language Models · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] Self-Rewarding Language Models ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] The Curse of Recursion: Training on Generated Data Makes Models Forget ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
