Self-Rewarding Language Models
Self-Rewarding:model 能否成为自己的 judge?
用 language model 评判自己生成的回答,将偏好 feedback 用于迭代训练,同时改善回答能力与 reward 判断能力。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Main Method
- Update Target
- Model Evolution
- Loop Role
- Solver · Experience Generator · Evaluator
- Persistence
- Across Improvement Rounds
- Recursive Reuse
- Demonstrated
- Evidence
- Task Gain · Recursive Reuse · Improver Quality Gain
- System Boundary
- Model Weights;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- model 通过 LLM-as-a-Judge prompt 为候选回答打分,由此形成偏好对并用于迭代 DPO。
- Evidence Scope
- 这些结果对应有限训练轮数与特定评估;持续改进是否稳定,需要更长周期与独立评价。 已核验固定版本的相关方法与主要结果;未独立复现。
更新后的 Model 同时生成 responses 与评价下一轮 preferences;有独立 judge-quality 结果,缺少把 successor gain 归因于该变化的全面受控实验。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Prior Work & Research Gap
前人做到哪一步,缺口在哪里?
Constitutional AI 已使用原则和 AI Feedback 生成训练信号,但其完整 Pipeline 仍包含人工设定的 Constitution、初始训练数据及特定反馈流程。Self-Rewarding 进一步让同一 Model 在多轮中兼任回答者和 Judge。其初始化同样使用人类提供的 Instruction 与偏好相关示例,不能解读为完全没有外部监督。
Idea Reconstruction
从已有知识与失败模式出发,如何走到这个想法?
先考虑一个可观察事实:Model 有时不能一次写好答案,却能指出两个答案的差别。把这种判断能力转成 Pairwise Preference,便有了额外训练数据。如果经过训练的 Model 判断也更可靠,那么上一轮的 Judge 就没有必要永久冻结。这个推理依赖生成与判断能共同受益,仍需分别测量两种能力,不能提前用最终成功作为前提。
Core Intuition
用一个清楚的视角抓住方法本质。
固定 reward model 可能成为训练瓶颈,因此论文让 model 同时承担回答者与 judge,再将自生成偏好用于下一轮学习。值得关注的是 reward 判断能力是否随训练提升:若这一环节改善,后续训练信号也有机会变好,形成 feedback 与 policy 的共同更新。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
沿用原文的开放式 Instruction Following 设置。教学输入是“解释为什么天空呈蓝色”。同一 Model 生成几个回答,并按固定 Rubric 为它们评分,选择高低分答案组成 Preference Pair,DPO 更新 Model。新版再回答和评分。主实验的 Prompt Generator 固定为 Llama 2 Chat 70B;会更新的是用于回答与 Judge 的 Model,不能把整个数据生产链都画成同步演化。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
用 DPO 理解训练:给定偏好答案 y+ 和非偏好答案 y−,先计算当前 Model 相对 Reference Model 对各答案的 Log Probability 增量,再取差。差越大,表示训练更偏向 y+。Sigmoid 把差转换成 0 到 1 的偏好概率,负对数使错误排序受到较大惩罚。β 控制相对偏移尺度。这优化的是给定 Preference Label;标签本身是否正确,Loss 无法保证。
s(y) = log πθ(y|x) − log πref(y|x) L = −log σ(β·[s(y+) − s(y−)]) σ(z) = 1 / (1 + exp(−z))
从两个候选理解 DPO。x 是同一个问题,y+ 是被 Judge 偏好的回答,y− 是另一个回答;πθ 是正在训练的 Model,πref 是固定参照。s(y) 衡量相对参照,当前 Model 把这个回答变得多常见。两者相减得到 Preference Margin。初始 Margin 为 0 时,Sigmoid 给 0.5,Loss 约为 0.693;若 β×Margin 变为 2,Loss 约为 0.127。因此,降低 Loss 会把相对概率推向被偏好的回答。这个推力只遵循训练标签:Judge 选错时,同一公式也会强化错误偏好。
Experiments & Claims
Research Question → Experiment → Answer
Question:多轮自评分训练是否改善回答,并改善 Judge?→ Experiment:逐轮比较 Instruction Following,并在独立的人类排序数据上测量判断一致性。→ Answer:作者报告两种能力均有改善。实验支持有限轮次的联合改进,但没有证明自评偏差会随轮数自动消失,也没有对所有后继训练条件进行配对控制。
Takeaways
这篇论文改变了哪些判断?
这项工作把 Evaluator 也纳入可更新的系统状态。理解它要问三件事:谁提供 Prompt、谁生成答案、谁决定偏好。只说“Model 自己奖励自己”会遗漏固定 Rubric、Seed Data 和训练算法这些外部锚点。
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:在一个小型 Model 上准备独立的事实型 Instruction 与人工核验集。Day 3–5:只做一轮 Preference 构造和 LoRA DPO,另设固定外部 Judge 生成偏好的对照。Day 6–7:盲评正确率、长度与 Judge 排序准确率。最小命题是“自评带来的排序改善能否独立于表达风格”。
Counterexample Design
如何构造有辨识力的反例?
构造事实相同、措辞不同的回答对,再构造措辞相同、事实不同的回答对。让自评训练偏向某种风格,随后交叉替换内容与风格。如果分数主要跟随风格而非事实,便能证伪该设置下 Judge Quality 等同于答案可靠性的假设。
Follow-up Research
从缺陷与需求推导新的研究问题。
研究“可证伪的自奖励”:Judge 对每个偏好决定提出一个能改变其排序的最小外部检查,再让系统选择信息量最高的检查,而非给所有答案追加同等监督。Constitutional AI 提供规范约束,此提案转向识别 Judge 的具体知识盲区。需要比较相同外部检查预算下,主动选择是否降低共享错误;若检查只是重复 Judge 原有理由,机制没有获得新信息。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] Self-Rewarding Language Models · v3 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] Constitutional AI: Harmlessness from AI Feedback ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] Direct Preference Optimization: Your Language Model is Secretly a Reward Model ↗DPO 的 Preference Loss 与 KL-Regularized Policy 背景。
