RSI Paper
All PapersRESEARCH NOTE / 2401.10020

Self-Rewarding Language Models

Self-Rewarding:model 能否成为自己的 judge?

Weizhe Yuan 等

Submitted Verified Version · v3Note Updated
THE QUESTION WORTH READING

用 language model 评判自己生成的回答,将偏好 feedback 用于迭代训练,同时改善回答能力与 reward 判断能力。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
Model Evolution
Loop Role
Solver · Experience Generator · Evaluator
Persistence
Across Improvement Rounds
Recursive Reuse
Demonstrated
Evidence
Task Gain · Recursive Reuse · Improver Quality Gain
System Boundary
Model Weights;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
model 通过 LLM-as-a-Judge prompt 为候选回答打分,由此形成偏好对并用于迭代 DPO。
Evidence Scope
这些结果对应有限训练轮数与特定评估;持续改进是否稳定,需要更长周期与独立评价。 已核验固定版本的相关方法与主要结果;未独立复现。

更新后的 Model 同时生成 responses 与评价下一轮 preferences;有独立 judge-quality 结果,缺少把 successor gain 归因于该变化的全面受控实验。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

固定 reward model 可能限制后续学习,reward 判断本身能否一起改进?

Inference

Preference Training 的上限受反馈质量影响。若 Judge 固定,Solver 逐渐变强后仍被同一套误差模式评价;若一直追加人工判断,成本又随规模上升。问题因而落在一个具体闭环上:能否让产生回答的 Model 同时学习判断回答,并让新 Judge 参与下一轮数据生成?

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

Constitutional AI 已使用原则和 AI Feedback 生成训练信号,但其完整 Pipeline 仍包含人工设定的 Constitution、初始训练数据及特定反馈流程。Self-Rewarding 进一步让同一 Model 在多轮中兼任回答者和 Judge。其初始化同样使用人类提供的 Instruction 与偏好相关示例,不能解读为完全没有外部监督。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

先考虑一个可观察事实:Model 有时不能一次写好答案,却能指出两个答案的差别。把这种判断能力转成 Pairwise Preference,便有了额外训练数据。如果经过训练的 Model 判断也更可靠,那么上一轮的 Judge 就没有必要永久冻结。这个推理依赖生成与判断能共同受益,仍需分别测量两种能力,不能提前用最终成功作为前提。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

固定 reward model 可能成为训练瓶颈,因此论文让 model 同时承担回答者与 judge,再将自生成偏好用于下一轮学习。值得关注的是 reward 判断能力是否随训练提升:若这一环节改善,后续训练信号也有机会变好,形成 feedback 与 policy 的共同更新。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

让 model 通过 prompt 评估候选回答,再使用生成的偏好数据进行多轮 direct preference optimization。

Inference

沿用原文的开放式 Instruction Following 设置。教学输入是“解释为什么天空呈蓝色”。同一 Model 生成几个回答,并按固定 Rubric 为它们评分,选择高低分答案组成 Preference Pair,DPO 更新 Model。新版再回答和评分。主实验的 Prompt Generator 固定为 Llama 2 Chat 70B;会更新的是用于回答与 Judge 的 Model,不能把整个数据生产链都画成同步演化。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

用 DPO 理解训练:给定偏好答案 y+ 和非偏好答案 y−,先计算当前 Model 相对 Reference Model 对各答案的 Log Probability 增量,再取差。差越大,表示训练更偏向 y+。Sigmoid 把差转换成 0 到 1 的偏好概率,负对数使错误排序受到较大惩罚。β 控制相对偏移尺度。这优化的是给定 Preference Label;标签本身是否正确,Loss 无法保证。

s(y) = log πθ(y|x) − log πref(y|x)
L = −log σ(β·[s(y+) − s(y−)])
σ(z) = 1 / (1 + exp(−z))
Inference

从两个候选理解 DPO。x 是同一个问题,y+ 是被 Judge 偏好的回答,y− 是另一个回答;πθ 是正在训练的 Model,πref 是固定参照。s(y) 衡量相对参照,当前 Model 把这个回答变得多常见。两者相减得到 Preference Margin。初始 Margin 为 0 时,Sigmoid 给 0.5,Loss 约为 0.693;若 β×Margin 变为 2,Loss 约为 0.127。因此,降低 Loss 会把相对概率推向被偏好的回答。这个推力只遵循训练标签:Judge 选错时,同一公式也会强化错误偏好。

07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:多轮自评分训练是否改善回答,并改善 Judge?→ Experiment:逐轮比较 Instruction Following,并在独立的人类排序数据上测量判断一致性。→ Answer:作者报告两种能力均有改善。实验支持有限轮次的联合改进,但没有证明自评偏差会随轮数自动消失,也没有对所有后继训练条件进行配对控制。

Paper Claim

论文在其 instruction following 实验中观察到回答与 reward 判断两方面的改善。

08

Takeaways

这篇论文改变了哪些判断?

Inference

这项工作把 Evaluator 也纳入可更新的系统状态。理解它要问三件事:谁提供 Prompt、谁生成答案、谁决定偏好。只说“Model 自己奖励自己”会遗漏固定 Rubric、Seed Data 和训练算法这些外部锚点。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是同源 Judge 的改进与真实回答质量一致。生成者和 Judge 可能共享事实盲区,或共同偏爱更长、更自信的风格;它们的互相认同上升,并不必然意味着外部用户获得更可靠的信息。

Inference

这些结果对应有限训练轮数与特定评估;持续改进是否稳定,需要更长周期与独立评价。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:在一个小型 Model 上准备独立的事实型 Instruction 与人工核验集。Day 3–5:只做一轮 Preference 构造和 LoRA DPO,另设固定外部 Judge 生成偏好的对照。Day 6–7:盲评正确率、长度与 Judge 排序准确率。最小命题是“自评带来的排序改善能否独立于表达风格”。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

构造事实相同、措辞不同的回答对,再构造措辞相同、事实不同的回答对。让自评训练偏向某种风格,随后交叉替换内容与风格。如果分数主要跟随风格而非事实,便能证伪该设置下 Judge Quality 等同于答案可靠性的假设。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究“可证伪的自奖励”:Judge 对每个偏好决定提出一个能改变其排序的最小外部检查,再让系统选择信息量最高的检查,而非给所有答案追加同等监督。Constitutional AI 提供规范约束,此提案转向识别 Judge 的具体知识盲区。需要比较相同外部检查预算下,主动选择是否降低共享错误;若检查只是重复 Judge 原有理由,机制没有获得新信息。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] Self-Rewarding Language Models · v3 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] Constitutional AI: Harmlessness from AI Feedback ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Direct Preference Optimization: Your Language Model is Secretly a Reward Model ↗DPO 的 Preference Loss 与 KL-Regularized Policy 背景。
arXiv:2401.10020 · v3 / REVIEWED 2026.09.13
返回全部论文