RSI Paper
All PapersRESEARCH NOTE / 2408.02666

Self-Taught Evaluators

Self-Taught Evaluators:以 synthetic preferences 迭代训练 judge

Tianlu Wang、Ilia Kulikov、Olga Golovneva 等

Submitted Verified Version · v2Note Updated
THE QUESTION WORTH READING

从未标注偏好的 instruction 构造优劣回答对,让 judge model 生成并筛选判断理由,再用这些理由反复训练评判能力。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Iterative Judge Training

Update Target
Model Evolution
Loop Role
Evaluator · Experience Generator
Persistence
Across Improvement Rounds
Recursive Reuse
Demonstrated
Evidence
Task Gain · Improver Quality Gain · Recursive Reuse
System Boundary
Judge Model Weights;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
回答对的预设合成优劣关系校验 model 判断;与预设关系一致的理由和标签成为下一轮监督训练数据。
Evidence Scope
无需人工偏好标签不等于无需人工来源的 instruction,也不等于每个合成优劣关系都可靠。扰动可能改变任务而非单纯降低质量,筛选还会继承初始 judge 偏差;固定 benchmark 提升不保证对新 model 或新错误类型同样有效。 已核验固定版本的相关方法与主要结果;未独立复现。

当前 Judge 为下一轮产生 Judgment Trajectories,筛选后从 Seed Model 训练新版;新版再次承担标注,构成局部 Recursive Reuse。构造回答对的 Model 与外层过滤规则固定;Judge Accuracy 增益尚非 Controlled Successor Gain。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

judge model 既用于训练 reward,也用于 model 比较,但人工偏好数据昂贵且会随着被评 model 变化而过时。论文研究能否只用合成训练信号提升 judge,让它不断产生更有用的判断理由,而无需追加人工偏好标签。

Inference

Model 越强,旧 Preference Data 越容易过时,人工评判成本也越高。Self-Taught Evaluators 研究如何构造带已知对照关系的合成回答对,训练 Judge 的推理与排序能力,并迭代更新判断数据。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

Self-Rewarding 同时更新回答者与 Judge,STaR 筛选成功推理用于训练。Self-Taught Evaluators 更集中于 Judge:通过修改 Instruction 构造不符合原请求的回答作为对照,再保留与构造标签一致的判断轨迹。无人工 Preference Label 仍依赖输入 Instruction 与合成规则。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

如果任意两个答案的优劣很难自动判断,可以先构造差别明确的对照:一个回答原问题,另一个高质量地回答了略有不同的问题。这样能得到训练用标签。Judge 对同一对答案采样多条解释,保留最终判断正确的路径,再用于下一轮训练;难点是这种合成错误能否代表真实模型的细微错误。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

先构造预期存在优劣关系的回答对,就能把难以收集的真实偏好问题转成对已知合成关系的判断问题。judge 生成的理由经过关系检查后成为下一轮训练数据,使评价能力本身进入 self-training 循环。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

选择未带偏好标注的 instruction,生成正常回答及针对扰动 instruction 的回答作为对照。当前 judge model 多次生成判断和理由,保留选中预期优胜答案的轨迹,再 supervised fine-tuning model;重复上述过程以更新下一轮 judge。

Inference

沿用论文 Response Pair Construction 作教学演示:原请求要求解释太阳能,修改请求改为解释风能。分别生成高质量回答,将风能回答作为原请求下的不匹配项;Judge 输出理由与胜者,标签一致的轨迹被保留。每轮用当前 Judge 重新标注,再从 Seed Model Fine-Tune;构造回答对的模型与 Judge 更新角色应分别记录。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

训练只对 Judgment 部分计算 Negative Log-Likelihood。先采样多个 Judgment j,只有 Verdict 与合成标签一致的轨迹进入数据。该筛选验证最终排序,没有逐句核验解释。Model Selection 还考虑位置偏差,因此交换 A/B 顺序是重要检查。公式展示数据筛选与训练的关系,不能保证合成标签在所有边界案例中都正确。

J_valid = {j : verdict(j) = synthetic label}
L = −log pθ(j | instruction, answer A, answer B)
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:合成数据能否训练出更可靠 Judge?→ Experiment:迭代训练后在独立 RewardBench 等评价中比较,并检查数据来源、模型选择与位置偏差。→ Answer:作者报告 Judge Accuracy 改善;它测量评价能力,不等于已经验证由该 Judge 训练出的所有后继 Solver 更强。

Paper Claim

摘要报告,Llama3-70B-Instruct 在 RewardBench 上由 75.4 提升至 88.3,多数投票可到 88.7。该结果针对评判能力,不能直接换算为被训练助手的任务收益;部署为 reward 来源后的效果仍需单独评价。

08

Takeaways

这篇论文改变了哪些判断?

Inference

这篇论文把 Evaluator 本身当成训练目标。合成对照提供了可扩展信号,但需要分别报告 Judge Accuracy、偏差与下游训练效果。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是“答了另一个问题”的合成错误,足以教会 Judge 识别真实答案中的细微缺陷。Model 可能学会主题匹配,却仍无法核验逻辑、事实和长链计算。

Inference

无需人工偏好标签不等于无需人工来源的 instruction,也不等于每个合成优劣关系都可靠。扰动可能改变任务而非单纯降低质量,筛选还会继承初始 judge 偏差;固定 benchmark 提升不保证对新 model 或新错误类型同样有效。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:构造数百个 Instruction 改写对。Day 3–5:用小 Judge 做一轮筛选训练。Day 6–7:评估主题不匹配、细微事实错和风格差异三类独立答案对,交换顺序报告 Position Bias。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

两个答案都紧扣原问题,但一个在关键数字上错误,另一个表达不够流畅却正确。如果训练收益只出现在主题错配组,便可定位合成对照分布的缺口。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究 Judge 盲区的可生成性:从外部可验证的失败类型出发,自动构造最小对照,并测它们是否改变下游训练方向。相对 Self-Rewarding 的同源评分循环,这要求反馈生成获得独立的语义证据。目标是建立 Judge 训练数据覆盖与后继 Solver 质量之间的可预测关系。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] Self-Taught Evaluators · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] Self-Rewarding Language Models ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] STaR: Bootstrapping Reasoning With Reasoning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2408.02666 · v2 / REVIEWED 2026.09.13
返回全部论文