Self-Taught Evaluators
Self-Taught Evaluators:以 synthetic preferences 迭代训练 judge
从未标注偏好的 instruction 构造优劣回答对,让 judge model 生成并筛选判断理由,再用这些理由反复训练评判能力。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Iterative Judge Training
- Update Target
- Model Evolution
- Loop Role
- Evaluator · Experience Generator
- Persistence
- Across Improvement Rounds
- Recursive Reuse
- Demonstrated
- Evidence
- Task Gain · Improver Quality Gain · Recursive Reuse
- System Boundary
- Judge Model Weights;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 回答对的预设合成优劣关系校验 model 判断;与预设关系一致的理由和标签成为下一轮监督训练数据。
- Evidence Scope
- 无需人工偏好标签不等于无需人工来源的 instruction,也不等于每个合成优劣关系都可靠。扰动可能改变任务而非单纯降低质量,筛选还会继承初始 judge 偏差;固定 benchmark 提升不保证对新 model 或新错误类型同样有效。 已核验固定版本的相关方法与主要结果;未独立复现。
当前 Judge 为下一轮产生 Judgment Trajectories,筛选后从 Seed Model 训练新版;新版再次承担标注,构成局部 Recursive Reuse。构造回答对的 Model 与外层过滤规则固定;Judge Accuracy 增益尚非 Controlled Successor Gain。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Research Problem & Background
问题为什么重要,解决它有什么价值?
judge model 既用于训练 reward,也用于 model 比较,但人工偏好数据昂贵且会随着被评 model 变化而过时。论文研究能否只用合成训练信号提升 judge,让它不断产生更有用的判断理由,而无需追加人工偏好标签。
Model 越强,旧 Preference Data 越容易过时,人工评判成本也越高。Self-Taught Evaluators 研究如何构造带已知对照关系的合成回答对,训练 Judge 的推理与排序能力,并迭代更新判断数据。
Core Intuition
用一个清楚的视角抓住方法本质。
先构造预期存在优劣关系的回答对,就能把难以收集的真实偏好问题转成对已知合成关系的判断问题。judge 生成的理由经过关系检查后成为下一轮训练数据,使评价能力本身进入 self-training 循环。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
选择未带偏好标注的 instruction,生成正常回答及针对扰动 instruction 的回答作为对照。当前 judge model 多次生成判断和理由,保留选中预期优胜答案的轨迹,再 supervised fine-tuning model;重复上述过程以更新下一轮 judge。
沿用论文 Response Pair Construction 作教学演示:原请求要求解释太阳能,修改请求改为解释风能。分别生成高质量回答,将风能回答作为原请求下的不匹配项;Judge 输出理由与胜者,标签一致的轨迹被保留。每轮用当前 Judge 重新标注,再从 Seed Model Fine-Tune;构造回答对的模型与 Judge 更新角色应分别记录。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
训练只对 Judgment 部分计算 Negative Log-Likelihood。先采样多个 Judgment j,只有 Verdict 与合成标签一致的轨迹进入数据。该筛选验证最终排序,没有逐句核验解释。Model Selection 还考虑位置偏差,因此交换 A/B 顺序是重要检查。公式展示数据筛选与训练的关系,不能保证合成标签在所有边界案例中都正确。
J_valid = {j : verdict(j) = synthetic label}
L = −log pθ(j | instruction, answer A, answer B)Experiments & Claims
Research Question → Experiment → Answer
Question:合成数据能否训练出更可靠 Judge?→ Experiment:迭代训练后在独立 RewardBench 等评价中比较,并检查数据来源、模型选择与位置偏差。→ Answer:作者报告 Judge Accuracy 改善;它测量评价能力,不等于已经验证由该 Judge 训练出的所有后继 Solver 更强。
摘要报告,Llama3-70B-Instruct 在 RewardBench 上由 75.4 提升至 88.3,多数投票可到 88.7。该结果针对评判能力,不能直接换算为被训练助手的任务收益;部署为 reward 来源后的效果仍需单独评价。
Takeaways
这篇论文改变了哪些判断?
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:构造数百个 Instruction 改写对。Day 3–5:用小 Judge 做一轮筛选训练。Day 6–7:评估主题不匹配、细微事实错和风格差异三类独立答案对,交换顺序报告 Position Bias。
Counterexample Design
如何构造有辨识力的反例?
两个答案都紧扣原问题,但一个在关键数字上错误,另一个表达不够流畅却正确。如果训练收益只出现在主题错配组,便可定位合成对照分布的缺口。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] Self-Taught Evaluators · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] Self-Rewarding Language Models ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] STaR: Bootstrapping Reasoning With Reasoning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
