Absolute Zero: Reinforced Self-play Reasoning with Zero Data
Absolute Zero:从自我出题到自我学习
同一个 model 提出并解决代码 reasoning 任务,以 executor 提供可验证 feedback,让训练 curriculum 与 reasoning 能力共同演化。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Main Method
- Update Target
- Model Evolution
- Loop Role
- Solver · Experience Generator
- Persistence
- Across Improvement Rounds
- Recursive Reuse
- Demonstrated
- Evidence
- Task Gain · Held-out Transfer · Recursive Reuse
- System Boundary
- Model & Curriculum;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 代码 executor 验证任务有效性与答案;出题 reward 反映可学习性,解题 reward 反映可验证正确性。
- Evidence Scope
- 零外部数据指这一训练过程不使用外部题库;系统仍依赖 pretrained model、执行环境和人为设计的 reward 机制。 已核验固定版本的相关方法与主要结果;未独立复现。
Proposer 与 Solver 在 self-play 中共同更新,下一轮任务生成受到新策略影响;Recursive Reuse 不等同 Controlled Successor Gain。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Core Intuition
用一个清楚的视角抓住方法本质。
AZR 把训练分布也交给 model 学习:出题角色寻找具有学习价值的任务,解题角色学习完成任务,两者共享 model。代码 executor 将这一循环固定在可验证的环境中,使 curriculum 变化能够与 model 更新相互作用,降低人工题库的供给压力。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
同一 model 联合学习出题与解题,以程序、输入、输出构造归纳、溯因和演绎任务;代码 executor 验证任务与答案,出题侧获得学习价值 feedback,解题侧获得正确性 reward。
以论文的 Deduction 任务类型作教学演示:Proposer 生成程序 f(x)=x*x+1 和输入 3,Executor 得到输出 10。给 Solver 程序与输入,让它推断 10,再由 Executor 核验。Abduction 改为给程序和输出寻找输入;Induction 根据示例寻找程序。只有有效任务进入训练,Proposer 与 Solver 共享的 Model 被更新,下轮继续出题。此处简单函数用于解释,非原文测试样本。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
设一题采样 G 次,p 是其中成功比例。Solver 的正确答案得 1。Proposer 的原文 Reward 在 p=0 时为 0,否则为 1−p:全部失败的题不会被奖励,偶尔能解的较难题得到更高奖励。注意它不是在 p=0.5 处达到最大值的对称函数;有限采样中一次偶然成功就可能显著改变奖励。Policy Gradient 再提高高于基线奖励的生成序列概率。
p = (1/G) Σᵢ 𝟙[answerᵢ is correct] r_propose = 0, if p = 0; otherwise 1 − p r_solve = 𝟙[answer is correct]
用四次 Solver 尝试算一遍。若只有一次答对,p=1/4,Proposer 得到 0.75;若四次全对,p=1,Proposer 得到 0;若全部失败,论文单独将奖励设为 0。这个分段设计偏好仍有成功可能的难题。每次 Solver 自己的奖励则由该次答案是否通过 Verifier 决定。Proposer 的难度信号来自当前 Solver 的有限采样,所以四次失败可能表示题目不可解,也可能只是 Solver 暂时较弱;这正是需要独立检查的歧义。
Experiments & Claims
Research Question → Experiment → Answer
Question:仅从自生成的可执行任务学习,能否迁移到外部 Reasoning?→ Experiment:在 Code Reasoning 相关测试及未作为训练题库的 Coding、Math Benchmark 上比较初始与训练后 Model,并检查不同规模和组件设置。→ Answer:作者报告跨任务收益,同时不同 Benchmark 的变化并不一致;“Zero Data”限定于这一训练阶段没有外部题目数据。
Takeaways
这篇论文改变了哪些判断?
AZR 将 Experience Generator 与 Solver 同时更新,但 Grounding 来自固定的程序语义。理解它应区分预训练知识、任务设计空间和训练期题库。没有外部题目数据,不代表没有先验知识或环境约束。
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:限制到短纯函数,禁止网络与文件操作,生成可重复运行的 Code Triplet。Day 3–5:比较按 Learnability Reward 选题与随机选题,在同样数量的训练 Token 下做小型更新。Day 6–7:测未见程序族的推断表现,并记录题目有效率与多样性。资源不足时先验证选题分布是否随 Solver 改变。
Counterexample Design
如何构造有辨识力的反例?
加入一类由随机常数或长查找表决定输出的程序。调节采样使成功率偶尔非零,但其中几乎没有可迁移结构。如果 Curriculum 大量偏向这些题而外部 Reasoning 不提升,就说明 Difficulty 与 Learning Progress 被混淆。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] Absolute Zero: Reinforced Self-play Reasoning with Zero Data · v3 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] STaR: Bootstrapping Reasoning With Reasoning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] Self-Instruct: Aligning Language Models with Self-Generated Instructions ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
