RSI Paper
All PapersRESEARCH NOTE / 2505.03335

Absolute Zero: Reinforced Self-play Reasoning with Zero Data

Absolute Zero:从自我出题到自我学习

Andrew Zhao 等

Submitted Verified Version · v3Note Updated
THE QUESTION WORTH READING

同一个 model 提出并解决代码 reasoning 任务,以 executor 提供可验证 feedback,让训练 curriculum 与 reasoning 能力共同演化。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
Model Evolution
Loop Role
Solver · Experience Generator
Persistence
Across Improvement Rounds
Recursive Reuse
Demonstrated
Evidence
Task Gain · Held-out Transfer · Recursive Reuse
System Boundary
Model & Curriculum;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
代码 executor 验证任务有效性与答案;出题 reward 反映可学习性,解题 reward 反映可验证正确性。
Evidence Scope
零外部数据指这一训练过程不使用外部题库;系统仍依赖 pretrained model、执行环境和人为设计的 reward 机制。 已核验固定版本的相关方法与主要结果;未独立复现。

Proposer 与 Solver 在 self-play 中共同更新,下一轮任务生成受到新策略影响;Recursive Reuse 不等同 Controlled Successor Gain。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

reasoning 训练能否减少对人工编写训练题目的依赖?

Inference

RLVR 可以用最终答案的正确性训练 Reasoning,但训练题目通常仍由人收集。随着 Solver 变强,固定题库会重复提供过于简单的题,难题又可能完全没有成功信号。AZR 研究能否连训练任务也由当前 Model 产生,并利用可执行环境维持反馈可靠性。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

STaR 生成 Reasoning Trace,但仍给定问题和正确答案。Self-Instruct 生成 Instruction 数据,却主要依靠生成与过滤得到训练集。AZR 将任务生成纳入在线 RL,同时用 Code Executor 构造并核验答案;区别在于学习分布与 Solver 一起变化,验证仍由固定执行环境提供。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

从任务难度看,已会的题提供很少新信号,完全不会的题也难以通过 Outcome Reward 学习。若程序执行可以免费提供明确结果,就能把程序、输入、输出中不同部分遮住,构造多种 Reasoning 任务。再根据当前 Solver 的成功率奖励题目生成者,就得到一个随能力变化的 Curriculum。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

AZR 把训练分布也交给 model 学习:出题角色寻找具有学习价值的任务,解题角色学习完成任务,两者共享 model。代码 executor 将这一循环固定在可验证的环境中,使 curriculum 变化能够与 model 更新相互作用,降低人工题库的供给压力。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

同一 model 联合学习出题与解题,以程序、输入、输出构造归纳、溯因和演绎任务;代码 executor 验证任务与答案,出题侧获得学习价值 feedback,解题侧获得正确性 reward。

Inference

以论文的 Deduction 任务类型作教学演示:Proposer 生成程序 f(x)=x*x+1 和输入 3,Executor 得到输出 10。给 Solver 程序与输入,让它推断 10,再由 Executor 核验。Abduction 改为给程序和输出寻找输入;Induction 根据示例寻找程序。只有有效任务进入训练,Proposer 与 Solver 共享的 Model 被更新,下轮继续出题。此处简单函数用于解释,非原文测试样本。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

设一题采样 G 次,p 是其中成功比例。Solver 的正确答案得 1。Proposer 的原文 Reward 在 p=0 时为 0,否则为 1−p:全部失败的题不会被奖励,偶尔能解的较难题得到更高奖励。注意它不是在 p=0.5 处达到最大值的对称函数;有限采样中一次偶然成功就可能显著改变奖励。Policy Gradient 再提高高于基线奖励的生成序列概率。

p = (1/G) Σᵢ 𝟙[answerᵢ is correct]
r_propose = 0, if p = 0; otherwise 1 − p
r_solve = 𝟙[answer is correct]
Inference

用四次 Solver 尝试算一遍。若只有一次答对,p=1/4,Proposer 得到 0.75;若四次全对,p=1,Proposer 得到 0;若全部失败,论文单独将奖励设为 0。这个分段设计偏好仍有成功可能的难题。每次 Solver 自己的奖励则由该次答案是否通过 Verifier 决定。Proposer 的难度信号来自当前 Solver 的有限采样,所以四次失败可能表示题目不可解,也可能只是 Solver 暂时较弱;这正是需要独立检查的歧义。

07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:仅从自生成的可执行任务学习,能否迁移到外部 Reasoning?→ Experiment:在 Code Reasoning 相关测试及未作为训练题库的 Coding、Math Benchmark 上比较初始与训练后 Model,并检查不同规模和组件设置。→ Answer:作者报告跨任务收益,同时不同 Benchmark 的变化并不一致;“Zero Data”限定于这一训练阶段没有外部题目数据。

Paper Claim

作者在代码与数学 reasoning 评估中观察到能力提升,并在多个 model 规模和 model 类别上验证方法。

08

Takeaways

这篇论文改变了哪些判断?

Inference

AZR 将 Experience Generator 与 Solver 同时更新,但 Grounding 来自固定的程序语义。理解它应区分预训练知识、任务设计空间和训练期题库。没有外部题目数据,不代表没有先验知识或环境约束。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是当前成功率能代理未来学习价值。一个题目可能因为格式奇怪而难,也可能只需要一个罕见常数;低但非零的成功率未必意味着值得学习的可迁移结构。

Inference

零外部数据指这一训练过程不使用外部题库;系统仍依赖 pretrained model、执行环境和人为设计的 reward 机制。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:限制到短纯函数,禁止网络与文件操作,生成可重复运行的 Code Triplet。Day 3–5:比较按 Learnability Reward 选题与随机选题,在同样数量的训练 Token 下做小型更新。Day 6–7:测未见程序族的推断表现,并记录题目有效率与多样性。资源不足时先验证选题分布是否随 Solver 改变。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

加入一类由随机常数或长查找表决定输出的程序。调节采样使成功率偶尔非零,但其中几乎没有可迁移结构。如果 Curriculum 大量偏向这些题而外部 Reasoning 不提升,就说明 Difficulty 与 Learning Progress 被混淆。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

让 Proposer 的奖励来自“该任务训练后使哪些未见能力发生变化”,建立跨任务能力的干预图。STaR 筛选正确轨迹,AZR 主要利用即时可解性;此提案把选题转成可迁移能力的因果发现问题。先在小型程序世界验证,若奖励只记住特定测试题,则需要重新定义能力节点和独立测量集,不能宣称已获得开放式 Curriculum。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] Absolute Zero: Reinforced Self-play Reasoning with Zero Data · v3 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] STaR: Bootstrapping Reasoning With Reasoning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Self-Instruct: Aligning Language Models with Self-Generated Instructions ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2505.03335 · v3 / REVIEWED 2026.09.13
返回全部论文