RSI Paper
All PapersRESEARCH NOTE / 2203.14465

STaR: Bootstrapping Reasoning With Reasoning

STaR:从自己的 reasoning 中学习 reasoning

Eric Zelikman 等

Submitted Verified Version · v2Note Updated
THE QUESTION WORTH READING

从少量 reasoning 示例出发,生成并筛选能得到正确答案的 reasoning 过程,再将这些过程用于迭代 fine-tuning。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
Model Evolution
Loop Role
Solver · Experience Generator
Persistence
Across Improvement Rounds
Recursive Reuse
Demonstrated
Evidence
Task Gain · Recursive Reuse
System Boundary
Model Weights;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
数据集正确答案用于筛选 reasoning;失败时也作为重新生成 reasoning 的条件,另有少量人工 reasoning 示例启动。
Evidence Scope
仍需要题目、正确答案及少量 reasoning 示例,不能理解为完全摆脱外部监督。 已核验固定版本的相关方法与主要结果;未独立复现。

新 Generator 产生下一轮 rationales;每轮 fine-tuning 从原始 pretrained Model 开始。反馈回流可核验,但不能据此确认一般 Improver 能力提高。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

如何在缺少大规模人工 reasoning 标注时,训练 model 生成有效的 reasoning 过程?

Inference

Reasoning Trace 可以让 Model 在输出答案前完成中间计算,但高质量人工 Trace 昂贵。只用少量 Few-shot 示例又无法充分改变 Model 的能力。STaR 研究如何从已有问题及答案出发,让 Model 生成可用于训练的中间过程,并逐轮扩大能够处理的问题范围。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

论文梳理了 Chain-of-Thought、Scratchpad 与基于 Rationale 的训练:前者利用少量示例引导推理,后者需要大量中间过程监督。其共同背景是中间计算可能有用,但构造这些计算的训练数据成本高。STaR 明确保留了问题和正确答案监督,减少的是人工 Rationale 的需求。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

先观察正确答案具有一个廉价判据,完整思考过程却没有。可以先把成功解题时生成的过程当作候选训练数据。困难在于 Model 最不会的题一直没有成功样本;此时把正确答案作为提示,再让它补出解释,就可能打开新的训练入口。最后必须去掉答案提示测试,检验它学到的是推理还是事后合理化。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

STaR 利用答案监督筛选 model 自己生成的 reasoning,将原本缺少中间步骤的数据转化为训练材料。失败题可以借助正确答案再生成解释,使训练覆盖更多问题;关键机制是生成、验证与 fine-tuning 的循环,而不是把所有自生成文本都当作正确知识。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

生成 reasoning、筛选正确结果;失败时提供正确答案尝试反推,再用合格 reasoning fine-tuning 并重复。

Inference

原文 Rationalization 示例问结账前葡萄放在哪里,选项包括 grocery cart。第一次若答错,训练数据生成阶段会提示正确选项,再要求生成相应 Rationale;得到“结账前商品放在购物车中”的解释后,将其用于 Fine-Tuning。下一轮生成时不再给正确答案。每轮新数据收集后,原实现从同一个初始 Pretrained Model 重新训练,以减少反复拟合同一轨迹的风险。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

把 Rationale r 看成隐藏的中间变量,最终答对的概率是所有路径概率之和。Reward 只在最终答案正确时取 1。Policy Gradient 的 Log-derivative Trick 把“提高期望正确率”写成“提高成功路径的 Log Probability”。STaR 用筛选成功样本再监督训练近似这个过程;Greedy Sampling 和在同批数据上多次训练会引入近似,不能直接视为精确 RL 更新。

p(y|x) = Σ_r p(r|x) p(y|x,r)
J(θ) = E_(r,y~pθ)[𝟙(y=y*)]
∇J = E[𝟙(y=y*) · ∇log pθ(r,y|x)]
Inference

这里 r 是 Rationale,y 是最终答案,x 是问题。第一式按所有可能的 r 求和,意思是一个答案可以沿多条推理路径得到。第二式对采样路径取平均,只奖励最终答案正确的路径。推导的关键是 ∇p=p∇log p:把概率的导数改写成概率乘以 Log-Probability 的导数,就能用采样近似梯度。最后的二值奖励会删去错误路径,只留下成功路径的增大概率方向。这解释了筛选成功轨迹再训练的直觉;论文的 Rationale Rationalization 与数据构造还加入额外步骤,不能把这三行当作完整算法的等价证明。

07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:自生成 Rationale 是否优于只学答案,Rationalization 是否帮助难题?→ Experiment:比较直接答案 Fine-Tuning、Rationale Bootstrapping 及加入 Rationalization 的迭代设置,在算术与常识等任务上评估。→ Answer:作者报告推理训练收益,且答案提示可帮助产生原本无法生成的训练路径。

Paper Claim

论文在多个数据集上观察到,相比直接训练预测答案,迭代学习自生成 reasoning 更有效。

08

Takeaways

这篇论文改变了哪些判断?

Inference

STaR 的循环同时改变 Solver 与下一轮 Rationale Generator。最终答案可验证使数据过滤容易,但它只验证终点,不能证明每一步推理都正确。该区别对后来 Self-Training 与 RLVR 的研究仍很关键。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是通向正确答案的 Rationale 通常更值得学习。答案提示可能诱导听起来合理却不忠实的解释;错误步骤也可能相互抵消,偶然得到正确结论。

Inference

仍需要题目、正确答案及少量 reasoning 示例,不能理解为完全摆脱外部监督。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:生成有完整计算真值的短算术题,划分未见结构。Day 3–5:用小 Model 比较 Answer-only、成功 Rationale 筛选和 Rationalization,一轮 LoRA 即可。Day 6–7:同时核验最终答案和每一步算式,测是否真正学会新结构。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

构造答案容易猜、过程需要多步计算的选择题,并加入两个错误相互抵消的 Rationale。若筛选器全部接受,训练后正确率短期上升但换数值就失败,便能定位到 Outcome Filter 的信息不足。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究哪些最小中间检查能够使自生成 Reasoning 可识别:把少量执行器检查放在因果上决定结果的步骤,测何时足以阻止虚假 Rationalization。目标是监督位置的必要性与充分性,而非给每一步都加标签。若只在固定题型有效,则需要解释结构差异,不能外推为通用可信推理。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] STaR: Bootstrapping Reasoning With Reasoning · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
arXiv:2203.14465 · v2 / REVIEWED 2026.09.13
返回全部论文