STaR: Bootstrapping Reasoning With Reasoning
STaR:从自己的 reasoning 中学习 reasoning
从少量 reasoning 示例出发,生成并筛选能得到正确答案的 reasoning 过程,再将这些过程用于迭代 fine-tuning。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Main Method
- Update Target
- Model Evolution
- Loop Role
- Solver · Experience Generator
- Persistence
- Across Improvement Rounds
- Recursive Reuse
- Demonstrated
- Evidence
- Task Gain · Recursive Reuse
- System Boundary
- Model Weights;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 数据集正确答案用于筛选 reasoning;失败时也作为重新生成 reasoning 的条件,另有少量人工 reasoning 示例启动。
- Evidence Scope
- 仍需要题目、正确答案及少量 reasoning 示例,不能理解为完全摆脱外部监督。 已核验固定版本的相关方法与主要结果;未独立复现。
新 Generator 产生下一轮 rationales;每轮 fine-tuning 从原始 pretrained Model 开始。反馈回流可核验,但不能据此确认一般 Improver 能力提高。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Prior Work & Research Gap
前人做到哪一步,缺口在哪里?
论文梳理了 Chain-of-Thought、Scratchpad 与基于 Rationale 的训练:前者利用少量示例引导推理,后者需要大量中间过程监督。其共同背景是中间计算可能有用,但构造这些计算的训练数据成本高。STaR 明确保留了问题和正确答案监督,减少的是人工 Rationale 的需求。
Idea Reconstruction
从已有知识与失败模式出发,如何走到这个想法?
先观察正确答案具有一个廉价判据,完整思考过程却没有。可以先把成功解题时生成的过程当作候选训练数据。困难在于 Model 最不会的题一直没有成功样本;此时把正确答案作为提示,再让它补出解释,就可能打开新的训练入口。最后必须去掉答案提示测试,检验它学到的是推理还是事后合理化。
Core Intuition
用一个清楚的视角抓住方法本质。
STaR 利用答案监督筛选 model 自己生成的 reasoning,将原本缺少中间步骤的数据转化为训练材料。失败题可以借助正确答案再生成解释,使训练覆盖更多问题;关键机制是生成、验证与 fine-tuning 的循环,而不是把所有自生成文本都当作正确知识。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
原文 Rationalization 示例问结账前葡萄放在哪里,选项包括 grocery cart。第一次若答错,训练数据生成阶段会提示正确选项,再要求生成相应 Rationale;得到“结账前商品放在购物车中”的解释后,将其用于 Fine-Tuning。下一轮生成时不再给正确答案。每轮新数据收集后,原实现从同一个初始 Pretrained Model 重新训练,以减少反复拟合同一轨迹的风险。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
把 Rationale r 看成隐藏的中间变量,最终答对的概率是所有路径概率之和。Reward 只在最终答案正确时取 1。Policy Gradient 的 Log-derivative Trick 把“提高期望正确率”写成“提高成功路径的 Log Probability”。STaR 用筛选成功样本再监督训练近似这个过程;Greedy Sampling 和在同批数据上多次训练会引入近似,不能直接视为精确 RL 更新。
p(y|x) = Σ_r p(r|x) p(y|x,r) J(θ) = E_(r,y~pθ)[𝟙(y=y*)] ∇J = E[𝟙(y=y*) · ∇log pθ(r,y|x)]
这里 r 是 Rationale,y 是最终答案,x 是问题。第一式按所有可能的 r 求和,意思是一个答案可以沿多条推理路径得到。第二式对采样路径取平均,只奖励最终答案正确的路径。推导的关键是 ∇p=p∇log p:把概率的导数改写成概率乘以 Log-Probability 的导数,就能用采样近似梯度。最后的二值奖励会删去错误路径,只留下成功路径的增大概率方向。这解释了筛选成功轨迹再训练的直觉;论文的 Rationale Rationalization 与数据构造还加入额外步骤,不能把这三行当作完整算法的等价证明。
Experiments & Claims
Research Question → Experiment → Answer
Question:自生成 Rationale 是否优于只学答案,Rationalization 是否帮助难题?→ Experiment:比较直接答案 Fine-Tuning、Rationale Bootstrapping 及加入 Rationalization 的迭代设置,在算术与常识等任务上评估。→ Answer:作者报告推理训练收益,且答案提示可帮助产生原本无法生成的训练路径。
Takeaways
这篇论文改变了哪些判断?
STaR 的循环同时改变 Solver 与下一轮 Rationale Generator。最终答案可验证使数据过滤容易,但它只验证终点,不能证明每一步推理都正确。该区别对后来 Self-Training 与 RLVR 的研究仍很关键。
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:生成有完整计算真值的短算术题,划分未见结构。Day 3–5:用小 Model 比较 Answer-only、成功 Rationale 筛选和 Rationalization,一轮 LoRA 即可。Day 6–7:同时核验最终答案和每一步算式,测是否真正学会新结构。
Counterexample Design
如何构造有辨识力的反例?
构造答案容易猜、过程需要多步计算的选择题,并加入两个错误相互抵消的 Rationale。若筛选器全部接受,训练后正确率短期上升但换数值就失败,便能定位到 Outcome Filter 的信息不足。
Follow-up Research
从缺陷与需求推导新的研究问题。
研究哪些最小中间检查能够使自生成 Reasoning 可识别:把少量执行器检查放在因果上决定结果的步骤,测何时足以阻止虚假 Rationalization。目标是监督位置的必要性与充分性,而非给每一步都加标签。若只在固定题型有效,则需要解释结构差异,不能外推为通用可信推理。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] STaR: Bootstrapping Reasoning With Reasoning · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
