Recursive Introspection: Teaching Language Model Agents How to Self-Improve
RISE:把多轮错误修订训练进 model
把单次解题改写为多轮决策问题,训练 model 从自身失败历史中修正回答;训练更新与 inference-time 修订需要分开理解。
Classification & RSI Relation 3 Variants · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Iterative Training
- Update Target
- Model Evolution
- Loop Role
- Solver · Experience Generator
- Persistence
- Across Improvement Rounds
- Recursive Reuse
- Demonstrated
- Evidence
- Task Gain · Recursive Reuse
- System Boundary
- Model Weights & Multi-Turn Refinement Policy;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 训练时使用答案正确性 reward 和轨迹中的失败历史;改进示范可来自自采样选优或更强 model,部署可选择是否调用 checker。
- Evidence Scope
- 训练依赖题目与正确性信号,改进回答还可能来自更强 model,因此不能笼统称为完全无 external feedback。标题中的 Recursive 指多轮内省;inference-time 通常修订 context 里的回答,并未在每轮自主修改 model 训练算法。 已核验固定版本的相关方法与主要结果;未独立复现。
训练阶段用当前 Policy 的 Rollout 构造后续训练数据,更新版本重新参与经验生成。部署阶段的单题修订另列 Variant,避免将训练的 Persistence 与测试时 Oracle 权限混合。
检查原文设置 ↗Deployment · With Oracle
- Update Target
- No persistent system target in this setting
- Loop Role
- Solver
- Persistence
- Ephemeral
- Recursive Reuse
- Not Demonstrated
- Evidence
- Task Gain
- System Boundary
- One deployment problem; fixed trained Model
- Feedback
- 每轮可查询答案正确性并在答对后停止。
- Evidence Scope
- 训练依赖题目与正确性信号,改进回答还可能来自更强 model,因此不能笼统称为完全无 external feedback。标题中的 Recursive 指多轮内省;inference-time 通常修订 context 里的回答,并未在每轮自主修改 model 训练算法。 已核验固定版本的相关方法与主要结果;未独立复现。
此 Variant 描述部署时单题修订;它不提交跨任务状态更新。训练得到的 Policy 已固定,不能将训练闭环的持久性沿用到这里。
检查原文设置 ↗Deployment · Without Oracle
- Update Target
- No persistent system target in this setting
- Loop Role
- Solver
- Persistence
- Ephemeral
- Recursive Reuse
- Not Demonstrated
- Evidence
- Task Gain
- System Boundary
- One deployment problem; fixed trained Model
- Feedback
- 不查询答案 Checker;强制重试并对跨轮答案做 Majority Vote。
- Evidence Scope
- 训练依赖题目与正确性信号,改进回答还可能来自更强 model,因此不能笼统称为完全无 external feedback。标题中的 Recursive 指多轮内省;inference-time 通常修订 context 里的回答,并未在每轮自主修改 model 训练算法。 已核验固定版本的相关方法与主要结果;未独立复现。
此 Variant 描述部署时单题修订;它不提交跨任务状态更新。训练得到的 Policy 已固定,不能将训练闭环的持久性沿用到这里。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Core Intuition
用一个清楚的视角抓住方法本质。
修订能力需要在 model 实际会犯错的状态上训练,而不只是学习孤立的正确答案。把问题、过去尝试和 feedback 共同视为状态,能够把如何从失败转向成功变成训练对象,进而缩小训练与部署时历史分布的差异。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
将单轮题目构成多轮 MDP,用当前 model 收集失败和成功轨迹,再通过自身多次采样选优或更强 model 补充改进回答。采用 reward 加权的监督训练更新 policy,并迭代收集新轨迹,让 model 学习在既有尝试之后作出修订。
沿用数学问答场景:状态包含原题、先前答案和可选反馈,Model 生成下一次回答。训练轨迹可先由当前 Model 展开,再由多样本筛选或更强 Model 提供改进答案。部署时 With Oracle 可在答对后停止;Without Oracle 强制多轮重试,再用跨轮 Majority Vote。输出与测试权限必须按这两种模式分别报告。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
将一次回答视为 Action,将问题和回答历史视为 State,原来的单步映射变成多步 Policy。Reward-Weighted Regression 提高高质量后续行动的概率,权重取决于训练奖励。下面给出该类损失的教学形式。它不会凭空注入缺失知识;帮助来自失败状态覆盖、较好目标答案及更多条件计算。
s_t = (question, previous responses, optional feedback) L ≈ −Σ_(s,a) w(reward)·log πθ(a|s)
Experiments & Claims
Research Question → Experiment → Answer
Question:专门训练后,多轮修订能否胜过普通重试?→ Experiment:比较训练前后、不同数据来源、Oracle 与非 Oracle 推理,并与并行采样比较。→ Answer:作者报告顺序改进能力和部分分布外收益;带 Oracle 的成绩不能当作无反馈部署的结果。
作者报告 Llama2、Llama3 与 Mistral 系列在数学 reasoning 中随轮次改善,并在相同 inference compute 条件下超过若干单轮 policy。分析显示改进来自有意义的回答修正;结论适用于论文的数据、feedback 协议与计算预算。
Takeaways
这篇论文改变了哪些判断?
RISE 的关键是把错误后的状态纳入训练。标题中的 Recursive Introspection 主要指多轮自我修订;跨训练轮的 Model 复用与部署中的单题循环,需在分类中分别说明。
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:构建小型数学题的失败与修订轨迹。Day 3–5:训练一轮 LoRA,与同量正确答案 SFT 比较。Day 6–7:在无 Oracle 的隐藏题上比较多轮投票与同预算并行采样,报告每轮净纠错率。
Counterexample Design
如何构造有辨识力的反例?
训练反馈总是准确指出答案错误,测试时给正确答案附上错误反馈。如果模型机械重试并退步,就能检验它是否学到了独立诊断,还是只学到服从纠错信号。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] Recursive Introspection: Teaching Language Model Agents How to Self-Improve · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] Self-Refine: Iterative Refinement with Self-Feedback ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] Large Language Models Cannot Self-Correct Reasoning Yet ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [4] STaR: Bootstrapping Reasoning With Reasoning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
