RSI Paper
All PapersRESEARCH NOTE / 2407.18219

Recursive Introspection: Teaching Language Model Agents How to Self-Improve

RISE:把多轮错误修订训练进 model

Yuxiao Qu、Tianjun Zhang、Naman Garg、Aviral Kumar

Submitted Verified Version · v2Note Updated
THE QUESTION WORTH READING

把单次解题改写为多轮决策问题,训练 model 从自身失败历史中修正回答;训练更新与 inference-time 修订需要分开理解。

Classification & RSI Relation 3 Variants · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Iterative Training

Update Target
Model Evolution
Loop Role
Solver · Experience Generator
Persistence
Across Improvement Rounds
Recursive Reuse
Demonstrated
Evidence
Task Gain · Recursive Reuse
System Boundary
Model Weights & Multi-Turn Refinement Policy;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
训练时使用答案正确性 reward 和轨迹中的失败历史;改进示范可来自自采样选优或更强 model,部署可选择是否调用 checker。
Evidence Scope
训练依赖题目与正确性信号,改进回答还可能来自更强 model,因此不能笼统称为完全无 external feedback。标题中的 Recursive 指多轮内省;inference-time 通常修订 context 里的回答,并未在每轮自主修改 model 训练算法。 已核验固定版本的相关方法与主要结果;未独立复现。

训练阶段用当前 Policy 的 Rollout 构造后续训练数据,更新版本重新参与经验生成。部署阶段的单题修订另列 Variant,避免将训练的 Persistence 与测试时 Oracle 权限混合。

检查原文设置 ↗

Deployment · With Oracle

Update Target
No persistent system target in this setting
Loop Role
Solver
Persistence
Ephemeral
Recursive Reuse
Not Demonstrated
Evidence
Task Gain
System Boundary
One deployment problem; fixed trained Model
Feedback
每轮可查询答案正确性并在答对后停止。
Evidence Scope
训练依赖题目与正确性信号,改进回答还可能来自更强 model,因此不能笼统称为完全无 external feedback。标题中的 Recursive 指多轮内省;inference-time 通常修订 context 里的回答,并未在每轮自主修改 model 训练算法。 已核验固定版本的相关方法与主要结果;未独立复现。

此 Variant 描述部署时单题修订;它不提交跨任务状态更新。训练得到的 Policy 已固定,不能将训练闭环的持久性沿用到这里。

检查原文设置 ↗

Deployment · Without Oracle

Update Target
No persistent system target in this setting
Loop Role
Solver
Persistence
Ephemeral
Recursive Reuse
Not Demonstrated
Evidence
Task Gain
System Boundary
One deployment problem; fixed trained Model
Feedback
不查询答案 Checker;强制重试并对跨轮答案做 Majority Vote。
Evidence Scope
训练依赖题目与正确性信号,改进回答还可能来自更强 model,因此不能笼统称为完全无 external feedback。标题中的 Recursive 指多轮内省;inference-time 通常修订 context 里的回答,并未在每轮自主修改 model 训练算法。 已核验固定版本的相关方法与主要结果;未独立复现。

此 Variant 描述部署时单题修订;它不提交跨任务状态更新。训练得到的 Policy 已固定,不能将训练闭环的持久性沿用到这里。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

直接要求现成 model reflection,往往不能让回答随尝试次数稳定改善。论文研究怎样训练一种能利用既往失败的 policy,使增加 inference rounds 成为有效计算,并避免 model 只会重述原答案或在修订时破坏原本正确的解法。

Inference

要求一个没有相关训练的 Model 反复检查,可能只得到更多错误。RISE 研究能否专门训练“看到先前失败后如何改变回答”,让额外测试时计算转成稳定收益。问题从提示技巧转向多轮条件分布的学习。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

Self-Refine 展示反馈修订,不能自纠错的研究提醒该能力并非默认存在,STaR 则训练成功 Reasoning。RISE 将单轮任务展开成多轮 MDP,用当前 Model 的失败历史和较好后续答案训练纠错 Policy,并区分有无 Oracle Feedback 的部署模式。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

普通 SFT 只展示理想答案,很少展示模型自己的失败状态。部署时却恰好需要在这些状态上行动,因此存在训练分布缺口。先滚动当前 Model 收集真实失败,再提供更好的下一步,便能训练从错误历史到修订的映射。是否优于等预算独立采样,应作为核心对照。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

修订能力需要在 model 实际会犯错的状态上训练,而不只是学习孤立的正确答案。把问题、过去尝试和 feedback 共同视为状态,能够把如何从失败转向成功变成训练对象,进而缩小训练与部署时历史分布的差异。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

将单轮题目构成多轮 MDP,用当前 model 收集失败和成功轨迹,再通过自身多次采样选优或更强 model 补充改进回答。采用 reward 加权的监督训练更新 policy,并迭代收集新轨迹,让 model 学习在既有尝试之后作出修订。

Inference

沿用数学问答场景:状态包含原题、先前答案和可选反馈,Model 生成下一次回答。训练轨迹可先由当前 Model 展开,再由多样本筛选或更强 Model 提供改进答案。部署时 With Oracle 可在答对后停止;Without Oracle 强制多轮重试,再用跨轮 Majority Vote。输出与测试权限必须按这两种模式分别报告。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

将一次回答视为 Action,将问题和回答历史视为 State,原来的单步映射变成多步 Policy。Reward-Weighted Regression 提高高质量后续行动的概率,权重取决于训练奖励。下面给出该类损失的教学形式。它不会凭空注入缺失知识;帮助来自失败状态覆盖、较好目标答案及更多条件计算。

s_t = (question, previous responses, optional feedback)
L ≈ −Σ_(s,a) w(reward)·log πθ(a|s)
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:专门训练后,多轮修订能否胜过普通重试?→ Experiment:比较训练前后、不同数据来源、Oracle 与非 Oracle 推理,并与并行采样比较。→ Answer:作者报告顺序改进能力和部分分布外收益;带 Oracle 的成绩不能当作无反馈部署的结果。

Paper Claim

作者报告 Llama2、Llama3 与 Mistral 系列在数学 reasoning 中随轮次改善,并在相同 inference compute 条件下超过若干单轮 policy。分析显示改进来自有意义的回答修正;结论适用于论文的数据、feedback 协议与计算预算。

08

Takeaways

这篇论文改变了哪些判断?

Inference

RISE 的关键是把错误后的状态纳入训练。标题中的 Recursive Introspection 主要指多轮自我修订;跨训练轮的 Model 复用与部署中的单题循环,需在分类中分别说明。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是训练中见过的失败类型足以覆盖部署错误。面对新的知识缺口或错误反馈,学会的修订模式可能只改变措辞,甚至把正确答案改掉。

Inference

训练依赖题目与正确性信号,改进回答还可能来自更强 model,因此不能笼统称为完全无 external feedback。标题中的 Recursive 指多轮内省;inference-time 通常修订 context 里的回答,并未在每轮自主修改 model 训练算法。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:构建小型数学题的失败与修订轨迹。Day 3–5:训练一轮 LoRA,与同量正确答案 SFT 比较。Day 6–7:在无 Oracle 的隐藏题上比较多轮投票与同预算并行采样,报告每轮净纠错率。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

训练反馈总是准确指出答案错误,测试时给正确答案附上错误反馈。如果模型机械重试并退步,就能检验它是否学到了独立诊断,还是只学到服从纠错信号。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究能够拒绝错误反馈的纠错 Policy:把反馈可靠性作为隐藏变量,通过少量主动检查决定何时修订、保留或寻求信息。相对 Self-Refine 的固定循环,这是部分可观测条件下的纠错控制问题。核心结果应是随反馈噪声变化的最优策略边界。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] Recursive Introspection: Teaching Language Model Agents How to Self-Improve · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] Self-Refine: Iterative Refinement with Self-Feedback ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Large Language Models Cannot Self-Correct Reasoning Yet ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  4. [4] STaR: Bootstrapping Reasoning With Reasoning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2407.18219 · v2 / REVIEWED 2026.09.13
返回全部论文