RSI Paper
All PapersRESEARCH NOTE / 2310.01798
Empirical Analysis

Large Language Models Cannot Self-Correct Reasoning Yet

Intrinsic Self-Correction 的边界:Reflection 为何可能把对答案改错

Jie Huang 等

Submitted Verified Version · v2Note Updated
THE QUESTION WORTH READING

通过去掉答案标签等外部帮助,检验 model 能否自行辨认 reasoning 错误,并强调停止规则、初始 prompt 和等预算 baseline 会改变结论。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
No persistent system target in this setting
Loop Role
Solver
Persistence
Ephemeral
Recursive Reuse
Not Demonstrated
Evidence
Negative Result
System Boundary
Output Refinement & Feedback Reliability;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
比较内生文字 feedback 与答案标签等 external feedback
Evidence Scope
该结论有明确的时间、model 与任务范围,不能作为新一代 model 的免检结论。作者承认可验证 external feedback,以及风格或偏好调整等任务中 self-correction 的作用;本条核读方法、结果和局限,未复现实验。 已核验固定版本的相关方法与主要结果;未独立复现。

编者归类:这是阅读 Self-Refine、Reflexion 和 self-rewarding 工作的关键对照,提醒读者追问 feedback 来自哪里、谁决定停止。它为 RSI 中的评价可靠性提供经验边界,并不构成通用 RSI 不可能的证明。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

model 生成批评文字,并不保证它准确识别了自己的错误。论文研究在没有答案标签、工具验证或其他 external feedback 时,已有 model 能否仅靠自身能力修正 reasoning,并排除评测协议带来的虚假增益。

Inference

自纠错实验常把更多调用、Oracle 提示或外部工具与修订机制混在一起。本文问的是更窄的问题:没有外部正确性反馈的固定 LLM,能否仅凭自身判断改善 Reasoning?它提醒研究者为强结论准备匹配的信息与计算对照。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

Self-Refine 研究当前答案的反馈修订,Reflexion 使用多种反馈与记忆,CRITIC 引入工具。本文区分 Intrinsic Self-correction 与带外部反馈的设置,重新检查 Prompt、Oracle Labels 和采样预算对结果的影响。不同研究的问题范围不完全相同。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

若只挑错误答案进入修订,系统实际上已经获得了“哪些题错了”的信息。若修订比基线多用几倍调用,也不能确定收益来自诊断能力。先消除这些混淆,再统计 Wrong→Right 与 Right→Wrong,便能看见净变化来自哪里。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

判断何时应保留正确答案,本身就是 self-correction 的关键能力。若研究者用真实标签阻止 model 把正确答案改错,便给循环注入了强外部信息;这种成绩不能直接归因于 model 独立 reflection。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

对比有 oracle 标签和纯 intrinsic feedback 的生成—批评—再回答流程,在数学、常识和 multi-hop 问答任务上测试多个 model 与 prompt。进一步用相近调用预算的 self-consistency 方法,以及更完整的初始 prompt 作对照。

Inference

沿用原文 GSM8K 与 CommonSenseQA 设置:先生成初答,在不告知对错的条件下要求检查并修订,最后统一用标签评分。另设 Oracle Feedback 和等量多样本等对照。输出是各类答案转移和总准确率,而非新的训练算法。原文发现部分 Model 会把原本正确的选择改错。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

设初始正确率为 a,正确答案被改错的条件概率为 p,错误答案被修正的概率为 q。一次修订后的正确率为 a(1−p)+(1−a)q。净增益是 (1−a)q−ap。因此基础 Model 越强,可供修复的错误越少,保护正确答案越重要。这是基于转移分类的教学推导,不是论文给出的不可能性定理。

a_new = a·(1−p) + (1−a)·q
Δa = (1−a)·q − a·p
p: Right→Wrong; q: Wrong→Right
Inference

假设原始 Accuracy 为 a=0.8,修订会把原来正确答案中的 p=0.1 改错,同时把错误答案中的 q=0.2 改对。保留下来的正确比例是 0.8×0.9=0.72,新救回来的比例是 0.2×0.2=0.04,合计 0.76。虽然有一些错误确实被修好,整体表现仍下降。一般地,只有救回的 (1−a)q 大于损失的 ap,Self-Correction 才产生净收益。这是由两类条件概率直接得到的分解,不是论文对所有任务使用同一 p、q 的假设。

07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:Intrinsic Self-correction 是否有独立收益?→ Experiment:移除 Oracle Labels,统一调用预算并改善初始 Prompt,再比较修订结果。→ Answer:在论文所测模型与推理任务中,许多设置没有收益甚至退步;结论不能外推为未来经专门训练的 Model 永远无法纠错。

Paper Claim

在所评估的历史 model 和 reasoning 设置中,intrinsic self-correction 通常没有稳定增益,部分实验出现性能下降。论文将问题定位到判断答案正确性的困难,而不是断言所有 feedback、所有任务或未来 model 都无法改进。

08

Takeaways

这篇论文改变了哪些判断?

Inference

这篇论文最有价值的结论是评价协议,而非标题的绝对语气。任何自纠错报告都应公布反馈权限、调用预算和正确答案被破坏的比例。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的外推是假定当时的固定 Model 和 Prompt 已代表全部可训练纠错能力。负结果限制的是所测条件;不同训练、可验证工具或新信息可能改变结论。

Inference

该结论有明确的时间、model 与任务范围,不能作为新一代 model 的免检结论。作者承认可验证 external feedback,以及风格或偏好调整等任务中 self-correction 的作用;本条核读方法、结果和局限,未复现实验。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:建立包含明确标签的 50 道推理题。Day 3–5:比较初答、无反馈修订、等预算独立采样和 Oracle 修订。Day 6–7:报告转移矩阵与置信区间,按题型分析错误,不只报告最终平均。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

要反驳广义“不可能”,可训练一个小 Model 专门识别并修复可执行算术错误,严格禁止测试标签进入 Prompt。若它在隐藏题上稳定获得正净增益,就能反驳过度外推,但不会推翻原文对当时模型的实测。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究纠错可行性的相图:以诊断准确率、反馈噪声、初始正确率和计算预算为轴,识别净增益由负转正的条件。相对 CRITIC 的工具增强与 Self-Refine 的固定循环,这目标是可预测的机制边界,而非单一 Benchmark 的新最好分数。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] Large Language Models Cannot Self-Correct Reasoning Yet · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] Self-Refine: Iterative Refinement with Self-Feedback ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Reflexion: Language Agents with Verbal Reinforcement Learning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  4. [4] CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2310.01798 · v2 / REVIEWED 2026.09.13
返回全部论文