Large Language Models Cannot Self-Correct Reasoning Yet
Intrinsic Self-Correction 的边界:Reflection 为何可能把对答案改错
通过去掉答案标签等外部帮助,检验 model 能否自行辨认 reasoning 错误,并强调停止规则、初始 prompt 和等预算 baseline 会改变结论。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Main Method
- Update Target
- No persistent system target in this setting
- Loop Role
- Solver
- Persistence
- Ephemeral
- Recursive Reuse
- Not Demonstrated
- Evidence
- Negative Result
- System Boundary
- Output Refinement & Feedback Reliability;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 比较内生文字 feedback 与答案标签等 external feedback
- Evidence Scope
- 该结论有明确的时间、model 与任务范围,不能作为新一代 model 的免检结论。作者承认可验证 external feedback,以及风格或偏好调整等任务中 self-correction 的作用;本条核读方法、结果和局限,未复现实验。 已核验固定版本的相关方法与主要结果;未独立复现。
编者归类:这是阅读 Self-Refine、Reflexion 和 self-rewarding 工作的关键对照,提醒读者追问 feedback 来自哪里、谁决定停止。它为 RSI 中的评价可靠性提供经验边界,并不构成通用 RSI 不可能的证明。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Core Intuition
用一个清楚的视角抓住方法本质。
判断何时应保留正确答案,本身就是 self-correction 的关键能力。若研究者用真实标签阻止 model 把正确答案改错,便给循环注入了强外部信息;这种成绩不能直接归因于 model 独立 reflection。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
对比有 oracle 标签和纯 intrinsic feedback 的生成—批评—再回答流程,在数学、常识和 multi-hop 问答任务上测试多个 model 与 prompt。进一步用相近调用预算的 self-consistency 方法,以及更完整的初始 prompt 作对照。
沿用原文 GSM8K 与 CommonSenseQA 设置:先生成初答,在不告知对错的条件下要求检查并修订,最后统一用标签评分。另设 Oracle Feedback 和等量多样本等对照。输出是各类答案转移和总准确率,而非新的训练算法。原文发现部分 Model 会把原本正确的选择改错。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
设初始正确率为 a,正确答案被改错的条件概率为 p,错误答案被修正的概率为 q。一次修订后的正确率为 a(1−p)+(1−a)q。净增益是 (1−a)q−ap。因此基础 Model 越强,可供修复的错误越少,保护正确答案越重要。这是基于转移分类的教学推导,不是论文给出的不可能性定理。
a_new = a·(1−p) + (1−a)·q Δa = (1−a)·q − a·p p: Right→Wrong; q: Wrong→Right
假设原始 Accuracy 为 a=0.8,修订会把原来正确答案中的 p=0.1 改错,同时把错误答案中的 q=0.2 改对。保留下来的正确比例是 0.8×0.9=0.72,新救回来的比例是 0.2×0.2=0.04,合计 0.76。虽然有一些错误确实被修好,整体表现仍下降。一般地,只有救回的 (1−a)q 大于损失的 ap,Self-Correction 才产生净收益。这是由两类条件概率直接得到的分解,不是论文对所有任务使用同一 p、q 的假设。
Experiments & Claims
Research Question → Experiment → Answer
Question:Intrinsic Self-correction 是否有独立收益?→ Experiment:移除 Oracle Labels,统一调用预算并改善初始 Prompt,再比较修订结果。→ Answer:在论文所测模型与推理任务中,许多设置没有收益甚至退步;结论不能外推为未来经专门训练的 Model 永远无法纠错。
在所评估的历史 model 和 reasoning 设置中,intrinsic self-correction 通常没有稳定增益,部分实验出现性能下降。论文将问题定位到判断答案正确性的困难,而不是断言所有 feedback、所有任务或未来 model 都无法改进。
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:建立包含明确标签的 50 道推理题。Day 3–5:比较初答、无反馈修订、等预算独立采样和 Oracle 修订。Day 6–7:报告转移矩阵与置信区间,按题型分析错误,不只报告最终平均。
Counterexample Design
如何构造有辨识力的反例?
要反驳广义“不可能”,可训练一个小 Model 专门识别并修复可执行算术错误,严格禁止测试标签进入 Prompt。若它在隐藏题上稳定获得正净增益,就能反驳过度外推,但不会推翻原文对当时模型的实测。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] Large Language Models Cannot Self-Correct Reasoning Yet · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] Self-Refine: Iterative Refinement with Self-Feedback ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] Reflexion: Language Agents with Verbal Reinforcement Learning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [4] CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
