RSI Paper
All PapersRESEARCH NOTE / 2305.11738
Method

CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing

CRITIC:用工具 feedback 验证并修正回答

Zhibin Gou 等

Submitted Verified Version · v4Note Updated
THE QUESTION WORTH READING

先生成候选,再调用检索、executor 或评价工具核验,以 external feedback 形成批评并迭代修订输出。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
No persistent system target in this setting
Loop Role
Solver
Persistence
Ephemeral
Recursive Reuse
Not Demonstrated
Evidence
Task Gain
System Boundary
Current Response & Generated Code;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
任务相关检索、代码执行或评价接口输出,以及 model 据此形成的批评。
Evidence Scope
工具能够提供证据,但检索内容或自动评价也会有误差;实现中的工具选择由研究者按任务配置。无参数更新且没有跨任务经验保存,因此不能从迭代次数增加推断长期学习,更不能推断无界 self-improvement。 已核验固定版本的相关方法与主要结果;未独立复现。

工具用于核验并修订当前答案。固定 Model、工具和 Critique Procedure 没有持久更新;Ephemeral 说明产物生命周期,而非反馈来源。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

model 可能写出错误事实、无法运行的程序或不合适的文本,仅要求它重新想一遍并不保证发现问题。论文研究黑盒 model 如何利用外部工具验证自己的初稿,让批评具有可检查的信息依据。

Inference

Model 自己检查事实或计算,容易与初稿共享同一个错误。CRITIC 研究让 Critique 访问搜索、代码执行等工具,用额外证据推动当前答案修订。价值在于把纠错过程连接到可观察结果。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

Self-Refine 使用同源语言反馈,ReAct 已让推理调用工具。CRITIC 将外部工具集中用于 Verify→Correct 循环:先检查已有答案,再用得到的批评改写。这依然主要是 Test-time Refinement,基本方法没有持久更新权重或工具实现。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

如果错误来自缺少事实,反复措辞调整不会增加信息。先让 Model 指出可检查的断言,再调用适合的工具,就能为修订增加独立线索。搜索适合事实、执行器适合计算;反馈形式不同,但都可以转成下一轮修改条件。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

feedback 的价值来自验证带来的新增信息,而不只是多生成一段批评文字。编辑理解是,CRITIC 把 self-correction 拆成检查与修改两个环节:model 既要选择有用的检查,也要正确理解结果,才能改善初稿。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

model 先基于原输入生成答案,再调用合适工具检查相关属性,将工具回执与批评接到初稿后重新生成。验证与修正循环重复,直到批评认为无需再改或达到轮数限制,全程采用 context 示例而非任务 fine-tuning。

Inference

沿用原文算术与程序辅助检查场景作教学演示:初稿把若干金额相加算错,Critic 生成一个计算表达式,执行器返回真实结果,Model 对照结果指出错误并修改答案;之后再检查直到停止条件满足。输出是修订后的答案与工具轨迹,具体金额为教学构造。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

把整个循环拆成 y_t→tool evidence→critique_t→y_(t+1)。工具可以提供新的信息,但 Model 仍需正确选择查询并解释结果,因此整体正确率受这几步共同限制。没有一个自动保证净收益的乘法公式;应分别测错误被修正和正确答案被破坏的频率。

e_t = Tool(query(x,y_t))
c_t = Critique(x,y_t,e_t)
y_(t+1) = Correct(x,y_t,c_t)
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:外部工具对自纠错是否关键?→ Experiment:在问答、数学与相关生成任务比较有无工具的 Critique,以及其它推理、采样基线。→ Answer:作者报告工具反馈带来收益;其检索实验还缓存结果以处理在线内容变化,说明环境可重复性属于评价的一部分。

Paper Claim

作者在自由形式问答、数学程序合成和文本毒性降低三类任务中报告改善,并强调 external feedback 的重要性。这些结果支持工具辅助的当前 Output Refinement,没有证明改正一次答案后,model 会永久掌握相应能力。

08

Takeaways

这篇论文改变了哪些判断?

Inference

CRITIC 的机制价值是引入与初稿不同的信息源。外部来源依然可能错误,因此应保留检索内容和执行结果,不能只展示一段看起来可靠的 Critique。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是工具反馈与目标事实相关且可信。搜到相似但不同对象、生成错误程序或误读单位,都可能让工具为错误答案提供伪支持。

Inference

工具能够提供证据,但检索内容或自动评价也会有误差;实现中的工具选择由研究者按任务配置。无参数更新且没有跨任务经验保存,因此不能从迭代次数增加推断长期学习,更不能推断无界 self-improvement。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:准备 30 个可核验事实与计算问题,缓存工具结果。Day 3–5:比较同源 Critique、真实工具和打乱工具结果。Day 6–7:检查净纠错率、引用匹配和每题额外成本。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

给出名称相同的两个实体,令搜索优先返回错误实体。若 Critic 只因结果来自工具就提高自信并改错答案,便能暴露 Evidence Matching 的失败。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究工具反馈的独立性预算:系统估计多个来源是否共享同一上游错误,并选择真正增加区分信息的下一次核验。相对 ReAct 的动态行动,这研究纠错中的证据依赖结构。关键实验是重复来源很多时,仍能避免把数量当作可信度。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing · v4 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] Self-Refine: Iterative Refinement with Self-Feedback ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] ReAct: Synergizing Reasoning and Acting in Language Models ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2305.11738 · v4 / REVIEWED 2026.09.13
返回全部论文