RSI Paper
All PapersRESEARCH NOTE / 2210.03629
Method

ReAct: Synergizing Reasoning and Acting in Language Models

ReAct:让 reasoning 与环境行动相互补充

Shunyu Yao 等

Submitted Verified Version · v3Note Updated
THE QUESTION WORTH READING

交替进行 reasoning、行动和环境观察,在执行过程中获取新信息并调整计划,是 feedback 式 Agent 的基础组件。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
No persistent system target in this setting
Loop Role
Solver
Persistence
Ephemeral
Recursive Reuse
Not Demonstrated
Evidence
Task Gain
System Boundary
Reasoning & Acting Workflow;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
任务接口返回的检索内容、环境状态及动作结果。
Evidence Scope
核心 prompt 范式没有持久学习模块,也不要求修改 model parameters、prompt optimization 器或自身代码。论文另有初步 fine-tuning 实验,但不能因此把主方法的每次观察都说成参数学习,或把任务内重规划称为 Recursive Self-Improvement。 已核验固定版本的相关方法与主要结果;未独立复现。

交错 reasoning 与 action 是执行方式;原方法不提交跨任务 Agent 配置更新。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

只在内部生成 reasoning 容易延续错误事实,只预测动作又难以跟踪子目标和异常。论文研究如何把语言 reasoning 与环境交互放进同一过程,使计划能依据新证据更新,行动也能主动补充 reasoning 所缺的信息。

Inference

只生成长段推理容易依赖错误的内部知识,只执行动作又难以维护计划。ReAct 研究能否让 Thought 指导下一次行动,再用真实 Observation 修正后续 Thought。它为后来许多 Self-Evolving Agents 提供执行骨架,但自身主要处理当前任务。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

原文比较 Chain-of-Thought 与只行动的 Agent:前者能组织中间计算,但缺少环境核验;后者能获取外部信息,却可能难以综合观察。ReAct 把语言思考加入动作序列,使任务分解、检索与状态跟踪在同一轨迹中交替出现。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

从多跳问答推起:先知道缺哪条事实,才能选择检索对象;检索回来后又要决定是否已足够回答。固定的一次检索不一定覆盖后续需求。把这种“计划一次、观察一次、调整一次”的过程写成 Few-shot Trajectory,便能用固定 Model 实现动态交互。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

一次行动既能推进目标,也能产生新的认识。ReAct 让 reasoning 指导何时查询与操作,再让观察约束后续 reasoning;编辑理解是,它解决了 feedback 从哪里进入决策的问题,却没有自动解决经验怎样跨任务保留的问题。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

用少量包含思考、动作与观察的示例,对冻结 model 进行 prompting。动作调用任务接口获取结果,文字 reasoning 用于分解目标、提炼观察和修订计划;持续追加的任务 context 连接这些步骤,直至作答或完成环境任务。

Inference

原文在 ALFWorld 中使用把纸张放到台灯下检查等任务。输入目标与环境描述,Thought 将目标拆为找到纸张和台灯;Action 导航、拿取和使用,Observation 更新物品位置与动作结果;Agent 据此继续行动直到完成。输出是实际动作轨迹与任务结果,没有将本次经验写入下一任务的训练步骤。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

将原动作空间 A 扩成 A∪L,L 表示语言 Thought。环境动作改变外部状态并产生 Observation;Thought 只更新当前 Context。这是一个清楚的形式化区别:Context 变长能改变当前策略输入,却不自动形成持久系统更新。论文主要通过 Prompt 和实验展示效果,无通用收敛保证。

 = A ∪ L
Thought: context_(t+1) = (context_t, thought_t)
Action: environment → observation_(t+1)
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:Reasoning 与 Acting 的结合是否互补?→ Experiment:在问答、事实验证、ALFWorld 与 WebShop 比较 CoT、Act-only 和 ReAct 等设置。→ Answer:作者报告多场景收益,也指出检索和推理会相互影响;并非每个任务都由同一种方式最好解决。

Paper Claim

作者在问答、事实核验、文本环境和网页操作任务中报告有效性,并分析相对仅 reasoning 或仅行动的差异。主实验是 few-shot prompting 执行,成绩反映当次任务求解能力,而非多轮自主更新后的通用能力增长。

08

Takeaways

这篇论文改变了哪些判断?

Inference

ReAct 让信息获取和决策连接起来。分析它时应检查工具返回了什么,以及 Thought 是否确实利用了这些证据;轨迹可读不等于所有推理都忠实。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是 Agent 能正确解释 Observation。工具结果可能不完整,Model 也可能忽略结果继续执行原计划,形成看似有反馈却没有实质纠正的循环。

Inference

核心 prompt 范式没有持久学习模块,也不要求修改 model parameters、prompt optimization 器或自身代码。论文另有初步 fine-tuning 实验,但不能因此把主方法的每次观察都说成参数学习,或把任务内重规划称为 Recursive Self-Improvement。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:建立一个有 Search、Lookup、Finish 的小型知识环境。Day 3–5:比较 CoT、Act-only 与交替轨迹,保持调用上限一致。Day 6–7:加入缺失页面与冲突信息,检查成功率和证据使用情况。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

让工具返回一条明确反驳初始猜测的事实。如果 Agent 在 Thought 中提到它却仍输出原结论,就能将“看到证据”与“根据证据改变决策”区分开。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究 Observation 的实际因果作用:对相同任务替换关键工具返回,测后续行动是否按证据变化,并训练能识别何时需要新信息的控制器。目标是信息获取策略的可验证性,而非把 Thought 写得更长。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] ReAct: Synergizing Reasoning and Acting in Language Models · v3 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
arXiv:2210.03629 · v3 / REVIEWED 2026.09.13
返回全部论文