RSI Paper
All PapersRESEARCH NOTE / 2303.11366

Reflexion: Language Agents with Verbal Reinforcement Learning

Reflexion:让失败成为下一次尝试的 memory

Noah Shinn 等

Submitted Verified Version · v4Note Updated
THE QUESTION WORTH READING

把任务 feedback 转成语言 reflection 并存入 episodic memory,让 Agent 在后续尝试中利用以往的经验。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
Memory Evolution
Loop Role
Solver
Persistence
Across Attempts
Recursive Reuse
Not Demonstrated
Evidence
Task Gain
System Boundary
Skills & Memory;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
外部任务结果或内部模拟信号,可以是标量或自然语言;Agent 将其转写为 episodic memory 中的 reflection。
Evidence Scope
这里的学习通过 reflection memory 实现,并不更新 model weights;效果也依赖 feedback 是否可靠。 已核验固定版本的相关方法与主要结果;未独立复现。

Reflection Text 保留到后续 Trial,改变 Actor 的输入。主要机制是 Memory 内容更新,固定 Reflection Procedure 没有被该实验重新设计。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

无需昂贵的 model fine-tuning,Agent 能否从试错中有效学习?

Inference

Agent 失败后重新开始,容易重复同一条错误行动。Fine-Tuning 可以积累经验,却对在线交互显得昂贵。Reflexion 研究能否将环境反馈转成简短的语言记忆,让固定 Model 在下一次尝试时避开已知失败。价值来自重试成本的降低。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

ReAct 已让 Agent 交替思考、行动和读取 Observation,但基本轨迹本身不要求将失败总结保留到下次尝试。Reflexion 在 Actor 和 Evaluator 之外加入 Self-Reflection,并将总结放进 Episodic Memory,使后续 Trial 能直接利用上次的教训。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

二元失败信号只告诉系统没成功,长轨迹又包含大量无关细节。LLM 擅长把过程压缩成语言解释,因而可以尝试将失败定位为可执行的建议。把建议放回下一次 Actor 的输入,就形成低成本的策略调整。关键不确定性是这份总结能否正确归因,而非仅凭结果编故事。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

Reflexion 将任务成败转译成下次尝试可读取的语言经验,使 feedback 不仅停留在一个分数上。reflection memory 改变后续决策时的 context,因而是跨尝试的系统状态更新;这为分析 nonparametric learning 提供了实例,也把 feedback 可靠性变成核心变量。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

将 feedback 信号写成 reflection 文本,存入 memory buffer,在后续行动时作为 context 使用。

Inference

沿用论文的编程任务设置作教学演示:输入函数描述,Actor 生成代码与可运行测试;Evaluator 执行可见测试,发现空列表失败。Self-Reflection 将错误概括为“先处理空输入”,写入 Memory。下次 Trial 读取描述和记忆,重新生成程序,最后用未暴露的测试评估。示例输入为构造,原文不同任务的反馈来源各异,不能混用它们的测试权限。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

可把 Policy 写成 π(a|state, memory)。Weights 固定,Memory 改变也会改变下一次动作分布,这解释了为什么不做 Gradient Update 仍能适应。Memory Update 将旧记忆与新反思合并,但没有 Bellman 收敛保证;反思文本的质量无法只由长度或语气度量。应将它看作一种有损的经验编码。

trajectory_t ~ π(· | task, memory_t)
reflection_t = Reflect(trajectory_t, feedback_t)
memory_(t+1) = Update(memory_t, reflection_t)
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:跨 Trial 保存语言反思能否帮助下一次尝试?→ Experiment:在决策、推理和编程任务上比较无反思或不同反馈、记忆设置。→ Answer:作者报告后续尝试的成功率提高;不同环境的评估协议不同,不能把带反馈的重试收益当作完全无反馈的一次作答能力。

Paper Claim

作者在顺序决策、编程与语言 reasoning 任务中报告相对 baseline 的改善。

08

Takeaways

这篇论文改变了哪些判断?

Inference

Reflexion 中的学习状态主要是 Episodic Memory。评估时至少记录 Trial Index、可见 Feedback 与 Memory Reset 规则,否则同名的 pass@1 很容易被误读成同样预算的一次尝试。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是失败原因可从现有轨迹辨认。随机失败、隐藏环境状态和不完整测试可能诱导错误归因;一旦写入 Memory,错误建议会影响更多尝试。

Inference

这里的学习通过 reflection memory 实现,并不更新 model weights;效果也依赖 feedback 是否可靠。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:准备带明确错误类型的小编程任务。Day 3–5:比较无 Memory、原始错误日志、压缩反思三组,限制相同重试次数。Day 6–7:替换任务中的表面变量,测教训能否迁移,并报告错误反思造成的额外失败。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

让某些失败来自随机超时,另一些来自真实逻辑错误,并隐藏该区分。若 Agent 从一次超时推断出错误算法规则,再在正常环境中持续避开正确动作,就能验证语言记忆可能放大偶然事件。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Prior Work

后续相关工作 DoCtOR 已将失败归因、反事实步骤修正与定向 Reflection 结合,用于 Multi-Agent Collaboration。单独提出因果归因或定向反思已有接近的研究。

Hypothesis

让每条反思携带一个可执行的反事实检查:若原因真是空输入,那么非空输入应通过,空输入应失败。系统通过主动实验决定是否保留记忆。相对 ReAct 的即时观察利用,这研究的是可证伪的经验积累;需要检验它是否减少错误归因,而不只是增加调试次数。 提案应进一步面对多个错误相互抵消或共同致错的情况:在写入跨任务规则前,主动选择能区分竞争原因的干预,并检验规则在未见任务上的可识别性。若只定位单个决定性错误,研究就没有覆盖这个新增问题;是否足够新颖仍需更多相关工作检索。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] Reflexion: Language Agents with Verbal Reinforcement Learning · v4 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] ReAct: Synergizing Reasoning and Acting in Language Models ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Finding Where the Buck Stops: An Automated Failure Attribution-Based Reflection Framework for Multi-Agent Collaboration ↗Follow-up 的相关工作核查;晚于原论文的研究仅用于评估提案,不作为作者当时的知识或动机。
arXiv:2303.11366 · v4 / REVIEWED 2026.09.13
返回全部论文