Reflexion: Language Agents with Verbal Reinforcement Learning
Reflexion:让失败成为下一次尝试的 memory
把任务 feedback 转成语言 reflection 并存入 episodic memory,让 Agent 在后续尝试中利用以往的经验。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Main Method
- Update Target
- Memory Evolution
- Loop Role
- Solver
- Persistence
- Across Attempts
- Recursive Reuse
- Not Demonstrated
- Evidence
- Task Gain
- System Boundary
- Skills & Memory;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 外部任务结果或内部模拟信号,可以是标量或自然语言;Agent 将其转写为 episodic memory 中的 reflection。
- Evidence Scope
- 这里的学习通过 reflection memory 实现,并不更新 model weights;效果也依赖 feedback 是否可靠。 已核验固定版本的相关方法与主要结果;未独立复现。
Reflection Text 保留到后续 Trial,改变 Actor 的输入。主要机制是 Memory 内容更新,固定 Reflection Procedure 没有被该实验重新设计。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Prior Work & Research Gap
前人做到哪一步,缺口在哪里?
ReAct 已让 Agent 交替思考、行动和读取 Observation,但基本轨迹本身不要求将失败总结保留到下次尝试。Reflexion 在 Actor 和 Evaluator 之外加入 Self-Reflection,并将总结放进 Episodic Memory,使后续 Trial 能直接利用上次的教训。
Idea Reconstruction
从已有知识与失败模式出发,如何走到这个想法?
二元失败信号只告诉系统没成功,长轨迹又包含大量无关细节。LLM 擅长把过程压缩成语言解释,因而可以尝试将失败定位为可执行的建议。把建议放回下一次 Actor 的输入,就形成低成本的策略调整。关键不确定性是这份总结能否正确归因,而非仅凭结果编故事。
Core Intuition
用一个清楚的视角抓住方法本质。
Reflexion 将任务成败转译成下次尝试可读取的语言经验,使 feedback 不仅停留在一个分数上。reflection memory 改变后续决策时的 context,因而是跨尝试的系统状态更新;这为分析 nonparametric learning 提供了实例,也把 feedback 可靠性变成核心变量。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
沿用论文的编程任务设置作教学演示:输入函数描述,Actor 生成代码与可运行测试;Evaluator 执行可见测试,发现空列表失败。Self-Reflection 将错误概括为“先处理空输入”,写入 Memory。下次 Trial 读取描述和记忆,重新生成程序,最后用未暴露的测试评估。示例输入为构造,原文不同任务的反馈来源各异,不能混用它们的测试权限。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
可把 Policy 写成 π(a|state, memory)。Weights 固定,Memory 改变也会改变下一次动作分布,这解释了为什么不做 Gradient Update 仍能适应。Memory Update 将旧记忆与新反思合并,但没有 Bellman 收敛保证;反思文本的质量无法只由长度或语气度量。应将它看作一种有损的经验编码。
trajectory_t ~ π(· | task, memory_t) reflection_t = Reflect(trajectory_t, feedback_t) memory_(t+1) = Update(memory_t, reflection_t)
Takeaways
这篇论文改变了哪些判断?
Reflexion 中的学习状态主要是 Episodic Memory。评估时至少记录 Trial Index、可见 Feedback 与 Memory Reset 规则,否则同名的 pass@1 很容易被误读成同样预算的一次尝试。
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:准备带明确错误类型的小编程任务。Day 3–5:比较无 Memory、原始错误日志、压缩反思三组,限制相同重试次数。Day 6–7:替换任务中的表面变量,测教训能否迁移,并报告错误反思造成的额外失败。
Counterexample Design
如何构造有辨识力的反例?
让某些失败来自随机超时,另一些来自真实逻辑错误,并隐藏该区分。若 Agent 从一次超时推断出错误算法规则,再在正常环境中持续避开正确动作,就能验证语言记忆可能放大偶然事件。
Follow-up Research
从缺陷与需求推导新的研究问题。
后续相关工作 DoCtOR 已将失败归因、反事实步骤修正与定向 Reflection 结合,用于 Multi-Agent Collaboration。单独提出因果归因或定向反思已有接近的研究。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] Reflexion: Language Agents with Verbal Reinforcement Learning · v4 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] ReAct: Synergizing Reasoning and Acting in Language Models ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] Finding Where the Buck Stops: An Automated Failure Attribution-Based Reflection Framework for Multi-Agent Collaboration ↗Follow-up 的相关工作核查;晚于原论文的研究仅用于评估提案,不作为作者当时的知识或动机。
