RSI Paper
All PapersRESEARCH NOTE / 2402.17574

Agent-Pro: Learning to Evolve via Policy-Level Reflection and Optimization

Agent-Pro:从整局 feedback 修订行为 policy

Wenqi Zhang 等

Submitted Verified Version · v3Note Updated
THE QUESTION WORTH READING

对完整交互轨迹中的错误信念进行 reflection,将有效行为准则保留进 policy prompt,并用游戏收益检验候选更新。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
Prompt & Context Evolution
Loop Role
Solver
Persistence
Across Tasks
Recursive Reuse
Not Demonstrated
Evidence
Task Gain
System Boundary
Persistent Policy Prompts & World Beliefs;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
完整博弈轨迹、终局信息、玩家得分及相同条件重放的收益。
Evidence Scope
prompt 更新与候选 search 框架由设计者固定,foundation model 没有 gradient 训练。牌局收益受到对手与随机性影响,不能仅凭一次高收益认定 policy 更优;world belief 也只是 model 的可修订假设,并非真实隐藏状态。 已核验固定版本的相关方法与主要结果;未独立复现。

Policy-level Reflection 更新 Behavioral Guideline 等 Prompt 内容,影响后续对局;Belief 与 DFS 框架本身固定,未展示 Architecture Code 的自动改写。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

多步博弈的 reward 延迟出现,Agent 还看不到对手全部状态,逐动作 reflection 很难判断失败源头。论文研究如何利用整局结果检查关于自身与对手的信念,并把教训提炼为之后仍可使用的 policy。

Inference

交互游戏中的好行动依赖对规则、对手和自身状态的判断。只在某个动作后反思,容易忽略造成多次错误的 Policy-level Belief。Agent-Pro 研究从整段经历修订这些信念和策略,并以搜索选择能提高收益的 Prompt。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

Reflexion 保存语言反思,OPRO 根据反馈优化 Prompt。Agent-Pro 结合 Belief-aware Decision Making、Policy-level Reflection 与 DFS-based Policy Evolution,主要通过 Context 中的策略指令变化学习,而非 Model Weight Fine-Tuning。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

一次失败行动可能只是错误世界模型的表面症状。例如持续高估对手弃牌概率,会影响很多下注决定。先把行为背后的信念显式化,再回顾多轮轨迹检查信念,便能修改一类行动而非一条动作。之后需要重复对局,因为单局输赢并不足以评价策略。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

行为失误可能来自对局面的错误理解,修订单个动作未必改变这一根源。Agent-Pro 把 world modeling 与行为准则写入持久 prompt;编辑理解是,优化对象由一次选择转为产生一类选择的决策规则。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

行动时动态更新自身和对手信念;对局结束后检查失败轨迹中的不一致或不合理判断,将 reflection 写成行为准则与 world model instruction。通过重放验证和 depth-first search 筛选 policy prompt,供后续决策复用。

Inference

沿用原文 Blackjack 与 Texas Hold’em 游戏设置:输入当前可见牌局与历史,Agent 更新 Self-belief 和对手相关 Belief,选择合法动作;游戏后检查轨迹中的不合理假设,生成新的 Behavioral Guideline,再用 DFS 探索并评价策略变体。输出是可保留的 Policy Prompt,牌局事实中的隐藏信息仍不可直接观察。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

Policy 的目标可写为期望 Payoff,而单次对局只提供带噪样本。多个对手策略下的平均值,取决于对手分布。DFS 沿策略变体树探索并回溯,是搜索程序,不构成单调收益的数学保证。原文所称 Belief 由语言表示,也不自动满足严格 Bayesian Update。

J(π) = E_(opponent, game randomness)[payoff(π)]
Estimate J using repeated games, not one outcome
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:Policy-level Reflection 是否改善复杂交互?→ Experiment:在 Blackjack 与 Texas Hold’em 比较基线和相关组件,分析信念与策略更新。→ Answer:作者报告游戏收益,但结论依赖对手、规则和评估回合,不能直接外推到一般社会推理。

Paper Claim

作者在 Blackjack 和多人限注德州扑克中报告优于普通 language model 及所比较专用 model 的表现。学习产物是 prompt 中的 policy 知识,结果对应这些博弈条件;论文没有展示跨领域通用智能或长期无界增长。

08

Takeaways

这篇论文改变了哪些判断?

Inference

Agent-Pro 把可修改状态从单次行动扩到策略性信念。最关键的评价是新策略在新对手下的稳定性,以及它究竟学到了规则还是对特定对手的适配。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是少量输赢足以判断信念错误。随机牌面与对手变化可能让合理策略暂时亏损,反思却将其当作需要修改的缺陷。

Inference

prompt 更新与候选 search 框架由设计者固定,foundation model 没有 gradient 训练。牌局收益受到对手与随机性影响,不能仅凭一次高收益认定 policy 更优;world belief 也只是 model 的可修订假设,并非真实隐藏状态。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:实现小型可控牌局环境和两种对手。Day 3–5:比较动作反思与策略反思,固定对局数。Day 6–7:更换对手策略,重复种子测平均 Payoff 与方差,检查语言信念是否随证据调整。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

训练对手总是激进下注,测试对手使用相反策略。若 Agent 把训练对手习惯写成游戏普遍规律,迁移时就会持续亏损,暴露社会信念的过度泛化。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究可撤销的对手模型:Agent 主动选择低成本探测动作,区分规则变化、对手变化和随机波动,再决定是否更新 Policy。相对 OPRO 的静态评分搜索,这构成非平稳博弈中的信息获取与学习问题。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] Agent-Pro: Learning to Evolve via Policy-Level Reflection and Optimization · v3 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] Reflexion: Language Agents with Verbal Reinforcement Learning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Large Language Models as Optimizers ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2402.17574 · v3 / REVIEWED 2026.09.13
返回全部论文