Agent-Pro: Learning to Evolve via Policy-Level Reflection and Optimization
Agent-Pro:从整局 feedback 修订行为 policy
对完整交互轨迹中的错误信念进行 reflection,将有效行为准则保留进 policy prompt,并用游戏收益检验候选更新。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Main Method
- Update Target
- Prompt & Context Evolution
- Loop Role
- Solver
- Persistence
- Across Tasks
- Recursive Reuse
- Not Demonstrated
- Evidence
- Task Gain
- System Boundary
- Persistent Policy Prompts & World Beliefs;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 完整博弈轨迹、终局信息、玩家得分及相同条件重放的收益。
- Evidence Scope
- prompt 更新与候选 search 框架由设计者固定,foundation model 没有 gradient 训练。牌局收益受到对手与随机性影响,不能仅凭一次高收益认定 policy 更优;world belief 也只是 model 的可修订假设,并非真实隐藏状态。 已核验固定版本的相关方法与主要结果;未独立复现。
Policy-level Reflection 更新 Behavioral Guideline 等 Prompt 内容,影响后续对局;Belief 与 DFS 框架本身固定,未展示 Architecture Code 的自动改写。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Core Intuition
用一个清楚的视角抓住方法本质。
行为失误可能来自对局面的错误理解,修订单个动作未必改变这一根源。Agent-Pro 把 world modeling 与行为准则写入持久 prompt;编辑理解是,优化对象由一次选择转为产生一类选择的决策规则。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
行动时动态更新自身和对手信念;对局结束后检查失败轨迹中的不一致或不合理判断,将 reflection 写成行为准则与 world model instruction。通过重放验证和 depth-first search 筛选 policy prompt,供后续决策复用。
沿用原文 Blackjack 与 Texas Hold’em 游戏设置:输入当前可见牌局与历史,Agent 更新 Self-belief 和对手相关 Belief,选择合法动作;游戏后检查轨迹中的不合理假设,生成新的 Behavioral Guideline,再用 DFS 探索并评价策略变体。输出是可保留的 Policy Prompt,牌局事实中的隐藏信息仍不可直接观察。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
Policy 的目标可写为期望 Payoff,而单次对局只提供带噪样本。多个对手策略下的平均值,取决于对手分布。DFS 沿策略变体树探索并回溯,是搜索程序,不构成单调收益的数学保证。原文所称 Belief 由语言表示,也不自动满足严格 Bayesian Update。
J(π) = E_(opponent, game randomness)[payoff(π)] Estimate J using repeated games, not one outcome
Experiments & Claims
Research Question → Experiment → Answer
Question:Policy-level Reflection 是否改善复杂交互?→ Experiment:在 Blackjack 与 Texas Hold’em 比较基线和相关组件,分析信念与策略更新。→ Answer:作者报告游戏收益,但结论依赖对手、规则和评估回合,不能直接外推到一般社会推理。
作者在 Blackjack 和多人限注德州扑克中报告优于普通 language model 及所比较专用 model 的表现。学习产物是 prompt 中的 policy 知识,结果对应这些博弈条件;论文没有展示跨领域通用智能或长期无界增长。
Takeaways
这篇论文改变了哪些判断?
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:实现小型可控牌局环境和两种对手。Day 3–5:比较动作反思与策略反思,固定对局数。Day 6–7:更换对手策略,重复种子测平均 Payoff 与方差,检查语言信念是否随证据调整。
Counterexample Design
如何构造有辨识力的反例?
训练对手总是激进下注,测试对手使用相反策略。若 Agent 把训练对手习惯写成游戏普遍规律,迁移时就会持续亏损,暴露社会信念的过度泛化。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] Agent-Pro: Learning to Evolve via Policy-Level Reflection and Optimization · v3 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] Reflexion: Language Agents with Verbal Reinforcement Learning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] Large Language Models as Optimizers ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
