GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning
GEPA:从 execution trace 中提炼 reflection 并演化 prompt
让 model 阅读 reasoning 和工具 execution trace,用自然语言诊断失败,再通过候选 population 与 Pareto 选择积累互补的 prompt strategy。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Main Method
- Update Target
- Prompt & Context Evolution
- Loop Role
- Solver
- Persistence
- Across Tasks
- Recursive Reuse
- Not Demonstrated
- Evidence
- Task Gain
- System Boundary
- Single- or Multi-Module Prompts;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- execution trace、诊断文字与任务评价分数
- Evidence Scope
- 本条核对 arXiv 摘要,未通读论文全文或复现实验。优化依赖 reflection model、可用轨迹及评价预算;保存 prompt 并不更新 foundation model 参数,减少轨迹数量也不必然等于同比例降低总算力成本。 已核验固定版本的相关方法与主要结果;未独立复现。
Reflection 从执行轨迹提取规则并修改目标系统 Prompts。所测收益主要是 Task Gain;固定的候选选择与 Reflection Procedure 没有被证明自更新。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Research Problem & Background
问题为什么重要,解决它有什么价值?
稀疏标量 reward 通常不能直接说明失败原因,reinforcement learning 适配新任务又可能需要大量轨迹。论文研究能否从少量可读执行信息中提炼高层规则,并通过 prompt 更新提高单个或复合 LLM 系统的表现。
Scalar Reward 把一个复杂失败压成一个数,丢掉工具报错、误解约束和中间决策等线索。GEPA 研究能否用语言 Reflection 把少量 Trajectory 转成可保留的 Prompt 改进,并通过保留互补候选避免过早集中在一个方案。
Core Intuition
用一个清楚的视角抓住方法本质。
轨迹中包含的错误位置、工具返回和 reasoning 过程,比一个最终分数提供更多可操作信息。reflection model 可将这些信息压缩成修改建议,而保留不同任务子集上的优势候选,有利于积累互补经验。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
先选取候选系统并在小批任务上执行,记录轨迹和 feedback;reflection model 据此提出 prompt 变体并测试。候选池保留不同任务上的有效方案,并可合并互补模块,反复进行选择、mutation 和评价。
沿用工具使用轨迹作教学演示:一个 Agent 误读 API 返回字段,Reflection 在真实错误日志中定位问题,修改该模块的 Prompt,强调字段语义与检查步骤。新候选先在 Minibatch 测试,再在更大评估集上记录逐题表现;有互补优势的候选可能被保留或合并。输出是更新后的 Prompt 集合,非 Model Weight Update。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
Pareto 的核心是逐项比较。若候选 A 在所有测试样本上都不差于 B,且至少一项更好,A 支配 B。GEPA 利用逐任务优势保留多样候选。此处的“前沿”依赖有限样本,增加样本或换分布后可能改变;不能将开发集上的非支配性理解为总体最优。
A dominates B if sᵢ(A) ≥ sᵢ(B) for every i and sⱼ(A) > sⱼ(B) for at least one j
用两个任务说明 Pareto。Prompt A 在两项任务的分数为 (0.9,0.5),B 为 (0.7,0.8),双方各有优势,不能互相 Dominate;C 为 (0.6,0.4),则被 A 和 B 同时支配。保留 A 与 B 可以让后续修改利用不同专长,单纯用平均分挑一个胜者会丢掉这种差别。这里的二维数值是教学示例;真实搜索还取决于样本级表现、候选生成和预算,Pareto 保留本身不保证会找到更好的组合。
Experiments & Claims
Research Question → Experiment → Answer
Question:文本 Reflection 能否用较少 Rollout 达到较强适应?→ Experiment:在多任务上比较相关 Prompt Optimizer 和 GRPO 设置,分析反思、选择及合并组件。→ Answer:作者报告样本效率与任务分数优势;Rollout 数量、Token 成本及训练计算是不同资源指标,不能互换。
更新版摘要报告六项任务上平均优于 GRPO 约 6%,最多使用少 35 倍的轨迹,并超过 prompt optimization baseline MIPROv2。这些是论文给定 model 和预算下的结果,不能解读为 prompt optimization 普遍胜过所有 reinforcement learning 方法。
Takeaways
这篇论文改变了哪些判断?
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:构造带可检查工具调用的 40 个任务。Day 3–5:对比标量评分搜索、日志 Reflection、Reflection 加多候选选择。Day 6–7:在未见 API 参数组合上重测,统一总 Token Budget。
Counterexample Design
如何构造有辨识力的反例?
让错误日志中出现与正确答案偶然相关的标识符。若 Reflection 把标识符写成规则,开发集提高而打乱标识符后失效,就可辨认语义诊断与捷径学习。
Follow-up Research
从缺陷与需求推导新的研究问题。
后续相关工作 DoCtOR 已将失败归因、反事实步骤修正与定向 Reflection 结合,用于 Multi-Agent Collaboration。单独提出因果归因或定向反思已有接近的研究。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] TextGrad: Automatic "Differentiation" via Text ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [4] Finding Where the Buck Stops: An Automated Failure Attribution-Based Reflection Framework for Multi-Agent Collaboration ↗Follow-up 的相关工作核查;晚于原论文的研究仅用于评估提案,不作为作者当时的知识或动机。
