RSI Paper
All PapersRESEARCH NOTE / 2507.19457

GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning

GEPA:从 execution trace 中提炼 reflection 并演化 prompt

Lakshya A Agrawal 等

Submitted Verified Version · v2Note Updated
THE QUESTION WORTH READING

让 model 阅读 reasoning 和工具 execution trace,用自然语言诊断失败,再通过候选 population 与 Pareto 选择积累互补的 prompt strategy。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
Prompt & Context Evolution
Loop Role
Solver
Persistence
Across Tasks
Recursive Reuse
Not Demonstrated
Evidence
Task Gain
System Boundary
Single- or Multi-Module Prompts;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
execution trace、诊断文字与任务评价分数
Evidence Scope
本条核对 arXiv 摘要,未通读论文全文或复现实验。优化依赖 reflection model、可用轨迹及评价预算;保存 prompt 并不更新 foundation model 参数,减少轨迹数量也不必然等于同比例降低总算力成本。 已核验固定版本的相关方法与主要结果;未独立复现。

Reflection 从执行轨迹提取规则并修改目标系统 Prompts。所测收益主要是 Task Gain;固定的候选选择与 Reflection Procedure 没有被证明自更新。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

稀疏标量 reward 通常不能直接说明失败原因,reinforcement learning 适配新任务又可能需要大量轨迹。论文研究能否从少量可读执行信息中提炼高层规则,并通过 prompt 更新提高单个或复合 LLM 系统的表现。

Inference

Scalar Reward 把一个复杂失败压成一个数,丢掉工具报错、误解约束和中间决策等线索。GEPA 研究能否用语言 Reflection 把少量 Trajectory 转成可保留的 Prompt 改进,并通过保留互补候选避免过早集中在一个方案。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

TextGrad 已通过文本反馈更新系统变量,Promptbreeder 已演化 Prompt 及 Mutation Prompt。GEPA 重点在完整执行轨迹的诊断、候选选择和互补经验合并。其主流程更新目标系统 Prompts,固定 Reflection 与选择程序并未因此成为已验证的自我修改 Improver。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

一次失败的日志常直接暴露修复方向,比试出许多微小参数变化更便宜。但一条新规则可能帮助一类任务、损害另一类任务,因此不应只保留平均分最高的 Prompt。保留在不同样本上有优势的候选,再尝试合并互补规则,就形成 Reflection 与 Pareto Selection 的组合。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

轨迹中包含的错误位置、工具返回和 reasoning 过程,比一个最终分数提供更多可操作信息。reflection model 可将这些信息压缩成修改建议,而保留不同任务子集上的优势候选,有利于积累互补经验。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

先选取候选系统并在小批任务上执行,记录轨迹和 feedback;reflection model 据此提出 prompt 变体并测试。候选池保留不同任务上的有效方案,并可合并互补模块,反复进行选择、mutation 和评价。

Inference

沿用工具使用轨迹作教学演示:一个 Agent 误读 API 返回字段,Reflection 在真实错误日志中定位问题,修改该模块的 Prompt,强调字段语义与检查步骤。新候选先在 Minibatch 测试,再在更大评估集上记录逐题表现;有互补优势的候选可能被保留或合并。输出是更新后的 Prompt 集合,非 Model Weight Update。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

Pareto 的核心是逐项比较。若候选 A 在所有测试样本上都不差于 B,且至少一项更好,A 支配 B。GEPA 利用逐任务优势保留多样候选。此处的“前沿”依赖有限样本,增加样本或换分布后可能改变;不能将开发集上的非支配性理解为总体最优。

A dominates B if sᵢ(A) ≥ sᵢ(B) for every i
and sⱼ(A) > sⱼ(B) for at least one j
Inference

用两个任务说明 Pareto。Prompt A 在两项任务的分数为 (0.9,0.5),B 为 (0.7,0.8),双方各有优势,不能互相 Dominate;C 为 (0.6,0.4),则被 A 和 B 同时支配。保留 A 与 B 可以让后续修改利用不同专长,单纯用平均分挑一个胜者会丢掉这种差别。这里的二维数值是教学示例;真实搜索还取决于样本级表现、候选生成和预算,Pareto 保留本身不保证会找到更好的组合。

07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:文本 Reflection 能否用较少 Rollout 达到较强适应?→ Experiment:在多任务上比较相关 Prompt Optimizer 和 GRPO 设置,分析反思、选择及合并组件。→ Answer:作者报告样本效率与任务分数优势;Rollout 数量、Token 成本及训练计算是不同资源指标,不能互换。

Paper Claim

更新版摘要报告六项任务上平均优于 GRPO 约 6%,最多使用少 35 倍的轨迹,并超过 prompt optimization baseline MIPROv2。这些是论文给定 model 和预算下的结果,不能解读为 prompt optimization 普遍胜过所有 reinforcement learning 方法。

08

Takeaways

这篇论文改变了哪些判断?

Inference

GEPA 的启发是把日志中的高信息量错误转成具体规则,并保留互补解。评估时同时记录 Reflection 所见数据、搜索次数和隐藏测试,才能判断规则是否真正泛化。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是 Reflection 能从少量失败定位可迁移原因。它可能将个例编成过度具体的指令,或根据偶然成功把错误规则加入 Prompt。

Inference

本条核对 arXiv 摘要,未通读论文全文或复现实验。优化依赖 reflection model、可用轨迹及评价预算;保存 prompt 并不更新 foundation model 参数,减少轨迹数量也不必然等于同比例降低总算力成本。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:构造带可检查工具调用的 40 个任务。Day 3–5:对比标量评分搜索、日志 Reflection、Reflection 加多候选选择。Day 6–7:在未见 API 参数组合上重测,统一总 Token Budget。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

让错误日志中出现与正确答案偶然相关的标识符。若 Reflection 把标识符写成规则,开发集提高而打乱标识符后失效,就可辨认语义诊断与捷径学习。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Prior Work

后续相关工作 DoCtOR 已将失败归因、反事实步骤修正与定向 Reflection 结合,用于 Multi-Agent Collaboration。单独提出因果归因或定向反思已有接近的研究。

Hypothesis

让 Reflection 输出一项可被主动干预检验的错误解释,先修改环境或输入来区分原因,再允许更新 Prompt。相对 TextGrad 的反馈传递,这将优化过程转为诊断实验设计。关键收益是减少错误规则累积,且必须在相同诊断预算下比较。 提案应进一步面对多个错误相互抵消或共同致错的情况:在写入跨任务规则前,主动选择能区分竞争原因的干预,并检验规则在未见任务上的可识别性。若只定位单个决定性错误,研究就没有覆盖这个新增问题;是否足够新颖仍需更多相关工作检索。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] TextGrad: Automatic "Differentiation" via Text ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  4. [4] Finding Where the Buck Stops: An Automated Failure Attribution-Based Reflection Framework for Multi-Agent Collaboration ↗Follow-up 的相关工作核查;晚于原论文的研究仅用于评估提案,不作为作者当时的知识或动机。
arXiv:2507.19457 · v2 / REVIEWED 2026.09.13
返回全部论文