RSI Paper
All PapersRESEARCH NOTE / 2406.07496

TextGrad: Automatic "Differentiation" via Text

TextGrad:沿系统结构传递文本 feedback 进行优化

Mert Yuksekgonul、Federico Bianchi、Joseph Boen 等

Submitted Verified Version · v1Note Updated
THE QUESTION WORTH READING

把复合系统表示为 computation graph,让 language model 沿依赖关系生成和传递修改建议,优化 prompt、代码或科学设计等不同对象。

Classification & RSI Relation 2 Variants · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Instance Optimization

Update Target
No persistent system target in this setting
Loop Role
Solver
Persistence
Ephemeral
Recursive Reuse
Not Demonstrated
Evidence
Task Gain
System Boundary
Prompts, Code & External Design Variables;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
Task-specific critique, execution or domain evaluation
Evidence Scope
方法依赖 model 提供可靠的语义归因,没有真实 gradient 或收敛保证。分子相关结果主要来自计算评价,外部科学设计不能仅凭代理分数证明真实效果;foundation model 和文本优化流程也没有在实验中自主重写。 已核验固定版本的相关方法与主要结果;未独立复现。

优化当前 answer、program 或其他产物;没有据此更新 TextGrad 自身。

检查原文设置 ↗

Prompt Optimization

Update Target
Prompt & Context Evolution
Loop Role
Solver
Persistence
Across Tasks
Recursive Reuse
Not Demonstrated
Evidence
Task Gain
System Boundary
Solver system prompt; fixed gradient engine
Feedback
External Model and task loss
Evidence Scope
方法依赖 model 提供可靠的语义归因,没有真实 gradient 或收敛保证。分子相关结果主要来自计算评价,外部科学设计不能仅凭代理分数证明真实效果;foundation model 和文本优化流程也没有在实验中自主重写。 已核验固定版本的相关方法与主要结果;未独立复现。

Prompt 跨样本保留;外部 gradient engine 固定,没有展示 evolved TextGrad optimizer。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

compound AI system 包含 model 调用、程序和外部 solver,往往无法对端到端目标直接求数值 gradient。论文研究能否以自然语言批评为 feedback,将最终失败追溯到可修改变量,从而自动改进多个相互依赖的组件或设计产物。

Inference

Compound AI System 中,最终错误可能来自多个上游组件。只给总分,很难决定改哪个 Prompt、代码或其他变量。TextGrad 研究把语言 Feedback 沿计算图向上游传递,让每个可优化变量收到与其作用相关的修改建议。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

OPRO 根据候选与分数搜索,Self-Refine 用反馈修订当前输出。TextGrad 增加计算图抽象与局部反馈传播,使多个组件能围绕共同目标优化。其 Textual Gradient 是语言建议,不等同于数学上的可微梯度。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

数值 AutoDiff 的优势来自记住前向依赖,再把输出误差分配给输入。LLM 虽然不一定提供可用导数,却能阅读局部输入、输出和下游反馈,解释该组件如何影响最终结果。于是可以保留图结构,让语言承担局部归因和编辑;这种类比是否有效必须用实际修改后的目标值验证。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

feedback 的价值不仅在于指出答案错了,还在于结合组件的角色和下游目标说明应改哪里。computation graph 提供这种依赖结构,language model 承担语义上的错误归因;所谓 textual gradient 是优化建议的比喻,并不具有数值导数的数学保证。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

把输入、输出和待优化对象建成 computation graph,先前向执行并依据目标取得评价,再沿依赖反向生成对各变量的文本 feedback。文本 optimizer 综合变量、角色和 feedback 提出更新,重新运行系统检验目标变化,迭代改进候选。

Inference

沿用原文 Prompt Optimization 场景:Prompt 与 Question 输入 Solver 得到 Prediction,Evaluator 给反馈;Backward 结合下游意见和局部上下文,为 Prompt 生成 Textual Gradient;Optimizer 修改 Prompt,再在独立样本上检查。原文还优化单题 Solution、代码、分子和治疗计划。这些 Variant 的输出与保留范围不同,单题修订不能被当成跨任务 Prompt Learning。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

数值 Chain Rule 中,dL/dx=(dL/dy)(dy/dx),局部导数有确定含义。TextGrad 用文字反馈近似“x 应如何变化以改善 L”的作用,而没有可相乘的数值局部导数。因此不要把 Textual Gradient 的方向看成已证明的下降方向。理解它时应跟踪依赖图、反馈可见范围和更新后的重新评估。

Numerical analogy: dL/dx = (dL/dy)·(dy/dx)
TextGrad: downstream feedback + local context → textual advice
variable′ = edit(variable, advice); then re-evaluate
Inference

链式法则的数值例子是 y=2x、L=y²:x 增加一点先让 y 以两倍幅度变化,再通过 L 对 y 的斜率 2y 传到目标,所以 dL/dx=2y×2。TextGrad 借用了沿依赖关系追溯影响的组织方式,但文字建议没有对应的连续微小扰动或可验证导数。一次编辑可能同时改变语义、格式和边界行为。因此,收到看似合理的 Feedback 后仍要重新运行系统,检查 Loss 是否改善;不能将建议方向直接当作下降保证。

07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:图式文本反馈能否跨不同变量与目标有效优化?→ Experiment:在代码、推理、Prompt、分子和治疗计划等任务展示并比较优化结果。→ Answer:作者报告多种场景收益;每个实验有自己的目标函数和约束,不能将其中的分数合并成统一的通用优化能力。

Paper Claim

第 3.2 节通过 test-time 逐题修订答案,将 GPQA zero-shot 准确率从 51% 提至 55%;第 3.3 节另做可跨查询复用的 prompt optimization。代码、分子与治疗计划属于不同产物任务,不能将其指标统一解释为 model 自身能力增长。

08

Takeaways

这篇论文改变了哪些判断?

Inference

TextGrad 的价值是统一反馈传递接口。它提供可用的工程抽象,但局部语言归因的正确性、收敛与跨任务保留仍需按 Variant 单独验证。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是局部上下文足以识别全局错误原因。两个组件可能各自合理、组合后失效;单独修改任一组件都可能破坏原有配合。

Inference

方法依赖 model 提供可靠的语义归因,没有真实 gradient 或收敛保证。分子相关结果主要来自计算评价,外部科学设计不能仅凭代理分数证明真实效果;foundation model 和文本优化流程也没有在实验中自主重写。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:建立检索加回答的两节点系统,构造有明确错误来源的数据。Day 3–5:比较只改最终输出、只改 Prompt、图式反馈三组。Day 6–7:测隐藏问题,并人工检查反馈是否指向真正出错的节点。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

让两个节点约定一个内部编码,单独看中间结果像错误、联合输出却正确。若 Backward 按常识修正其中一个节点并破坏最终答案,就能展示局部解释与全局功能的冲突。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Prior Work

后续相关工作 DoCtOR 已将失败归因、反事实步骤修正与定向 Reflection 结合,用于 Multi-Agent Collaboration。单独提出因果归因或定向反思已有接近的研究。

Hypothesis

研究语言反馈的因果信用分配:在建议修改前,对中间节点做最小替换实验,判断哪个变化真正改变最终结果。相对 Self-Refine 的整段修订,这要求区分归因证据和编辑建议。评价应看定位准确率及错误更新减少量,而非只看最终多次尝试后的最高分。 提案应进一步面对多个错误相互抵消或共同致错的情况:在写入跨任务规则前,主动选择能区分竞争原因的干预,并检验规则在未见任务上的可识别性。若只定位单个决定性错误,研究就没有覆盖这个新增问题;是否足够新颖仍需更多相关工作检索。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] TextGrad: Automatic "Differentiation" via Text · v1 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] Large Language Models as Optimizers ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Self-Refine: Iterative Refinement with Self-Feedback ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  4. [4] Finding Where the Buck Stops: An Automated Failure Attribution-Based Reflection Framework for Multi-Agent Collaboration ↗Follow-up 的相关工作核查;晚于原论文的研究仅用于评估提案,不作为作者当时的知识或动机。
arXiv:2406.07496 · v1 / REVIEWED 2026.09.13
返回全部论文