RSI Paper
All PapersRESEARCH NOTE / 2309.03409

Large Language Models as Optimizers

OPRO:用历史候选与分数驱动 prompt optimization

Chengrun Yang、Xuezhi Wang、Yifeng Lu 等

Submitted Verified Version · v3Note Updated
THE QUESTION WORTH READING

把先前候选及其分数写入 meta-prompt,让 language model 持续提出更优 prompt;optimizer 本身保持固定,更新的是目标系统的任务 instruction。

Classification & RSI Relation 2 Variants · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Reusable Prompt Optimization

Update Target
Prompt & Context Evolution
Loop Role
Solver
Persistence
Across Tasks
Recursive Reuse
Not Demonstrated
Evidence
Task Gain
System Boundary
Task Prompts & Candidate History;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
目标 model 在带答案训练样本上的准确率为候选评分;候选 prompt 与分数写入 meta-prompt,驱动下一轮生成。
Evidence Scope
训练样本及可计算评分是必要外部信号,反复选择也可能 overfitting 小型训练集。context 预算限制可利用的历史,foundation model 与元优化流程固定;外部数学问题的解变好与部署系统的长期能力改进需分别记录。 已核验固定版本的相关方法与主要结果;未独立复现。

可复用任务 Prompt 被更新,外部 Optimizer LLM 与候选生成规则固定;附带的数值与路线搜索属于外部 Artifact Optimization,另列 Variant。

检查原文设置 ↗

Mathematical Optimization Examples

Update Target
No persistent system target in this setting
Loop Role
Solver
Persistence
Ephemeral
Recursive Reuse
Not Demonstrated
Evidence
Task Gain
System Boundary
Candidate regression coefficients or TSP route
Feedback
目标 model 在带答案训练样本上的准确率为候选评分;候选 prompt 与分数写入 meta-prompt,驱动下一轮生成。
Evidence Scope
训练样本及可计算评分是必要外部信号,反复选择也可能 overfitting 小型训练集。context 预算限制可利用的历史,foundation model 与元优化流程固定;外部数学问题的解变好与部署系统的长期能力改进需分别记录。 已核验固定版本的相关方法与主要结果;未独立复现。

更新外部数值或路线候选;搜索历史留在当前优化问题中,未提交跨问题 Optimizer 更新。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

prompt 空间离散、巨大且通常只能通过 model 调用测量表现,难以使用常规 gradient 优化。论文研究 language model 能否从自然语言目标及过往候选分数中识别改进方向,自动 search 能在新样本上提高任务准确率的 instruction。

Inference

许多优化变量是字符串或离散方案,无法直接对目标函数求梯度。OPRO 研究 LLM 是否可以理解自然语言目标,阅读历史候选及分数,提出下一批更好的候选。Prompt Optimization 是其主要应用,因为 Prompt 的语义结构可被 LLM 直接理解。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

STaR 通过生成与筛选数据改善模型的 Reasoning,说明成功样本可提供训练信号。OPRO 则保持 Optimizer LLM 固定,把搜索历史放在 Context 中;它不通过这一步更新模型参数。原文还用线性回归与 TSP 作为离散或无梯度优化的说明场景。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

若一个人看到多条指令及其成绩,通常能提出哪些措辞可能有帮助的猜测。LLM 也能从自然语言候选提取共同特征,因而可以把候选表和目标说明直接交给它。下一步仍需要独立执行评分,因为语言上看起来更合理不代表目标函数更高。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

历史候选和分数构成一种可读的 optimization trajectory,model 不必只围绕当前最好 prompt 作局部修改,而可以比较多个尝试来提出新 strategy。任务描述和示例提供语义约束,实际运行得分则决定候选是否值得进入下一轮历史。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

meta-prompt 包含任务说明、示例及已评估的候选与分数;optimizer model 生成新 prompt,目标 model 在训练样本上运行并计算准确率。把新 prompt 和得分加入历史,继续生成,直到不能改进或达到预算,再采用选出的任务 prompt。

Inference

沿用原文 GSM8K Prompt Search:输入候选指令、对应训练准确率及任务描述;Optimizer LLM 生成新指令,Scorer Model 用它回答一批题;结果追加到历史后进入下一轮。最终输出是选出的 Prompt,再到测试题评估。Scorer 与 Optimizer 的角色可以由不同 Model 承担,不能把历史分数增长解读为 Optimizer Weights 改善。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

设 p 为 Prompt,f(p) 为一批任务的平均分。OPRO 根据历史 H={(p,f(p))} 生成候选,而非计算 ∂f/∂p。自然语言相当于带先验的候选生成器,真实目标仍需外部测量。由于反复查看开发分数,选择偏差会累积;测试集必须留到搜索结束后使用。

p_next ~ LLM(objective, constraints, H)
H ← H ∪ {(p_next, f_dev(p_next))}
Report f_test(selected prompt) only after search
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:LLM 能否利用优化历史提出有效候选?→ Experiment:先在数学优化示例测试,再在 GSM8K 与 BBH 等任务进行 Prompt Search,比较人工指令。→ Answer:作者报告部分任务显著提升,但效果随 Optimizer、Scorer、初始化与评价集变化。

Paper Claim

论文在 GSM8K 与 Big-Bench Hard 上报告,search 到的 prompt 超过所比较的人工 prompt,并观察到同领域任务的迁移收益。结果反映特定 model、起点和训练样本下的 prompt optimization,摘要中的最大提升不应视为普遍平均收益。

08

Takeaways

这篇论文改变了哪些判断?

Inference

OPRO 的最小闭环是提出、测量、记录。它降低了设计候选的门槛,但固定 Model 在越来越长的 Context 中工作,不能自动算作改进算法的持久演化。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是候选成绩中的可学习规律多于噪声。小开发集、随机输出和题型偏差可能让 LLM 追逐偶然高分措辞。

Inference

训练样本及可计算评分是必要外部信号,反复选择也可能 overfitting 小型训练集。context 预算限制可利用的历史,foundation model 与元优化流程固定;外部数学问题的解变好与部署系统的长期能力改进需分别记录。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:划分 40 道开发题和独立测试题。Day 3–5:比较有分数历史、打乱分数历史与随机 Prompt 生成,限制相同候选数。Day 6–7:重测最佳 Prompt 的方差,检验正确的历史关联是否真正有用。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

把历史分数随机打乱但保留候选文本,或让分数只依赖无关标点。若优化过程依旧声称找到语义规律,却不能在隐藏任务提升,就能检验它是否在合理化随机反馈。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究 Optimizer 何时应该拒绝继续搜索:估计候选成绩中的可预测结构与噪声,只有在新评估能区分假设时分配预算。相对 STaR 的成功轨迹训练,这关注黑盒优化中的可辨识信息。目标是推导或测出何种反馈条件允许语言优化优于随机搜索。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] Large Language Models as Optimizers · v3 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] STaR: Bootstrapping Reasoning With Reasoning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2309.03409 · v3 / REVIEWED 2026.09.13
返回全部论文