Large Language Models as Optimizers
OPRO:用历史候选与分数驱动 prompt optimization
把先前候选及其分数写入 meta-prompt,让 language model 持续提出更优 prompt;optimizer 本身保持固定,更新的是目标系统的任务 instruction。
Classification & RSI Relation 2 Variants · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Reusable Prompt Optimization
- Update Target
- Prompt & Context Evolution
- Loop Role
- Solver
- Persistence
- Across Tasks
- Recursive Reuse
- Not Demonstrated
- Evidence
- Task Gain
- System Boundary
- Task Prompts & Candidate History;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 目标 model 在带答案训练样本上的准确率为候选评分;候选 prompt 与分数写入 meta-prompt,驱动下一轮生成。
- Evidence Scope
- 训练样本及可计算评分是必要外部信号,反复选择也可能 overfitting 小型训练集。context 预算限制可利用的历史,foundation model 与元优化流程固定;外部数学问题的解变好与部署系统的长期能力改进需分别记录。 已核验固定版本的相关方法与主要结果;未独立复现。
可复用任务 Prompt 被更新,外部 Optimizer LLM 与候选生成规则固定;附带的数值与路线搜索属于外部 Artifact Optimization,另列 Variant。
检查原文设置 ↗Mathematical Optimization Examples
- Update Target
- No persistent system target in this setting
- Loop Role
- Solver
- Persistence
- Ephemeral
- Recursive Reuse
- Not Demonstrated
- Evidence
- Task Gain
- System Boundary
- Candidate regression coefficients or TSP route
- Feedback
- 目标 model 在带答案训练样本上的准确率为候选评分;候选 prompt 与分数写入 meta-prompt,驱动下一轮生成。
- Evidence Scope
- 训练样本及可计算评分是必要外部信号,反复选择也可能 overfitting 小型训练集。context 预算限制可利用的历史,foundation model 与元优化流程固定;外部数学问题的解变好与部署系统的长期能力改进需分别记录。 已核验固定版本的相关方法与主要结果;未独立复现。
更新外部数值或路线候选;搜索历史留在当前优化问题中,未提交跨问题 Optimizer 更新。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Research Problem & Background
问题为什么重要,解决它有什么价值?
prompt 空间离散、巨大且通常只能通过 model 调用测量表现,难以使用常规 gradient 优化。论文研究 language model 能否从自然语言目标及过往候选分数中识别改进方向,自动 search 能在新样本上提高任务准确率的 instruction。
许多优化变量是字符串或离散方案,无法直接对目标函数求梯度。OPRO 研究 LLM 是否可以理解自然语言目标,阅读历史候选及分数,提出下一批更好的候选。Prompt Optimization 是其主要应用,因为 Prompt 的语义结构可被 LLM 直接理解。
Prior Work & Research Gap
前人做到哪一步,缺口在哪里?
STaR 通过生成与筛选数据改善模型的 Reasoning,说明成功样本可提供训练信号。OPRO 则保持 Optimizer LLM 固定,把搜索历史放在 Context 中;它不通过这一步更新模型参数。原文还用线性回归与 TSP 作为离散或无梯度优化的说明场景。
Idea Reconstruction
从已有知识与失败模式出发,如何走到这个想法?
若一个人看到多条指令及其成绩,通常能提出哪些措辞可能有帮助的猜测。LLM 也能从自然语言候选提取共同特征,因而可以把候选表和目标说明直接交给它。下一步仍需要独立执行评分,因为语言上看起来更合理不代表目标函数更高。
Core Intuition
用一个清楚的视角抓住方法本质。
历史候选和分数构成一种可读的 optimization trajectory,model 不必只围绕当前最好 prompt 作局部修改,而可以比较多个尝试来提出新 strategy。任务描述和示例提供语义约束,实际运行得分则决定候选是否值得进入下一轮历史。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
meta-prompt 包含任务说明、示例及已评估的候选与分数;optimizer model 生成新 prompt,目标 model 在训练样本上运行并计算准确率。把新 prompt 和得分加入历史,继续生成,直到不能改进或达到预算,再采用选出的任务 prompt。
沿用原文 GSM8K Prompt Search:输入候选指令、对应训练准确率及任务描述;Optimizer LLM 生成新指令,Scorer Model 用它回答一批题;结果追加到历史后进入下一轮。最终输出是选出的 Prompt,再到测试题评估。Scorer 与 Optimizer 的角色可以由不同 Model 承担,不能把历史分数增长解读为 Optimizer Weights 改善。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
设 p 为 Prompt,f(p) 为一批任务的平均分。OPRO 根据历史 H={(p,f(p))} 生成候选,而非计算 ∂f/∂p。自然语言相当于带先验的候选生成器,真实目标仍需外部测量。由于反复查看开发分数,选择偏差会累积;测试集必须留到搜索结束后使用。
p_next ~ LLM(objective, constraints, H)
H ← H ∪ {(p_next, f_dev(p_next))}
Report f_test(selected prompt) only after searchExperiments & Claims
Research Question → Experiment → Answer
Question:LLM 能否利用优化历史提出有效候选?→ Experiment:先在数学优化示例测试,再在 GSM8K 与 BBH 等任务进行 Prompt Search,比较人工指令。→ Answer:作者报告部分任务显著提升,但效果随 Optimizer、Scorer、初始化与评价集变化。
论文在 GSM8K 与 Big-Bench Hard 上报告,search 到的 prompt 超过所比较的人工 prompt,并观察到同领域任务的迁移收益。结果反映特定 model、起点和训练样本下的 prompt optimization,摘要中的最大提升不应视为普遍平均收益。
Takeaways
这篇论文改变了哪些判断?
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:划分 40 道开发题和独立测试题。Day 3–5:比较有分数历史、打乱分数历史与随机 Prompt 生成,限制相同候选数。Day 6–7:重测最佳 Prompt 的方差,检验正确的历史关联是否真正有用。
Counterexample Design
如何构造有辨识力的反例?
把历史分数随机打乱但保留候选文本,或让分数只依赖无关标点。若优化过程依旧声称找到语义规律,却不能在隐藏任务提升,就能检验它是否在合理化随机反馈。
Follow-up Research
从缺陷与需求推导新的研究问题。
研究 Optimizer 何时应该拒绝继续搜索:估计候选成绩中的可预测结构与噪声,只有在新评估能区分假设时分配预算。相对 STaR 的成功轨迹训练,这关注黑盒优化中的可辨识信息。目标是推导或测出何种反馈条件允许语言优化优于随机搜索。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] Large Language Models as Optimizers · v3 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] STaR: Bootstrapping Reasoning With Reasoning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
