Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models
ACE:让 context 成为持续演化的经验手册
把 context 管理为可增量更新的 strategy 条目,由生成、reflection 和整理三类角色积累经验,缓解反复整体重写造成的信息流失。
Classification & RSI Relation 2 Variants · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Offline Playbook Adaptation
- Update Target
- Prompt & Context Evolution
- Loop Role
- Solver
- Persistence
- Across Tasks
- Recursive Reuse
- Not Demonstrated
- Evidence
- Task Gain
- System Boundary
- Structured Context & Experiential Memory;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 任务 execution trace、成功/失败信息与条目使用 feedback
- Evidence Scope
- 收益依赖 reflection 器能否从轨迹提取可靠经验;错误洞见也可能污染 memory。作者明确指出简短 instruction 适合部分任务。本条核读方法、结果摘要和局限章节,未独立复现,也不把 context 变化称为 weights 学习。 已核验固定版本的相关方法与主要结果;未独立复现。
更新的是可保留的 Playbook 内容;Generator、Reflector、Curator 的外层分工保持既定。Offline 与 Online 设置分别记录,内容累积不自动构成 Curator 演化。
检查原文设置 ↗Online Playbook Adaptation
- Update Target
- Prompt & Context Evolution · Memory Evolution
- Loop Role
- Solver
- Persistence
- Across Tasks
- Recursive Reuse
- Not Demonstrated
- Evidence
- Task Gain
- System Boundary
- Structured Context & Experiential Memory;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 任务 execution trace、成功/失败信息与条目使用 feedback
- Evidence Scope
- 收益依赖 reflection 器能否从轨迹提取可靠经验;错误洞见也可能污染 memory。作者明确指出简短 instruction 适合部分任务。本条核读方法、结果摘要和局限章节,未独立复现,也不把 context 变化称为 weights 学习。 已核验固定版本的相关方法与主要结果;未独立复现。
更新的是可保留的 Playbook 内容;Generator、Reflector、Curator 的外层分工保持既定。Offline 与 Online 设置分别记录,内容累积不自动构成 Curator 演化。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Core Intuition
用一个清楚的视角抓住方法本质。
经验应被存成带身份和使用 feedback 的细粒度条目,而不只是一个每轮重写的长 prompt。将提炼洞见与整理存储分工,再用局部增量合并,可以减少无关知识被覆盖,并控制重复内容的增长。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
Generator 产生任务轨迹,Reflector 从成败中提炼经验,Curator 形成增量条目,再由确定性逻辑合入 context。条目保留标识及帮助/误导计数,通过局部更新、语义去重和 grow-and-refine 控制规模。
沿用 AppWorld 的任务设置作教学演示:Generator 利用 Playbook 执行 API 任务,轨迹暴露某个查询必须分页。Reflector 提取具体错误及建议,Curator 生成增量条目并合并到已有 Playbook。下一个任务读取这条策略,输出回答及新的执行轨迹。原文覆盖 Offline Prompt 与 Online Memory 适应,部署时必须说明哪一种状态会持续保留。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
可把 Playbook 看作条目集合 C,Reflection 产生增量 Δ,Curator 执行合并、修订或删除。集合符号只是解释结构,并非证明每次 Merge 都保持知识正确。整段改写的问题是高损压缩,增量更新则把风险转移到重复、冲突与过期规则;两者都需要独立评价。
Δ_t = Reflect(trajectory_t, feedback_t) C_(t+1) = Curate(C_t, Δ_t) Track: retained facts, contradictions, retrieval cost
Experiments & Claims
Research Question → Experiment → Answer
Question:结构化增量维护是否避免 Context Collapse 并改善适应?→ Experiment:在 Agent 与领域任务比较相关 Context 方法,分析更新方式、泛化及成本。→ Answer:作者报告收益,并展示整段重写造成细节骤失的案例;这支持所测设置中的维护机制,不代表 Context 越长越好。
论文报告在 Agent 与金融 reasoning 任务上分别获得平均 10.6 个百分点与 8.6 个百分点的提升,并展示仅利用 execution feedback、不提供真实标签的适应效果。具体增益随 model、离线/在线设置和任务指标变化。
Takeaways
这篇论文改变了哪些判断?
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:建立包含分页、权限和字段变化的小 API 环境。Day 3–5:比较整段重写、纯追加和增量整理。Day 6–7:修改 API 规则,测事实保留、旧规则撤销、成功率与 Prompt 长度。
Counterexample Design
如何构造有辨识力的反例?
让早期 API 用页码分页,后期改为游标分页,并保持相同函数名。若旧策略被持续保留且压过新反馈,ACE 风格积累就可能比重新开始更差。
Follow-up Research
从缺陷与需求推导新的研究问题。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models · v3 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] MemGPT: Towards LLMs as Operating Systems ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [4] Agent Zero Memory: Provenance-Aware Long-Term Memory for LLM Agents ↗Follow-up 的相关工作核查;晚于原论文的研究仅用于评估提案,不作为作者当时的知识或动机。
