PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents
PAST-Bench:保留的经验,真的改善了下一次任务吗?
在新会话任务中控制是否保留经验,同时检查成绩变化与保存、检索、更新路径,衡量 memory 是否真正带来后续收益。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Framework / Protocol
- Update Target
- No persistent system target in this setting
- Loop Role
- Not Applicable
- Persistence
- Not Applicable
- Recursive Reuse
- Not Applicable
- Evidence
- Benchmark Measurement
- System Boundary
- Cross-Session Experience & Causal Evaluation;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 有序任务序列的评测结果,以及保存、检索和更新经验的过程证据。
- Evidence Scope
- 这是一套经验利用的评测与诊断证据,不能直接证明 Agent 会修改自己的改进算法。场景和任务片段数也不等于所有个人助理任务的覆盖范围;此条目核验摘要,未复现评测或独立检查轨迹。 已核验固定版本的相关方法与主要结果;未独立复现。
Benchmark 通过 Fresh-session 配对测试隔离持久经验,并检查 Save、Retrieve、Update 路径。其 Protocol 提供能力测量,不直接更新被评估 Agent 的 Improver。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Core Intuition
用一个清楚的视角抓住方法本质。
关键在于把经验开关设为可比较的实验条件,并追踪保存、检索、更新的完整路径。本站解读:仅报告最终成功率会混合多种来源的收益,过程证据才能帮助判断 persistent memory 是不是改进原因。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
将任务排成有顺序的新会话序列,在匹配条件下打开或关闭经验保留;覆盖 memory、过程复用、信息收集与更新,分别记录后续收益和经验路径证据,再据诊断对 Agent 循环加入针对性改动。
沿用其 Update Task Family 作教学演示:Learn Episode 保存一项用户偏好,Update Episode 给出修改;Evaluation 在新 Session 中询问相关任务,并移除显式提醒。两次配对运行使用相同 Prompt、工具和 Seed,仅切换对 Family-produced State 的访问。输出包括任务分差与机制路径证据。具体偏好内容为构造示例。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
对同一个 Task Family,Δ 是 Persistence On 与 Off 的平均分差,再按 Family 和 Capability 做宏平均。Cold Episode 用于初始能力校准,不能拿它替代配对的 Off 条件。作者把配对设计视为强控制,而非完美因果证明,因此还报告 Mechanism Evidence。
Δ_f = S_f(with persistence) − S_f(without persistence) Overall gain = macro-average across families / capabilities Cold score is not the matched control
以某个任务族 f 为例,保留经验时得分 0.7,配对关闭经验时得分 0.5,那么 Δ_f=0.2,即 20 个百分点。之所以配对,是为了让 Prompt、工具与随机性等条件尽量相同,把差异收窄到 Persistence。Macro-Average 再让每个任务族按既定权重贡献,而不由样本最多的任务支配。若历史信息或执行预算仍有未控制差别,Δ_f 就可能混入其他因素;一个正数还需要结合协议检查才能解释。
Experiments & Claims
Research Question → Experiment → Answer
Question:保留经验是否提高后续表现,路径是否可信?→ Experiment:在多种 Model 和 Agent Framework 上运行配对任务序列,并检查存取更新过程。→ Answer:作者报告收益存在但分布不均,相近的总分差也可能有不同的机制证据。
论文摘要列出 26 个场景、204 个任务片段,比较七个 foundation model 和四个框架。所提出的改进系统提高了经验保留的平均收益,替换过时状态的任务改善最明显,但效果仍依赖能力类型与 model。
Takeaways
这篇论文改变了哪些判断?
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:实现五组 Learn→Update→Fresh Evaluation 序列。Day 3–5:严格复制环境,仅切换状态挂载,记录文件和工具访问。Day 6–7:加入无关状态、错误状态与过期状态对照,分别报告 Δ 和有效路径比例。
Counterexample Design
如何构造有辨识力的反例?
在持久状态中放入错误偏好,同时让 Prompt 表面线索暗示正确答案。如果 Agent 仍答对且从未读取记忆,便能展示 Task Score 不能替代机制证据。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents · v1 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] Reflexion: Language Agents with Verbal Reinforcement Learning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] MemGPT: Towards LLMs as Operating Systems ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [4] CLIN: A Continually Learning Language Agent for Rapid Task Adaptation and Generalization ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
