RSI Paper
All PapersRESEARCH NOTE / 2608.04003

PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents

PAST-Bench:保留的经验,真的改善了下一次任务吗?

Shuhan Xue 等

Submitted Verified Version · v1Note Updated
THE QUESTION WORTH READING

在新会话任务中控制是否保留经验,同时检查成绩变化与保存、检索、更新路径,衡量 memory 是否真正带来后续收益。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Framework / Protocol

Update Target
No persistent system target in this setting
Loop Role
Not Applicable
Persistence
Not Applicable
Recursive Reuse
Not Applicable
Evidence
Benchmark Measurement
System Boundary
Cross-Session Experience & Causal Evaluation;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
有序任务序列的评测结果,以及保存、检索和更新经验的过程证据。
Evidence Scope
这是一套经验利用的评测与诊断证据,不能直接证明 Agent 会修改自己的改进算法。场景和任务片段数也不等于所有个人助理任务的覆盖范围;此条目核验摘要,未复现评测或独立检查轨迹。 已核验固定版本的相关方法与主要结果;未独立复现。

Benchmark 通过 Fresh-session 配对测试隔离持久经验,并检查 Save、Retrieve、Update 路径。其 Protocol 提供能力测量,不直接更新被评估 Agent 的 Improver。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

Agent 可以保存偏好、任务历史与工具经验,但保存了内容不等于未来任务变好。研究要区分保留经验带来的收益、系统本身的能力,以及经验是否经由预期路径被实际使用。

Inference

Personal Agent 保存了用户偏好或操作经验,并不说明后续任务真的受益。PAST-Bench 研究如何在 Fresh Session 中隔离持久状态的作用,并检查收益是否经过预期的 Save、Retrieve 与 Update 路径。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

Reflexion 和 CLIN 展示语言经验复用,MemGPT 展示跨 Session 存储。PAST-Bench 将这些机制转成受控评估:同一个后续任务分别允许和禁止访问此前生成的状态。它还检查更新过时信息等能力,避免只用静态记忆问答代表持续学习。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

一个 Agent 第二次答得更好,原因可能是题更容易、Prompt 暗示更多或采样不同。要隔离 Memory 作用,应让两次评估只在是否可访问持久状态上不同。再检查实际写入和读取痕迹,才能区分真正经验复用与答对了但没走预期路径。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

关键在于把经验开关设为可比较的实验条件,并追踪保存、检索、更新的完整路径。本站解读:仅报告最终成功率会混合多种来源的收益,过程证据才能帮助判断 persistent memory 是不是改进原因。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

将任务排成有顺序的新会话序列,在匹配条件下打开或关闭经验保留;覆盖 memory、过程复用、信息收集与更新,分别记录后续收益和经验路径证据,再据诊断对 Agent 循环加入针对性改动。

Inference

沿用其 Update Task Family 作教学演示:Learn Episode 保存一项用户偏好,Update Episode 给出修改;Evaluation 在新 Session 中询问相关任务,并移除显式提醒。两次配对运行使用相同 Prompt、工具和 Seed,仅切换对 Family-produced State 的访问。输出包括任务分差与机制路径证据。具体偏好内容为构造示例。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

对同一个 Task Family,Δ 是 Persistence On 与 Off 的平均分差,再按 Family 和 Capability 做宏平均。Cold Episode 用于初始能力校准,不能拿它替代配对的 Off 条件。作者把配对设计视为强控制,而非完美因果证明,因此还报告 Mechanism Evidence。

Δ_f = S_f(with persistence) − S_f(without persistence)
Overall gain = macro-average across families / capabilities
Cold score is not the matched control
Inference

以某个任务族 f 为例,保留经验时得分 0.7,配对关闭经验时得分 0.5,那么 Δ_f=0.2,即 20 个百分点。之所以配对,是为了让 Prompt、工具与随机性等条件尽量相同,把差异收窄到 Persistence。Macro-Average 再让每个任务族按既定权重贡献,而不由样本最多的任务支配。若历史信息或执行预算仍有未控制差别,Δ_f 就可能混入其他因素;一个正数还需要结合协议检查才能解释。

07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:保留经验是否提高后续表现,路径是否可信?→ Experiment:在多种 Model 和 Agent Framework 上运行配对任务序列,并检查存取更新过程。→ Answer:作者报告收益存在但分布不均,相近的总分差也可能有不同的机制证据。

Paper Claim

论文摘要列出 26 个场景、204 个任务片段,比较七个 foundation model 和四个框架。所提出的改进系统提高了经验保留的平均收益,替换过时状态的任务改善最明显,但效果仍依赖能力类型与 model。

08

Takeaways

这篇论文改变了哪些判断?

Inference

PAST-Bench 最有价值的是分离 Task Gain 与 Memory Pathway。它测量持久经验的基础作用;没有单凭正 Δ 证明生成改进的机制本身越来越强。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是 On/Off 切换只改变目标状态的可用性。残留文件、缓存或额外提示会污染对照;反过来,禁用状态也可能改变工具行为。

Inference

这是一套经验利用的评测与诊断证据,不能直接证明 Agent 会修改自己的改进算法。场景和任务片段数也不等于所有个人助理任务的覆盖范围;此条目核验摘要,未复现评测或独立检查轨迹。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:实现五组 Learn→Update→Fresh Evaluation 序列。Day 3–5:严格复制环境,仅切换状态挂载,记录文件和工具访问。Day 6–7:加入无关状态、错误状态与过期状态对照,分别报告 Δ 和有效路径比例。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

在持久状态中放入错误偏好,同时让 Prompt 表面线索暗示正确答案。如果 Agent 仍答对且从未读取记忆,便能展示 Task Score 不能替代机制证据。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究经验复用的因果可迁移性:将状态在具有不同经历的 Agent 之间交换,检验哪些记忆内容、格式与检索机制共同决定收益。相对 CLIN 的跨任务测试,这可区分经验本身的质量与接收者的利用能力。目标是建立可组合的经验接口,而非只增添更多记忆场景。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents · v1 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] Reflexion: Language Agents with Verbal Reinforcement Learning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] MemGPT: Towards LLMs as Operating Systems ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  4. [4] CLIN: A Continually Learning Language Agent for Rapid Task Adaptation and Generalization ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2608.04003 · v1 / REVIEWED 2026.09.13
返回全部论文