RSI Paper
All PapersRESEARCH NOTE / 2310.08560

MemGPT: Towards LLMs as Operating Systems

MemGPT:让有限 context 拥有可管理的 long-term memory

Charles Packer 等

Submitted Verified Version · v2Note Updated
THE QUESTION WORTH READING

通过分层存储、memory 读写和 control flow,让固定 context model 处理长期对话与超出窗口的文档。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
Memory Evolution
Loop Role
Solver
Persistence
Across Tasks
Recursive Reuse
Not Demonstrated
Evidence
Task Gain
System Boundary
Context & External Memory;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
memory 函数执行结果、容量预警、用户新信息与检索结果。
Evidence Scope
系统 instruction、函数接口和队列管理规则由设计者提供,model 能改变 memory 内容,不能据此推定它优化了管理算法。检索成功也不等于 memory 真实,长期存储的完整性与长期 reasoning 可靠性仍需分别评价。 已核验固定版本的相关方法与主要结果;未独立复现。

Working Context 与外部 Memory 可写并跨 Session 使用;固定的存储层、控制规则和函数接口未被该方法自动重新设计。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

长对话和大型文档会超过 model 的 context 容量,直接截断又会丢失用户偏好与早期事实。论文研究能否把信息保存在外部,并让 model 按需调入当前窗口,使连续交互不必总从头开始。

Inference

长期对话与大文档会超过 Context Window。把所有历史塞进 Prompt 不可行,盲目截断又会丢掉用户偏好或关键证据。MemGPT 研究固定窗口中的 Model 如何主动管理不同存储层,让有限的即时输入连接到更长的交互历史。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

Generative Agents 已使用 Memory Stream 与检索支持长期行为。MemGPT 借用操作系统的分层存储思想,区分当前可读 Context 与外部存储,并通过 Function Calls 控制信息搬运。它改变信息的可访问方式,没有把 Base Model 的物理窗口扩展为无限长度。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

计算机的 RAM 有限,却能通过磁盘和 Paging 处理更大的数据。LLM 也有类似约束:外部数据库里有信息,不等于当前推理能看到。由此可把 Context 看作稀缺工作区,让系统显式决定哪些事实留下、哪些历史外置,以及何时检索回来。Memory 管理本身于是成为 Agent 的动作。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

可供保存的信息量与一次 reasoning 能访问的信息量可以分开设计。MemGPT 将 context 视为稀缺工作区,由 model 主动决定记住什么、检索什么;编辑理解是,长期 Agent 首先需要可靠保留经验的基础设施。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

系统把输入分为只读 instruction、可写工作 memory 与消息队列,另设历史和归档存储。model 以 function calling 读写与检索,队列管理器在容量不足时清理并摘要,连续调用机制支持多步取回信息再作答。

Inference

沿用多轮对话任务作教学演示:用户早先说自己吃素,许多轮后询问晚餐。Model 把偏好写入可修改的 Working Context;更详细的旧对话保存在 Recall Storage。之后若需要确认具体过敏信息,它调用检索,将结果移入当前 Context,再回答。输入是新消息与有限工作区,输出既包括回答,也可能包括写入或检索操作。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

这篇工作主要是系统设计,没有需要照搬的收敛推导。设窗口预算为 B,System Instructions、Working Context 和 FIFO Queue 占用之和不能超过 B。外部记忆的容量可以更大,但检索结果仍要进入这同一个预算。因而长期记忆能力取决于写入、压缩和检索的联合决策,存储容量增长本身无法保证召回率。

tokens(system) + tokens(working context) + tokens(queue) ≤ B
External storage → retrieval → main context → LLM
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:主动分层管理是否改善超窗口任务?→ Experiment:在多 Session 对话和文档分析中,比较记忆管理系统与受限 Context 的基础设置。→ Answer:作者报告长期信息利用收益,但依赖模型正确调用 Memory Functions,且检索与压缩仍可能失误。

Paper Claim

作者在长对话和文档分析任务中报告优于固定 context baseline 的表现,并展示嵌套键值检索。收益说明外部存储可以缓解窗口限制;论文没有把它转换为 foundation model 参数更新或多代 improver 增强的结果。

08

Takeaways

这篇论文改变了哪些判断?

Inference

MemGPT 的学习载体是保留的 Memory Content;控制规则和函数接口主要由设计者提供。判断它的价值,应看跨 Session 的可用信息与错误率,而非只看数据库存了多少文字。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是 Model 能及时意识到自己缺少信息。错误地认为已经记住,或把新信息压缩到错误的旧事实里,都可能让检索根本不会发生。

Inference

系统 instruction、函数接口和队列管理规则由设计者提供,model 能改变 memory 内容,不能据此推定它优化了管理算法。检索成功也不等于 memory 真实,长期存储的完整性与长期 reasoning 可靠性仍需分别评价。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:构造跨十个 Session 的偏好与事件对话。Day 3–5:比较 FIFO 截断、固定检索与主动 Memory Calls,限制相同 Context Budget。Day 6–7:加入偏好变更,测 Recall、过期事实使用率和检索成本。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

用户先喜欢咖啡,后来因健康原因不再饮用。让旧偏好出现多次、新偏好只出现一次。若系统压缩后仍推荐咖啡,就能展示出现频率和语义相关性无法替代时间有效性。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Prior Work

后续相关工作 Agent Zero Memory 已为长期记忆设计来源与证据追踪。给记忆增加来源、时间或引用本身已有直接先例。

Hypothesis

研究带撤销语义的长期记忆:每个事实记录有效时间、来源和替代关系,系统能说明旧结论为何失效。相对 Generative Agents 的检索评分,这要求把记忆作为可修订的证据集合。关键实验应检验冲突信息传播和撤销后的行为恢复,而非只增加事实召回。 更值得检验的问题是多条依赖记录在冲突更新后如何一致地撤销:构造一个错误上游事实影响多个策略的场景,比较仅检索来源与显式依赖事务的恢复行为,要求恢复下游决策且保留不受影响的知识。这里的新颖性主张仅是待验证的研究方向。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] MemGPT: Towards LLMs as Operating Systems · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] Generative Agents: Interactive Simulacra of Human Behavior ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Agent Zero Memory: Provenance-Aware Long-Term Memory for LLM Agents ↗Follow-up 的相关工作核查;晚于原论文的研究仅用于评估提案,不作为作者当时的知识或动机。
arXiv:2310.08560 · v2 / REVIEWED 2026.09.13
返回全部论文