RSI Paper
All PapersRESEARCH NOTE / 2305.16291

Voyager: An Open-Ended Embodied Agent with Large Language Models

Voyager:把一次次探索积累成 skill

Guanzhi Wang 等

Submitted Verified Version · v2Note Updated
THE QUESTION WORTH READING

结合自动 curriculum、可复用代码 skill library 与 environment feedback,让 Minecraft Agent 在探索中不断扩展能力。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
Memory Evolution · Tool & Skill Evolution
Loop Role
Solver
Persistence
Across Tasks
Recursive Reuse
Not Demonstrated
Evidence
Task Gain · Held-out Transfer
System Boundary
Skills & Memory;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
Minecraft environment feedback、程序执行错误与 model 自我验证共同指导程序修订;成功程序进入 skill library。
Evidence Scope
改进主要保存在 skill library 和 context 中,不涉及 foundation model 参数更新。 已核验固定版本的相关方法与主要结果;未独立复现。

成功代码进入 Skill Library,供后续任务调用;Curriculum 与技能生成流程保持既定设计。技能积累和跨世界迁移不单独证明改进器配置被更新。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

开放环境中的 Agent,怎样保留并复用过去学到的行为?

Inference

开放环境中的任务互相依赖:获得工具后才能采集更高级资源。若每次都从原始动作重新推理,Context 和尝试预算很快耗尽。Voyager 研究如何让固定 LLM 持续探索,同时把已经成功的行为保存为可执行 Skill,降低之后解决复杂任务的成本。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

ReAct 提供交互式推理与行动;Reflexion 将失败总结保存为语言记忆。Voyager 在这些能力背景下进一步强调可运行的 Skill Library 和自动 Curriculum。语言总结告诉系统注意什么,可执行 Skill 则能直接调用一段长行为序列,两者的验证和复用方式不同。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

从 Minecraft 的 Tech Tree 推起:复杂目标可以由较小目标组合,而已完成的小目标往往无需重新设计。程序恰好能封装这种可重用行为。若再根据库存、已完成任务和失败记录选择下一目标,就能让探索难度随可用工具变化。这里仍需验证 Library 中的技能在新环境中是否保持有效。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

Voyager 把成功经验存为可执行代码 skill,使学习成果能被检索、组合并用于后续探索。自动 curriculum 负责决定下一步学什么,skill library 负责保留已学内容;model 能力与系统能力由此可以分开观察,后者能在不更新参数时持续积累。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

自动选择探索任务,将成功行为存为可执行 skill,并通过 execution feedback 迭代修正程序。

Inference

沿用原文采矿任务:Curriculum 根据库存提出获取资源的目标;系统检索相关技能代码,生成新的采集程序,执行后读取环境结果、错误与 Self-Verification。成功程序及其描述进入向量索引。后续更复杂目标可检索并调用它。输出包括实际获得的资源和新 Skill;原文还把已有 Library 带到新 Minecraft World 检验复用。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

没有关于开放探索必然持续的定理。核心数据结构可写为描述 Embedding 到代码的映射。检索时用 Query 与每个描述的向量相似度选 Top-k,Model 再据此组合程序。相似度只是候选选择依据,不能保证前置条件满足;库存、地形和环境版本仍决定技能能否执行。

Library = {(embedding(descriptionᵢ), codeᵢ)}
Retrieved = Top-kᵢ similarity(query, descriptionᵢ)
New skill = Generate(task, state, Retrieved, feedback)
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:Curriculum、Skill Library 和反馈修订是否帮助开放探索?→ Experiment:比较物品获取、探索范围、里程碑速度,做组件消融,并在新世界复用技能。→ Answer:作者报告组件组合带来收益和一定迁移;这些指标测量游戏环境内的能力积累,没有单独证明 Skill Generator 自身的改进策略被更新。

Paper Claim

论文报告更丰富的物品发现与更快的里程碑达成,并展示 skill library 在新世界中的迁移。

08

Takeaways

这篇论文改变了哪些判断?

Inference

Voyager 展示了不改变 Weights 也能积累可复用能力。Library 的增长是明确的持久更新;固定检索、生成与评价流程是否变得更善于改进,需要另行测量。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是成功一次的程序可以作为通用 Skill。隐含前置条件可能没有进入描述:同一个采矿函数在工具不足、地形不同或资源缺失时会失败,组合多个技能还会放大这些问题。

Inference

改进主要保存在 skill library 和 context 中,不涉及 foundation model 参数更新。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:用可重置的小型环境实现采集、制作和移动任务。Day 3–5:对比保存可执行 Skill 与只保留文本经验,匹配行动预算。Day 6–7:改变初始资源和地图,测新任务完成率、无效调用率及每个 Skill 的复用次数。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

让两个地图具有相同资源描述,却要求相反的前置动作。若描述相似的 Skill 被反复检索并失败,而从头规划能成功,就能检验语义相似度对行为可迁移性的不足。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究自动发现 Skill 的适用边界:执行成功后主动改变环境条件,学习何时技能仍有效,再让 Curriculum 专门探索边界未知的组合。相对 Reflexion 的事后总结,这将经验获取目标变成可复用技能的适用域识别。关键指标应是组合成功率和错误迁移减少量,不能只数 Library 条目。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] Voyager: An Open-Ended Embodied Agent with Large Language Models · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] ReAct: Synergizing Reasoning and Acting in Language Models ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Reflexion: Language Agents with Verbal Reinforcement Learning ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2305.16291 · v2 / REVIEWED 2026.09.13
返回全部论文