RSI Paper
All PapersRESEARCH NOTE / 2408.08435

Automated Design of Agentic Systems

ADAS:用 Meta-Agent 自动设计 Agent 系统

Shengran Hu、Cong Lu、Jeff Clune

Submitted Verified Version · v2Note Updated
THE QUESTION WORTH READING

Meta-Agent 编写候选 Agent 的代码,用 validation set 评估并维护历史档案,从过去设计中组合出新的 reasoning 与 feedback 流程。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
Architecture Evolution
Loop Role
Solver
Persistence
Across Tasks
Recursive Reuse
Not Demonstrated
Evidence
Task Gain · Held-out Transfer
System Boundary
Agent Code & Workflows;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
validation set 得分、执行错误与历史设计档案
Evidence Scope
实验仍采用人为提供的 model 接口、validation set、基础框架和 search 轮数;代码空间理论上丰富不等于有限预算可遍历全部设计。本条核读方法与实验章节,未复现实验,也未逐项审计生成 Agent。 已核验固定版本的相关方法与主要结果;未独立复现。

固定 Meta-Agent 设计 candidate Agent,archive 向搜索提供历史;论文将 Higher-order ADAS 列为未来方向,不能把 archive 增长当作已证明 Improver 更新。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

Agent 的 prompt、reflection 步骤和工具组合通常依赖人工调试,search 范围又容易被固定模板限制。论文研究能否把完整 Agent 设计写成代码,让另一个 Agent 持续发现可复用且表现更好的结构。

Inference

Agent 的 Prompt、工具调用和协作流程通常由人组合,搜索空间远大于几个常用模板。ADAS 将系统设计本身作为优化对象,希望自动发现人未预先列出的组合。需要解决的实际问题是如何表示候选、如何探索,以及如何防止只在开发集上表现好。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

Promptbreeder 主要在文本 Prompt 空间中演化;STOP 已让程序化 Improver 修改自身。ADAS 的 Meta Agent Search 将目标 Agent 写成代码并积累 Archive,但主实验中的 Meta-Agent 保持固定。自动设计目标系统与更新改进者,是两个独立判断。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

Prompt 改写无法表达所有控制结构,例如分支、循环或多个 Model 的协作。代码具有更强的表示能力,LLM 又已能阅读和修改代码,因此可以把 Agent 写成可执行候选。为了避免每次从零设计,让 Meta-Agent 看到历史实现及成绩,就有机会组合已有有效模式;是否得到可迁移结构仍需隐藏任务验证。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

代码能够同时表达 prompt、条件分支、循环和模块调用,比只改一段 prompt 提供更大的设计空间。历史候选不必立刻成为最优解,也可能作为后续组合的中间材料,因此档案的价值超出保存冠军。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

Meta Agent Search 根据档案生成设计说明和 forward 函数,进行新颖性 reflection,再在验证任务上执行。错误 feedback 触发修复,候选代码与分数写入档案;多轮 search 后,在保留测试集及跨 model 任务上评估。

Inference

沿用原文 ARC 推理任务:输入是任务样例和初始 Agent Archive;Meta-Agent 读取已有方案及评估结果,编写新的 forward 实现,组合分解、生成或检查等调用;执行候选并将源码和成绩加入 Archive。输出是可用于后续题目的目标 Agent。整个搜索循环使用固定 Meta-Agent,Archive 中目标 Agent 的增强没有自动接管搜索器。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

可用 Black-box Optimization 理解:A 是 Agent 程序,J(A) 是开发任务上的平均得分,搜索器试图找到更大的 J。代码的表达能力大,不代表有限预算能搜索到任意算法。每增加一种控制结构,都可能增加无效程序与评估成本,因此 Search Space、Search Algorithm 和 Evaluator 必须共同讨论。

A* ≈ argmax_(A∈SearchSpace) J_dev(A)
A_next = MetaAgent(archive, feedback)
Evaluate A* separately on held-out tasks
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:自动发现的 Agent 是否优于手工设计并能迁移?→ Experiment:在 ARC 与多种推理任务搜索,比较人工架构,并测试跨任务、跨 Model 使用。→ Answer:作者报告自动设计收益及一定迁移;结果依赖初始模块、评估预算和所用 Foundation Models。

Paper Claim

作者报告在阅读理解、数学、科学等任务上超过所比较的人工设计 baseline,并观察到部分跨任务及跨 model 迁移。正文同时指出不同领域增益并不相同,foundation model 知识不足会限制结构 search 带来的提升。

08

Takeaways

这篇论文改变了哪些判断?

Inference

ADAS 给出了清楚的自动设计问题分解。读者应把“代码空间理论上能表达什么”与“实验预算实际发现什么”分开,也要检查优化器是否真的被更新。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是开发集能够奖励可迁移的结构。复杂 Workflow 可能通过更多调用或对题型的偶然适配取胜,架构本身未必优于更简单的同预算基线。

Inference

实验仍采用人为提供的 model 接口、validation set、基础框架和 search 轮数;代码空间理论上丰富不等于有限预算可遍历全部设计。本条核读方法与实验章节,未复现实验,也未逐项审计生成 Agent。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:定义一个允许顺序、并行和检查调用的小型代码空间。Day 3–5:在 30 道开发题上搜索十个候选,设统一 Token Budget。Day 6–7:在隐藏题和另一 Model 上复测,比较简单 Best-of-N 与自动架构。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

开发题全部适合先分解再回答,隐藏题包含必须整体推理的问题。如果搜索得到的固定分解流程在隐藏集退步,就能说明任务分布塑造了架构,而非发现了通用设计原则。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究 Architecture 的最小不变量:对发现的代码进行模块删除、替换和重排,寻找跨 Model、跨任务仍决定收益的结构。相对 Promptbreeder 的文本演化,目标是发现可证伪的控制结构规律。若收益完全跟随调用次数,结构规律假设就应被放弃。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] Automated Design of Agentic Systems · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2408.08435 · v2 / REVIEWED 2026.09.13
返回全部论文