Automated Design of Agentic Systems
ADAS:用 Meta-Agent 自动设计 Agent 系统
Meta-Agent 编写候选 Agent 的代码,用 validation set 评估并维护历史档案,从过去设计中组合出新的 reasoning 与 feedback 流程。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Main Method
- Update Target
- Architecture Evolution
- Loop Role
- Solver
- Persistence
- Across Tasks
- Recursive Reuse
- Not Demonstrated
- Evidence
- Task Gain · Held-out Transfer
- System Boundary
- Agent Code & Workflows;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- validation set 得分、执行错误与历史设计档案
- Evidence Scope
- 实验仍采用人为提供的 model 接口、validation set、基础框架和 search 轮数;代码空间理论上丰富不等于有限预算可遍历全部设计。本条核读方法与实验章节,未复现实验,也未逐项审计生成 Agent。 已核验固定版本的相关方法与主要结果;未独立复现。
固定 Meta-Agent 设计 candidate Agent,archive 向搜索提供历史;论文将 Higher-order ADAS 列为未来方向,不能把 archive 增长当作已证明 Improver 更新。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Research Problem & Background
问题为什么重要,解决它有什么价值?
Agent 的 prompt、reflection 步骤和工具组合通常依赖人工调试,search 范围又容易被固定模板限制。论文研究能否把完整 Agent 设计写成代码,让另一个 Agent 持续发现可复用且表现更好的结构。
Agent 的 Prompt、工具调用和协作流程通常由人组合,搜索空间远大于几个常用模板。ADAS 将系统设计本身作为优化对象,希望自动发现人未预先列出的组合。需要解决的实际问题是如何表示候选、如何探索,以及如何防止只在开发集上表现好。
Core Intuition
用一个清楚的视角抓住方法本质。
代码能够同时表达 prompt、条件分支、循环和模块调用,比只改一段 prompt 提供更大的设计空间。历史候选不必立刻成为最优解,也可能作为后续组合的中间材料,因此档案的价值超出保存冠军。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
Meta Agent Search 根据档案生成设计说明和 forward 函数,进行新颖性 reflection,再在验证任务上执行。错误 feedback 触发修复,候选代码与分数写入档案;多轮 search 后,在保留测试集及跨 model 任务上评估。
沿用原文 ARC 推理任务:输入是任务样例和初始 Agent Archive;Meta-Agent 读取已有方案及评估结果,编写新的 forward 实现,组合分解、生成或检查等调用;执行候选并将源码和成绩加入 Archive。输出是可用于后续题目的目标 Agent。整个搜索循环使用固定 Meta-Agent,Archive 中目标 Agent 的增强没有自动接管搜索器。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
可用 Black-box Optimization 理解:A 是 Agent 程序,J(A) 是开发任务上的平均得分,搜索器试图找到更大的 J。代码的表达能力大,不代表有限预算能搜索到任意算法。每增加一种控制结构,都可能增加无效程序与评估成本,因此 Search Space、Search Algorithm 和 Evaluator 必须共同讨论。
A* ≈ argmax_(A∈SearchSpace) J_dev(A) A_next = MetaAgent(archive, feedback) Evaluate A* separately on held-out tasks
Experiments & Claims
Research Question → Experiment → Answer
Question:自动发现的 Agent 是否优于手工设计并能迁移?→ Experiment:在 ARC 与多种推理任务搜索,比较人工架构,并测试跨任务、跨 Model 使用。→ Answer:作者报告自动设计收益及一定迁移;结果依赖初始模块、评估预算和所用 Foundation Models。
作者报告在阅读理解、数学、科学等任务上超过所比较的人工设计 baseline,并观察到部分跨任务及跨 model 迁移。正文同时指出不同领域增益并不相同,foundation model 知识不足会限制结构 search 带来的提升。
Takeaways
这篇论文改变了哪些判断?
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:定义一个允许顺序、并行和检查调用的小型代码空间。Day 3–5:在 30 道开发题上搜索十个候选,设统一 Token Budget。Day 6–7:在隐藏题和另一 Model 上复测,比较简单 Best-of-N 与自动架构。
Counterexample Design
如何构造有辨识力的反例?
开发题全部适合先分解再回答,隐藏题包含必须整体推理的问题。如果搜索得到的固定分解流程在隐藏集退步,就能说明任务分布塑造了架构,而非发现了通用设计原则。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] Automated Design of Agentic Systems · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
