AFlow: Automating Agentic Workflow Generation
AFlow:通过 tree search 自动生成 Agent workflow
把 workflow 优化写成代码空间 search,用 Monte Carlo tree search 的变体组织候选、execution feedback 和修改经验,减少人工编排。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Main Method
- Update Target
- Architecture Evolution
- Loop Role
- Solver
- Persistence
- Across Tasks
- Recursive Reuse
- Not Demonstrated
- Evidence
- Task Gain
- System Boundary
- Workflow Structure & Prompts;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 任务执行成绩与树结构修改经验
- Evidence Scope
- 自动化发生在人工指定的任务、算子、评价函数和 search 预算内;主要实验并未同时 search model weights 或评测标准。文中的低 reasoning 费用比较也不应自动解释成包含离线 search 成本的全部生命周期成本。 已核验固定版本的相关方法与主要结果;未独立复现。
更新可跨任务使用的 Workflow 节点及控制结构;MCTS、候选生成器与外部评分流程保持固定。历史树增长本身不构成 Improver 更新证据。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Core Intuition
用一个清楚的视角抓住方法本质。
workflow 可以视作 model 调用节点与代码表达的连接关系。将 search 历史保存成树,能够从多个有潜力的候选继续扩展;将常见操作组成算子,则可为巨大代码空间提供便于 search 的先验结构。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
AFlow 循环执行候选选择、LLM 代码扩展、workflow 执行评价和经验回传,使用 MCTS 变体平衡探索与利用。search 在给定算子集合内推进,到预算上限或满足收敛条件时选择表现较好的 workflow。
沿用论文 Coding Workflow 的任务类型作演示:初始流程直接生成代码;一次扩展加入 Test 或 Review 节点,执行后得到反馈;搜索器将新节点的成绩与父流程关联,再决定继续扩展哪条分支。输出是经过选择的 Workflow 程序,之后用于隐藏任务。具体节点组合是教学例,真实候选以原文发现的 Workflow 为准。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
MCTS 的直觉是不能总选目前均值最高的分支,因为试验少的分支还不确定。常见 UCB 写法把平均收益 Q 与探索奖励相加;n 小时探索项大,n 增长后下降。下面是帮助理解的通用公式,不等同于 AFlow 全部实现细节。实际论文还定义了选择、扩展、评价和回传过程。
Illustrative UCB: score = Q + c·√[log(N)/n] Q: observed mean reward; n: branch visits N: parent visits; c: exploration weight
UCB 中 Q 是已观察到的平均收益,后面的项给探索不足的分支加分。假设两个分支 Q 相同,访问次数 n 较小的分支会得到更大的探索加分;访问逐渐增多后,加分缩小,选择越来越依赖观察结果。参数 c 控制探索意愿。这解释了 Tree Search 为什么可能暂时探索当前不领先的方案。此式是通用 UCB 教学表达,AFlow 的具体节点选择和扩展机制仍需以原文算法为准。
Experiments & Claims
Research Question → Experiment → Answer
Question:基于执行反馈的结构搜索能否得到更好 Workflow?→ Experiment:在多个 Benchmark 比较人工与自动工作流,并分析成本、模型组合及搜索组件。→ Answer:作者报告平均收益和部分低成本配置;不同模型与任务的具体成本不能从平均值直接推导。
论文摘要报告六个数据集上相对比较 baseline 平均提升 5.7%,并展示小 model 配合优化流程的成本优势。这些结果支持 workflow search 的实用价值,但具体优势依赖任务、执行 model 与所比较的流程。
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:构造包含 Generate、Review、Test 三类节点的小空间。Day 3–5:比较树形搜索与等预算随机搜索。Day 6–7:每个最佳候选多次重跑,报告均值、方差、调用成本与隐藏任务结果。
Counterexample Design
如何构造有辨识力的反例?
设置两个单独加入都会降分、一起加入才有效的模块。若搜索反复淘汰两个中间分支而找不到组合,就能验证局部回报对强交互结构的局限。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] AFlow: Automating Agentic Workflow Generation · v4 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] Automated Design of Agentic Systems ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] Large Language Models as Optimizers ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
