AlphaEvolve: A coding agent for scientific and algorithmic discovery
AlphaEvolve:用可验证 feedback 演化算法与计算基础设施
LLM 生成程序变体,自动 evaluator 执行并验证,程序数据库保留可用于后续 search 的候选,覆盖数学发现与工程优化。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Main Method
- Update Target
- No persistent system target in this setting
- Loop Role
- Solver
- Persistence
- Across Improvement Rounds
- Recursive Reuse
- Not Demonstrated
- Evidence
- Task Gain
- System Boundary
- Algorithm Code & Computing Infrastructure;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 自动正确性检查、运行性能与多目标评价
- Evidence Scope
- 核验 arXiv 摘要、方法和工程案例相关章节,未复现内部部署或通读全部白皮书。任务目标和自动 evaluator 仍由研究者定义;加速 foundation model 的训练基础设施,不等于已经自动再训练并接替多代发现 Agent。 已核验固定版本的相关方法与主要结果;未独立复现。
主要实验改进外部 candidate programs;程序数据库复用不等同 AlphaEvolve 自身的 Improver 变强。基础设施回流应单独核验。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Core Intuition
用一个清楚的视角抓住方法本质。
model 负责提出有创造性的变体,evaluator 负责判定正确性和性能,演化过程则决定哪些程序进入未来 prompt。将提案与验证分工,使生成错误不必直接变成被接受的发现,并支持多目标 search。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
prompt 采样器从程序数据库组织历史候选,由 Gemini model 组合提出代码修改;自动 evaluator 检查、运行并打分,数据库通过演化选择保留有价值的程序,再 feedback 给下一轮生成与改写过程。
原文包括矩阵乘法算法与基础设施优化。沿用矩阵乘法任务:输入初始算法程序、允许修改区和评价函数;LLM 提议代码变化,先做低成本正确性检查,再评价有效运算或性能;数据库保存源码与多个分数,下一轮抽取候选及历史提示继续搜索。输出是经指定验证的算法,而非自动更新后的 Foundation Model。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
外层是程序空间搜索,内层评价可以包含正确性与资源指标。Evaluation Cascade 的直觉是先用便宜的必要条件过滤,再投入更贵的充分检查。通过有限测试只支持测试范围内正确;若某项数学结果有独立证明,应明确使用的是证明而非经验评分。数据库多样性帮助探索,却不提供全局最优保证。
Candidate program → cheap checks → expensive evaluation Store (code, correctness evidence, performance metrics) Selection reuses evaluated programs under a fixed pipeline
Experiments & Claims
Research Question → Experiment → Answer
Question:这种搜索能否产生有实际价值的算法?→ Experiment:在数学问题、调度、硬件与训练组件等具体任务验证候选,并与既有实现比较。→ Answer:白皮书报告多种发现;不同应用的验证方式和资源条件不同,不应把一个案例的效率收益推广到全部任务。
论文报告用 48 次标量乘法完成复数 4×4 矩阵乘法的算法。在训练工程案例中,所发现的启发式在目标内核集合上平均提速 23%,对应总体训练时间减少约 1%;内核速度、训练时间和 model 能力是不同指标。
Takeaways
这篇论文改变了哪些判断?
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:选择一个小型数值或组合优化函数,写独立正确性测试。Day 3–5:进行有预算的代码演化,比较只采样与带数据库选择。Day 6–7:在未见输入和另一运行配置重测,并报告整个搜索成本。
Counterexample Design
如何构造有辨识力的反例?
训练评价只包含小矩阵,隐藏测试加入病态数值与不同尺寸。若候选利用固定尺寸或低精度捷径而失败,就能定位可执行评分与普遍正确性的差距。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] AlphaEvolve: A coding agent for scientific and algorithmic discovery · v1 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] FunBO: Discovering Acquisition Functions for Bayesian Optimization with FunSearch ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
