RSI Paper
All PapersRESEARCH NOTE / 2506.13131
Method

AlphaEvolve: A coding agent for scientific and algorithmic discovery

AlphaEvolve:用可验证 feedback 演化算法与计算基础设施

Alexander Novikov 等

Submitted Verified Version · v1Note Updated
THE QUESTION WORTH READING

LLM 生成程序变体,自动 evaluator 执行并验证,程序数据库保留可用于后续 search 的候选,覆盖数学发现与工程优化。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
No persistent system target in this setting
Loop Role
Solver
Persistence
Across Improvement Rounds
Recursive Reuse
Not Demonstrated
Evidence
Task Gain
System Boundary
Algorithm Code & Computing Infrastructure;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
自动正确性检查、运行性能与多目标评价
Evidence Scope
核验 arXiv 摘要、方法和工程案例相关章节,未复现内部部署或通读全部白皮书。任务目标和自动 evaluator 仍由研究者定义;加速 foundation model 的训练基础设施,不等于已经自动再训练并接替多代发现 Agent。 已核验固定版本的相关方法与主要结果;未独立复现。

主要实验改进外部 candidate programs;程序数据库复用不等同 AlphaEvolve 自身的 Improver 变强。基础设施回流应单独核验。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

复杂数学和计算工程问题的解空间巨大,单次代码生成难以找到超越专家优化的算法。论文研究如何把 language model 的程序建议与反复执行评价结合,在可测量目标上持续改进候选解决方案。

Inference

许多科学和工程问题能写成程序并自动评估,但好算法仍依赖大量创造性搜索。AlphaEvolve 研究将 LLM 的代码生成与演化数据库、分级评价和并行计算结合,用反复可执行验证筛选候选。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

FunBO 利用代码搜索发现 Acquisition Functions,STOP 研究改进 Improver。AlphaEvolve 主要搜索给定任务的算法源码,具有更广的任务与工程应用。优化训练基础设施可能间接帮助后续模型,但原报告未展示这些收益自动闭合成下一代研究者继续改进自己的完整链条。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

LLM 能提出人可读的程序变体,但单次提案可靠性不足。自动执行器能快速拒绝错误,数据库能保留互补实现,分级测试则可把昂贵评估留给有希望的候选。由此将创造性提案与确定性核验分工,再用演化选择累积有用改动。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

model 负责提出有创造性的变体,evaluator 负责判定正确性和性能,演化过程则决定哪些程序进入未来 prompt。将提案与验证分工,使生成错误不必直接变成被接受的发现,并支持多目标 search。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

prompt 采样器从程序数据库组织历史候选,由 Gemini model 组合提出代码修改;自动 evaluator 检查、运行并打分,数据库通过演化选择保留有价值的程序,再 feedback 给下一轮生成与改写过程。

Inference

原文包括矩阵乘法算法与基础设施优化。沿用矩阵乘法任务:输入初始算法程序、允许修改区和评价函数;LLM 提议代码变化,先做低成本正确性检查,再评价有效运算或性能;数据库保存源码与多个分数,下一轮抽取候选及历史提示继续搜索。输出是经指定验证的算法,而非自动更新后的 Foundation Model。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

外层是程序空间搜索,内层评价可以包含正确性与资源指标。Evaluation Cascade 的直觉是先用便宜的必要条件过滤,再投入更贵的充分检查。通过有限测试只支持测试范围内正确;若某项数学结果有独立证明,应明确使用的是证明而非经验评分。数据库多样性帮助探索,却不提供全局最优保证。

Candidate program → cheap checks → expensive evaluation
Store (code, correctness evidence, performance metrics)
Selection reuses evaluated programs under a fixed pipeline
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:这种搜索能否产生有实际价值的算法?→ Experiment:在数学问题、调度、硬件与训练组件等具体任务验证候选,并与既有实现比较。→ Answer:白皮书报告多种发现;不同应用的验证方式和资源条件不同,不应把一个案例的效率收益推广到全部任务。

Paper Claim

论文报告用 48 次标量乘法完成复数 4×4 矩阵乘法的算法。在训练工程案例中,所发现的启发式在目标内核集合上平均提速 23%,对应总体训练时间减少约 1%;内核速度、训练时间和 model 能力是不同指标。

08

Takeaways

这篇论文改变了哪些判断?

Inference

AlphaEvolve 强调可执行评价与搜索基础设施的结合。论文的外部算法发现证据很强地依赖 Evaluator 设计,是否构成递归改进还要看新算法被谁、以什么方式重新使用。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是自动评价覆盖了真正需求。程序可以对固定输入、硬件或数值精度过拟合,尤其当搜索次数很多时,微小评价漏洞也可能被放大。

Inference

核验 arXiv 摘要、方法和工程案例相关章节,未复现内部部署或通读全部白皮书。任务目标和自动 evaluator 仍由研究者定义;加速 foundation model 的训练基础设施,不等于已经自动再训练并接替多代发现 Agent。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:选择一个小型数值或组合优化函数,写独立正确性测试。Day 3–5:进行有预算的代码演化,比较只采样与带数据库选择。Day 6–7:在未见输入和另一运行配置重测,并报告整个搜索成本。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

训练评价只包含小矩阵,隐藏测试加入病态数值与不同尺寸。若候选利用固定尺寸或低精度捷径而失败,就能定位可执行评分与普遍正确性的差距。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究 Evaluator 的共同发现:搜索器提出算法时,也提出最可能让它失败的输入族,由独立验证器将反例固化为可复用规范。相对 FunBO 的固定目标函数集合,这让搜索积累的是问题结构的可检验证据。需要控制评估器变化,保留固定外部测试以防指标漂移。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] AlphaEvolve: A coding agent for scientific and algorithmic discovery · v1 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] FunBO: Discovering Acquisition Functions for Bayesian Optimization with FunSearch ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2506.13131 · v1 / REVIEWED 2026.09.13
返回全部论文