RSI Paper
All PapersRESEARCH NOTE / 2408.06292
Method

The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery

AI Scientist:从研究想法到实验与论文的自动化闭环

Chris Lu、Cong Lu 等

Submitted Verified Version · v3Note Updated
THE QUESTION WORTH READING

从给定代码模板出发,自动提出想法、检索文献、改代码、跑实验、写论文并生成模拟评审,将发现写入研究档案。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Main Method

Update Target
No persistent system target in this setting
Loop Role
Experience Generator · Proposer
Persistence
Across Improvement Rounds
Recursive Reuse
Not Demonstrated
Evidence
Feasibility Demonstration
System Boundary
Research Workflow & Idea Archive;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
实验日志、文献检索与 model 生成的评审
Evidence Scope
原论文依赖人工提供的研究方向、初始模板和评价流程;示范主要是小规模 machine learning 实验。自动评审有偏差,写作也可能错误解释数据。本条核读方法、案例与局限材料,未复核全部生成论文。 已核验固定版本的相关方法与主要结果;未独立复现。

科研假设、实验代码和 manuscript 是输出产物;自动做研究不等同研究 Agent 更新自己的 Improver。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

LLM 能够辅助头脑风暴或编程,但完整科研流程还包含实验规划、故障修复、结果解释与证据沟通。论文研究能否将这些环节接成可重复执行的流程,让后续想法利用此前的实验与评审信息。

Inference

自动科研不能只生成一个 Idea,还要实现、实验、检查结果和形成可审查叙述。The AI Scientist 研究把这些阶段连成 Pipeline,在轻量 ML 模板上完成研究产物。其意义是观察完整过程的可行性与失败模式,论文数量本身不能代表科学知识增量。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

OPRO 用 LLM 提出并评价候选,SWE-agent 展示工具支持的代码操作。The AI Scientist 将相关能力扩展到 Idea、实验和写作,并使用自动 Review 评估产物。初始研究模板、评估框架和可用模型仍由人提供。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

一个小型 ML 实验通常已有可运行 Baseline;接下来需要提出可测试变化、修改代码并比较。LLM 能承担这些局部任务,因此可用结构化文件连接阶段,保存 Idea Archive 避免重复,再以结果驱动实验迭代。最危险的断点是论文叙述可能偏离实际执行记录。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

可执行实验和可检查的论文产物能把 language model 的想法落到外部证据上。将研究想法、实现计划及已完成研究保存在档案中,可以为下一轮提供探索历史,而不仅依靠一次性生成的灵感。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

系统从小型实验模板生成候选想法,用文献检索筛查相似工作,通过 Aider 修改代码并执行多轮实验;结果日志支持绘图和 LaTeX 写作,随后由 LLM 评审,并把想法与 feedback 加入档案。

Inference

原文提供小 Transformer 训练 Shakespeare 文本等起始模板。系统提出研究方向,修改训练代码,运行和绘图,根据结果继续实验,再将记录写成 LaTeX 论文,最后由 Reviewer Model 给意见。输出是代码、实验结果与论文。这里主要改进外部研究产物;没有证明 Scientist 自身的研究策略被持久更新后接管下一代。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

该框架没有统一的科学发现目标函数或核心收敛推导。每个生成项目有自己的训练 Loss,Review Score 又是另一评价层。用一个分数概括论文质量,会把正确性、意义、新颖性和表达混在一起。研究笔记应追踪 Claim→Experiment→Artifact 的证据链,而非把 Reviewer 分数当作知识发现的概率。

Idea → executable change → experiment logs → claim → review
A high review score does not establish a valid scientific claim
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:端到端自动研究是否能产出完整项目,自动 Review 是否可用?→ Experiment:在多个轻量 ML 研究模板上生成项目,并比较或分析自动审稿判断。→ Answer:作者展示完整产物和部分有趣结果,也记录执行、引用和报告错误等局限。

Paper Claim

作者在扩散 model、language model 和 grokking 三个小规模方向展示端到端生成论文,报告每篇成本低于 15 美元。部分稿件超过其自动评审器的录用阈值;这一指标不等于论文经过真实会议独立录用。

08

Takeaways

这篇论文改变了哪些判断?

Inference

这篇工作将科研自动化的多个环节放到一起,方便审查接口失败。应区分可运行、可复现、结论成立与研究有价值四个层次。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是同源系统能可靠审查自己生成的研究。提出 Idea、写实验和审稿的模型可能共享偏差,尤其容易接受叙事流畅却证据薄弱的结果。

Inference

原论文依赖人工提供的研究方向、初始模板和评价流程;示范主要是小规模 machine learning 实验。自动评审有偏差,写作也可能错误解释数据。本条核读方法、案例与局限材料,未复核全部生成论文。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:准备一个一分钟级 Baseline 与预注册问题。Day 3–5:允许 Agent 完成一次改动、一个消融和三种子实验。Day 6–7:由独立脚本核对论文每个数字与日志,并尝试推翻主要 Claim。目标是证据链完整性,不是批量生成论文。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

给出一个只在单 Seed 上成立的表面提升,并让更强 Baseline 被遗漏。如果自动 Review 仍高度认可,就能检验系统对实验充分性与选择性报告的盲区。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究自动科学中的敌对证据生产:一个系统提出可证伪 Claim,另一个仅有预算寻找最有价值的反例,最终产物是经反例修订的适用范围。相对 OPRO 的单目标候选优化,这将科学进展定义为可排除的解释空间,而非更高 Review Score。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery · v3 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] Large Language Models as Optimizers ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2408.06292 · v3 / REVIEWED 2026.09.13
返回全部论文