The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery
AI Scientist:从研究想法到实验与论文的自动化闭环
从给定代码模板出发,自动提出想法、检索文献、改代码、跑实验、写论文并生成模拟评审,将发现写入研究档案。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Main Method
- Update Target
- No persistent system target in this setting
- Loop Role
- Experience Generator · Proposer
- Persistence
- Across Improvement Rounds
- Recursive Reuse
- Not Demonstrated
- Evidence
- Feasibility Demonstration
- System Boundary
- Research Workflow & Idea Archive;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 实验日志、文献检索与 model 生成的评审
- Evidence Scope
- 原论文依赖人工提供的研究方向、初始模板和评价流程;示范主要是小规模 machine learning 实验。自动评审有偏差,写作也可能错误解释数据。本条核读方法、案例与局限材料,未复核全部生成论文。 已核验固定版本的相关方法与主要结果;未独立复现。
科研假设、实验代码和 manuscript 是输出产物;自动做研究不等同研究 Agent 更新自己的 Improver。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Core Intuition
用一个清楚的视角抓住方法本质。
可执行实验和可检查的论文产物能把 language model 的想法落到外部证据上。将研究想法、实现计划及已完成研究保存在档案中,可以为下一轮提供探索历史,而不仅依靠一次性生成的灵感。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
系统从小型实验模板生成候选想法,用文献检索筛查相似工作,通过 Aider 修改代码并执行多轮实验;结果日志支持绘图和 LaTeX 写作,随后由 LLM 评审,并把想法与 feedback 加入档案。
原文提供小 Transformer 训练 Shakespeare 文本等起始模板。系统提出研究方向,修改训练代码,运行和绘图,根据结果继续实验,再将记录写成 LaTeX 论文,最后由 Reviewer Model 给意见。输出是代码、实验结果与论文。这里主要改进外部研究产物;没有证明 Scientist 自身的研究策略被持久更新后接管下一代。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
该框架没有统一的科学发现目标函数或核心收敛推导。每个生成项目有自己的训练 Loss,Review Score 又是另一评价层。用一个分数概括论文质量,会把正确性、意义、新颖性和表达混在一起。研究笔记应追踪 Claim→Experiment→Artifact 的证据链,而非把 Reviewer 分数当作知识发现的概率。
Idea → executable change → experiment logs → claim → review A high review score does not establish a valid scientific claim
Experiments & Claims
Research Question → Experiment → Answer
Question:端到端自动研究是否能产出完整项目,自动 Review 是否可用?→ Experiment:在多个轻量 ML 研究模板上生成项目,并比较或分析自动审稿判断。→ Answer:作者展示完整产物和部分有趣结果,也记录执行、引用和报告错误等局限。
作者在扩散 model、language model 和 grokking 三个小规模方向展示端到端生成论文,报告每篇成本低于 15 美元。部分稿件超过其自动评审器的录用阈值;这一指标不等于论文经过真实会议独立录用。
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:准备一个一分钟级 Baseline 与预注册问题。Day 3–5:允许 Agent 完成一次改动、一个消融和三种子实验。Day 6–7:由独立脚本核对论文每个数字与日志,并尝试推翻主要 Claim。目标是证据链完整性,不是批量生成论文。
Counterexample Design
如何构造有辨识力的反例?
给出一个只在单 Seed 上成立的表面提升,并让更强 Baseline 被遗漏。如果自动 Review 仍高度认可,就能检验系统对实验充分性与选择性报告的盲区。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery · v3 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] Large Language Models as Optimizers ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
- [3] SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
