RSI Paper
All PapersRESEARCH NOTE / 2410.07095

MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering

MLE-bench:评估 Agent 能否完成 machine learning engineering

Jun Shern Chan 等

Submitted Verified Version · v6Note Updated
THE QUESTION WORTH READING

基于 75 项公开 machine learning 竞赛评价 Agent 的数据准备、训练和实验能力,用历史人类成绩建立参照,同时讨论资源扩展与 data contamination。

Classification & RSI Relation 1 Variant · Editorial Assessment

主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。

Framework / Protocol

Update Target
No persistent system target in this setting
Loop Role
Not Applicable
Persistence
Not Applicable
Recursive Reuse
Not Applicable
Evidence
Benchmark Measurement
System Boundary
ML Engineering Evaluation;以该论文实际可更新组件为边界,固定部分见下方判定。
Feedback
竞赛评分、历史人类门槛与过程合规检查
Evidence Scope
竞赛工程成绩不直接等于自主发现新算法或 Recursive Self-Improvement。数据泄漏、历史任务可见性、训练资源与代理脚手架都会影响比较;原论文的历史结果必须保留 model 和预算 context。本条核验摘要,未独立重跑竞赛。 已核验固定版本的相关方法与主要结果;未独立复现。

编者归类:这是 RSI 相关 AI 研发能力的外部测量工具,并非 self-improvement 算法。它可检测改进后的系统是否更会完成 machine learning 任务,但还需额外记录系统更新过程,才能将分数变化归因于自主学习。

检查原文设置 ↗
Paper Claim

原论文明确提出或报告的内容

Prior Work

相关文献中已有的知识与结论

Inference

基于证据的解释、重建或教学推演

Hypothesis

待验证的猜测、实验计划或新研究提案

Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。

Contents · 12 Questions
01

Research Problem & Background

问题为什么重要,解决它有什么价值?

Paper Claim

编程问答或短代码 benchmark 不足以衡量自动 AI 研发:完成 machine learning 项目需要处理数据、训练 model、安排实验并生成有效提交。论文因此寻找可重复评价、具有明确结果和人类参照的工程任务集合。

Inference

写出一段正确代码,不足以说明 Agent 能完成 ML Engineering。真实任务还包括数据清洗、训练、验证、排查问题和提交预测。MLE-bench 研究如何把这套过程放进可执行、可比较的任务集合,测量研究工程能力的一个具体切面。

02

Prior Work & Research Gap

前人做到哪一步,缺口在哪里?

Prior Work

SWE-agent 评估仓库修复,The AI Scientist 展示自动实验与论文生成。MLE-bench 则聚焦已有 ML Competition 的端到端工程流程,以历史排行榜作为结果参照。它提供的是固定研究任务上的能力测量,不直接测试 Agent 是否更新自身的改进策略。

03

Idea Reconstruction

从已有知识与失败模式出发,如何走到这个想法?

Inference

要测试工程能力,任务应当允许多种合理方案,同时有可客观评分的最终产物。公开比赛恰好提供数据、指标和历史人类结果。把运行环境与提交格式统一后,便可观察 Agent 能否从任务说明走到有效模型。困难在于历史数据污染和不同比赛的资源背景不相同。

04

Core Intuition

用一个清楚的视角抓住方法本质。

Inference

machine learning 竞赛同时具备现实数据、可执行目标和公开成绩,可将多步骤工程工作压缩为可评分任务。评价对象是 model 与 Agent 框架的组合,预算和试验安排因此会直接影响能力估计。

05

Method & Worked Example

沿着输入、处理、输出走完 Pipeline。

Paper Claim

从公开平台整理 75 项 machine learning 竞赛,构建数据与评分流程,以原竞赛公开榜单作为人类参照。研究使用开源 Agent scaffold 测试多个 model,并通过不同资源配置和污染分析考察成绩变化的来源。

Inference

沿用其真实 Competition Task 形式:Agent 得到训练数据、无标签测试输入、任务说明和计算环境;它建立验证集,尝试特征与 Model,训练并生成符合格式的预测文件;固定评分程序与历史 Private Leaderboard 比较。输出是预测 Submission 和工程轨迹,改进的是任务模型,而非必然改进执行研究的 Agent。

06

Mathematical Foundations

从符号、直觉与简单例子理解理论。

Inference

Headline Metric 是获得至少 Bronze Medal 的 Attempt 比例。每个比赛的 Medal Threshold 由参赛规模与历史排名确定,因而将不同任务映射为相近的相对成就。这个二元指标会忽略同一阈值两侧的细小差异,也不代表在相同时间预算下直接击败历史参赛者。

Medal rate = (# attempts reaching bronze or above) / (# attempts)
Also inspect valid-submission rate and task-level scores
07

Experiments & Claims

Research Question → Experiment → Answer

Paper Claim

Question:Agent 能否完成有竞争力的 ML Engineering?→ Experiment:在多项比赛上运行不同 Model / Scaffold,分析资源扩展与潜在训练污染。→ Answer:作者报告部分任务达到 Medal 水平,同时存在无效提交和长程执行瓶颈;结果是工程任务能力证据。

Paper Claim

原论文最优配置 o1-preview 加 AIDE 在 16.9%的竞赛达到至少铜牌水平。这里指达到门槛的竞赛比例,并非在所有参赛者中排名前 16.9%;它也是原论文历史结果,不是当前公开榜单最高成绩。

08

Takeaways

这篇论文改变了哪些判断?

Inference

读 MLE-bench 应先问是否提交了有效产物,再问质量多高。Medal 是便于汇总的参照,不能替代各任务数据、时间、计算与人类投入的背景。

09

Most Fragile Assumption

哪一个假设失效会动摇方法?

Inference

最脆弱的假设是历史比赛可代表新的 ML 研究工作。已有解决方案可能进入 Pretraining,比赛指标也偏向最终预测效果,难覆盖问题定义、原创方法或科研判断。

Inference

竞赛工程成绩不直接等于自主发现新算法或 Recursive Self-Improvement。数据泄漏、历史任务可见性、训练资源与代理脚手架都会影响比较;原论文的历史结果必须保留 model 和预算 context。本条核验摘要,未独立重跑竞赛。

10

One-Week Reproduction

用一周检验一个最小且明确的命题。

Hypothesis

Day 1–2:挑一个可在本地资源完成的小型预测任务,冻结数据划分。Day 3–5:运行同一 Agent 的三次独立尝试,保存训练与验证日志。Day 6–7:检查泄漏、有效提交率和隐藏得分,并与简单人工 Baseline 比较。

11

Counterexample Design

如何构造有辨识力的反例?

Hypothesis

设计训练与验证存在重复实体、真正测试按实体隔离的任务。如果 Agent 通过错误划分获得极高本地分数但隐藏测试失败,就能检查它是否具备研究工程中的数据诊断能力。

12

Follow-up Research

从缺陷与需求推导新的研究问题。

Hypothesis

研究可解释的工程失败分解:在同一任务中分别注入数据、训练和验证问题,测 Agent 能否识别瓶颈并选择信息量最大的实验。相对 SWE-agent 的代码修复,这将能力测量转为研究决策的因果诊断,而非继续扩大比赛数量。

Sources & Verification

阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。

  1. [1] MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering · v6 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
  2. [2] SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
  3. [3] The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
arXiv:2410.07095 · v6 / REVIEWED 2026.09.13
返回全部论文