RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts
RE-Bench:在研究工程任务上比较 Agent 与人类专家
在 7 个开放式 machine learning 研究工程环境中,把 Agent 与专家置于明确的总计算时间预算下比较,揭示短时与长时工作能力差异。
Classification & RSI Relation 1 Variant · Editorial Assessment
主题标签用于检索;以下按实际 Experiment / Variant 判断更新对象与证据。Not Demonstrated 表示这项研究未提供相应证据。
Framework / Protocol
- Update Target
- No persistent system target in this setting
- Loop Role
- Not Applicable
- Persistence
- Not Applicable
- Recursive Reuse
- Not Applicable
- Evidence
- Benchmark Measurement
- System Boundary
- AI R&D Evaluation;以该论文实际可更新组件为边界,固定部分见下方判定。
- Feedback
- 环境评分、可执行实验与人类专家参照
- Evidence Scope
- 多数环境允许随时查询评分,比真实科研更容易得到 feedback;七个环境也无法覆盖全部研发工作。32 小时结果包含多次尝试的预算聚合,不等于单次连续研究。本条核读 arXiv 摘要及预算说明,未通读全文。 已核验固定版本的相关方法与主要结果;未独立复现。
编者归类:它衡量 RSI 可能依赖的研究工程能力,尤其适合检查更长时间是否带来更好研究。benchmark 本身不让系统自动修改 improver,因此评测高分与 recursive optimization 能力之间仍有明确的证据缺口。
检查原文设置 ↗原论文明确提出或报告的内容
相关文献中已有的知识与结论
基于证据的解释、重建或教学推演
待验证的猜测、实验计划或新研究提案
Idea Reconstruction 是从已知背景出发的推演,不代表作者真实心理过程。Follow-up 是研究提案;相关工作比较不等于已证实 Novelty。教学示例与原文案例在正文中区分。
Contents · 12 Questions
Prior Work & Research Gap
前人做到哪一步,缺口在哪里?
MLE-bench 通过历史 Competition 排名评价工程结果。RE-Bench 提供更直接的专家尝试记录与时间预算比较,任务覆盖速度优化、模型修复、训练与 Scaffold 等。它测量研发能力的一部分,没有让最终产物自动训练下一代研究者。
Idea Reconstruction
从已有知识与失败模式出发,如何走到这个想法?
如果只给一个最终分数,无法知道系统适合快速探索还是长期攻关。先选择专家在数小时内能取得进展、又未被轻易解决的任务,再保留不同预算下的尝试,就能画出能力与时间的关系。多个独立尝试的总时长也必须与一次持续工作区分。
Core Intuition
用一个清楚的视角抓住方法本质。
短时间内快速试错与长时间内深入研究是不同能力。固定总计算时间,并允许多次短尝试或少量长尝试,能够观察 model 调用速度、试验 strategy 及持续 reasoning 能力如何共同决定最终研究成绩。
Method & Worked Example
沿着输入、处理、输出走完 Pipeline。
构建 7 个开放式研究工程环境,收集 61 位专家的 71 次八小时尝试,并比较不同 model、Agent scaffold 和 best-of-k 配置。评价按总计算时间预算展开,同一预算可以分配给多次独立尝试。
原文 Optimize a Kernel 任务要求编写 GPU Prefix-sum Kernel。输入是参考实现、环境与评分接口;参与者分析瓶颈、实现和测试优化,输出代码;固定流程测正确性与运行时间。另一任务要求用小规模训练预测 Scaling Law。不同任务对应不同研究技能,不能把 Kernel 成功等同于训练新 Model 的能力。
Mathematical Foundations
从符号、直觉与简单例子理解理论。
不同指标先经任务特定变换,再相对参考点归一化,便于跨环境汇总。Best-of-k 表示运行 k 次再取最好值,它衡量带选择的搜索收益;一次运行的期望分数是另一指标。比较时间时需说明是 Wall-clock、总尝试时间还是计算成本,原文也分析随预算变化的结果。
Best-of-k score = max(score₁,…,score_k) Total effort = Σ attempt budgets Single-run mean ≠ selected best score
Experiments & Claims
Research Question → Experiment → Answer
Question:Agent 与专家的能力差距如何随时间改变?→ Experiment:在七个环境记录专家和模型尝试,比较多个预算及 Scaffold。→ Answer:作者发现短预算和长预算下相对表现不同,人类在更长时间上显示较好的收益增长;结论限于参与者、任务与当时 Model。
原论文报告两小时总预算下最优 Agent 平均得分约为专家的 4 倍;八小时人类略占优,32 小时聚合尝试预算下人类约为最佳 Agent 的 2 倍。这些是特定环境和历史 model 的相对分数。
One-Week Reproduction
用一周检验一个最小且明确的命题。
Day 1–2:选择一个小型运行时优化任务,固定正确性测试。Day 3–5:比较 Agent 在 15、30、60 分钟下的进展,并记录并行重启和持续单次工作。Day 6–7:分析曲线与失败原因,不尝试用一个人的结果代表所有专家。
Counterexample Design
如何构造有辨识力的反例?
构造一个必须先花较长时间理解数据布局、短期没有分数回报的任务。若短预算排名完全反转,就能证伪从短任务优势推断长程研发优势的外推。
Follow-up Research
从缺陷与需求推导新的研究问题。
研究研发能力的时间结构:区分信息收集、假设形成、实现与验证阶段,主动交换中间产物,找出人和 Agent 长程差距的来源。相对 MLE-bench 的最终提交指标,这研究的是进展生成机制及其可迁移瓶颈。
Sources & Verification
阅读已固定版本的原文 Background、方法与主要结果,结合下列相关文献撰写。Paper Claim 表示作者报告,未独立复现;Inference 包括数学教学推演与 Idea Reconstruction。One-Week Reproduction、Counterexample 和 Follow-up 均为待执行提案,Novelty 尚需更全面的文献与实验检验。
- [1] RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts · v2 ↗原文 Background、Method / Formalization 与主要实验或理论结论。数字沿用原文设置;未独立运行完整实验。
- [2] MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering ↗相关方法与研究背景;用于说明具体差异,不能替代对本篇结论的验证。
