All resources / AI Models & Benchmarks
FreeResearch Paper
AI Models & Benchmarks
RE-Bench: Evaluating Frontier AI R&D Capabilities (METR)
What it is
METR's November 2024 release of RE-Bench, a benchmark comparing frontier model agents with human experts on seven machine-learning research-engineering tasks. It includes data from 71 human expert attempts and results for Claude 3.5 Sonnet and o1-preview.
Topics
Added Oct 1, 2026 · 0 opens
