Forskningsutvidelser
Beste resultat med menneskeskrevne hints
- RETNING
- KAPABILITET
- DEKNING
- 12 oppgaver
research-automation/rexbench/best-with-hintsBESLUTNINGSVISNING / AI-FOU
Tre komplementære benchmarklinser: implementere forskningsutvidelser, foreslå og teste nye metoder, og gjennomføre en åpen forskningsarbeidsflyt.
Objektivt målt, men på bare syv konkurranseoppgaver.
Hver måler beholder sin egen skala og retning. Lengden på feltene gjør datapunktet synlig, men er uttrykkelig ikke en rangering mellom benchmarkene.
Beste resultat med menneskeskrevne hints
research-automation/rexbench/best-with-hintsAndel av gapet til toppmenneske som ble lukket
research-automation/mlrc/gap-closedEksempelvis ugyldige resultater i ett agentoppsett
research-automation/mlr/invalid-experimentsRExBench v3 viser under 44 % selv med menneskeskrevne hints på 12 realistiske utvidelser.
RExBench: beste resultat med hints · Forskningsutvidelser; ikke generell FoU-rate.
RExBench-dekning · Avgrenset benchmark.
Beste MLRC-Bench-agent lukket 9,3 % av gapet på syv objektivt evaluerte konkurranseoppgaver.
MLRC-Bench: gap lukket · Objektiv resultatmåling mot baseline og toppmenneske.
MLRC-Bench-dekning · Dynamiske ML-konkurranseoppgaver.
MLR-Bench dekker 201 oppgaver og fire steg, men rapporterer alvorlige problemer med eksperimentell validitet.
MLR-Bench-dekning · Ende-til-ende benchmarkdesign; ikke én sammenlignbar score.
MLR-Bench: eksperimentfeil · Eksempeltall fra særskilt coding-agentoppsett.
På tvers av ulike evalueringsformer er implementasjon og eksperimentell kontroll fortsatt tydelige svakheter.
RExBench: beste resultat med hints · Forskningsutvidelser; ikke generell FoU-rate.
MLRC-Bench: gap lukket · Objektiv resultatmåling mot baseline og toppmenneske.
MLR-Bench: eksperimentfeil · Eksempeltall fra særskilt coding-agentoppsett.
Det finnes ingen forsvarlig felles nevner for en samlet automatiseringsprosent.
Samlet AI-FoU-automatisering · Bevisst tomt aggregat.
Twelve research-extension tasks and reported agent evaluation; do not generalize to all research work.
Åpne originalkilde ↗Open-ended ML research benchmark; the reported coding-agent failure example is not a cross-benchmark rate.
Åpne originalkilde ↗Seven objectively scored ML research competition tasks; kept separate from RExBench and MLR-Bench.
Åpne originalkilde ↗The current arXiv v3 abstract, revised 2026-04-21, reports about 33% autonomous success and says the best hinted result remains below 44%. This supersedes the legacy candidate whose hash represented the identical raw page bytes rather than the normalized visible-content fingerprint required by source admission.
Åpne originalkilde ↗Påstander, beregninger, kilder og kjente grenser for denne visningen. Kildedata og dashboardtolkning holdes adskilt.
RExBench v3 rapporterer at beste resultat, selv med menneskeskrevne hints, er under 44 % på realistiske forskningsutvidelser.
research-automation/claim/rexbench-capabilityRExBench inneholder 12 forskningsimplementasjonsoppgaver med automatisk evaluering.
research-automation/claim/rexbench-scopeMLR-Bench beskriver hyppige, eksempelvis 80 %, fabrikkerte eller invaliderte eksperimentresultater for det testede coding-agentoppsettet.
research-automation/claim/mlr-reliabilityMLR-Bench dekker 201 oppgaver og en firestegs arbeidsflyt fra idé til paperskriving.
research-automation/claim/mlr-scopeI MLRC-Bench lukket beste testede agent 9,3 % av gapet mellom baseline og toppmenneskelig resultat.
research-automation/claim/mlrc-capabilityMLRC-Bench bruker syv dynamiske ML-konkurranseoppgaver med objektive resultatmål.
research-automation/claim/mlrc-scopeDe tre benchmarkene peker samlet mot implementasjon og eksperimentell validitet som en tydelig begrensning, men de kan ikke summeres til én automatiseringsandel.
research-automation/claim/experimental-bottleneckModulen publiserer ingen samlet FoU-automatiseringsprosent fordi benchmarkene ikke måler samme oppgave, agent eller suksesskriterium.
research-automation/claim/no-aggregateresearch-automation/fact/rexbench/best-with-hintsBest RExBench performance with human-written hints
Edwards et al. · v3 abstract revised 2026-04-21research-automation/fact/rexbench/tasksRExBench realistic research extension tasks
Edwards et al. · Abstractresearch-automation/fact/mlr/tasksMLR-Bench open-ended ML research tasks
Chen et al. · Abstractresearch-automation/fact/mlr/stagesMLR-Agent research workflow stages
Chen et al. · Abstract and workflow descriptionresearch-automation/fact/mlr/invalid-resultsCoding-agent fabricated or invalidated experiment results
Chen et al. · Abstractresearch-automation/fact/mlrc/tasksMLRC-Bench competition tasks
Zhang et al. · Abstractresearch-automation/fact/mlrc/gap-closedBest agent share of baseline-to-top-human gap closed
Zhang et al. · Abstractresearch-automation/fact/coverage/no-aggregateCross-benchmark aggregate automation score
Edwards et al. · Module methodology; intentional non-derivationResultatene er ikke tidsseriekompatible.
Forskjellige evaluatorer gir forskjellige feilkilder.
Ingen av benchmarkene observerer hemmelig eller kommersiell laboratoriepraksis.
Tre separate benchmarklinser; eksperimentell validitet er den tydeligste flaskehalsen