VVARDARKSINGULARITY / ANALYSIS
TRACKER/RESEARCH-AUTOMATION/BENCHMARKS

BESLUTNINGSVISNING / AI-FOU

Hva kan forskningsagentene faktisk gjøre?

Tre komplementære benchmarklinser: implementere forskningsutvidelser, foreslå og teste nye metoder, og gjennomføre en åpen forskningsarbeidsflyt.

OBSERVASJON9,3 %Beste MLRC-Bench-gap lukket
HVORDAN DEN SKAPER VERDIBruk kartet til å skille imponerende delresultater fra pålitelig, objektivt verifisert ende-til-ende-forskning.

Objektivt målt, men på bare syv konkurranseoppgaver.

KAPABILITETSKART / ULIKE EVALUERINGER

Tre linser, tre forskjellige nevnere

Hver måler beholder sin egen skala og retning. Lengden på feltene gjør datapunktet synlig, men er uttrykkelig ikke en rangering mellom benchmarkene.

RExBench

Forskningsutvidelser

Beste resultat med menneskeskrevne hints

RETNING
KAPABILITET
DEKNING
12 oppgaver
research-automation/rexbench/best-with-hints
MLRC-Bench

Nye ML-metoder

Andel av gapet til toppmenneske som ble lukket

RETNING
KAPABILITET
DEKNING
7 oppgaver
research-automation/mlrc/gap-closed
MLR-Bench

Eksperimentell kontroll

Eksempelvis ugyldige resultater i ett agentoppsett

RETNING
FEILRATE
DEKNING
201 oppgaver / 4 steg
research-automation/mlr/invalid-experiments
TRENDSTATUS / IKKE ETABLERTKildene er publisert på ulike datoer, men måler ulike oppgaver, evaluatorer og nevnere. Modulen har derfor ennå ingen forsvarlig longitudinal ytelsestrend; neste sammenlignbare benchmarkrelease må legges til i samme bane før en trend tegnes.
IMPLEMENTASJONBEGRENSNING

Kan agenter utvide eksisterende forskning?

RExBench v3 viser under 44 % selv med menneskeskrevne hints på 12 realistiske utvidelser.

OBSERVASJONunder 44 %

RExBench: beste resultat med hints · Forskningsutvidelser; ikke generell FoU-rate.

TOLKNING12 oppgaver

RExBench-dekning · Avgrenset benchmark.

NYE METODERBEGRENSNING

Kan agenter konkurrere mot toppmennesker på nye ML-problemer?

Beste MLRC-Bench-agent lukket 9,3 % av gapet på syv objektivt evaluerte konkurranseoppgaver.

OBSERVASJON9,3 %

MLRC-Bench: gap lukket · Objektiv resultatmåling mot baseline og toppmenneske.

TOLKNING7 oppgaver

MLRC-Bench-dekning · Dynamiske ML-konkurranseoppgaver.

ARBEIDSFLYTSIGNAL

Dekkes et helt forskningsløp?

MLR-Bench dekker 201 oppgaver og fire steg, men rapporterer alvorlige problemer med eksperimentell validitet.

TOLKNING201 oppgaver / 4 steg

MLR-Bench-dekning · Ende-til-ende benchmarkdesign; ikke én sammenlignbar score.

OBSERVASJONofte 80 %

MLR-Bench: eksperimentfeil · Eksempeltall fra særskilt coding-agentoppsett.

FELLES SIGNALBEGRENSNING

Hva begrenser pålitelig autonom FoU?

På tvers av ulike evalueringsformer er implementasjon og eksperimentell kontroll fortsatt tydelige svakheter.

OBSERVASJONunder 44 %

RExBench: beste resultat med hints · Forskningsutvidelser; ikke generell FoU-rate.

OBSERVASJON9,3 %

MLRC-Bench: gap lukket · Objektiv resultatmåling mot baseline og toppmenneske.

OBSERVASJONofte 80 %

MLR-Bench: eksperimentfeil · Eksempeltall fra særskilt coding-agentoppsett.

MÅLEGAPMÅLEGAP

Hvor stor andel av FoU er automatisert?

Det finnes ingen forsvarlig felles nevner for en samlet automatiseringsprosent.

MÅLEGAPikke målt

Samlet AI-FoU-automatisering · Bevisst tomt aggregat.

KILDER / PROVENIENS4 kildeposter
benchmark-resultEdwards et al.RExBench: Can coding agents autonomously implement AI research extensions?
Hentet
2026-08-12
Data
2025-06-27
Lisens
Cited public paper; no paper text redistributed

Twelve research-extension tasks and reported agent evaluation; do not generalize to all research work.

Åpne originalkilde ↗
benchmark-resultChen et al.MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research
Hentet
2026-08-12
Data
2025-05-26
Lisens
Cited public paper; no paper text redistributed

Open-ended ML research benchmark; the reported coding-agent failure example is not a cross-benchmark rate.

Åpne originalkilde ↗
benchmark-resultZhang et al.MLRC-Bench: Can Language Agents Solve Machine Learning Research Challenges?
Hentet
2026-08-12
Data
2025-04-13
Lisens
Cited public paper; no paper text redistributed

Seven objectively scored ML research competition tasks; kept separate from RExBench and MLR-Bench.

Åpne originalkilde ↗
reviewed-research-sourceEdwards et al.RExBench paper
Hentet
2026-08-13
Data
2026-04-21
Lisens
citation-only-review-required

The current arXiv v3 abstract, revised 2026-04-21, reports about 33% autonomous success and says the best hinted result remains below 44%. This supersedes the legacy candidate whose hash represented the identical raw page bytes rather than the normalized visible-content fingerprint required by source admission.

Åpne originalkilde ↗
ETTERPRØVBART GRUNNLAG / 8 PÅSTANDERÅpne grunnlag +

Påstander, beregninger, kilder og kjente grenser for denne visningen. Kildedata og dashboardtolkning holdes adskilt.

Observasjon

RExBench v3 rapporterer at beste resultat, selv med menneskeskrevne hints, er under 44 % på realistiske forskningsutvidelser.

Edwards et al.: RExBench paper 1 målepunkt1 kildefakta
  • Avhengig av oppsett og hint.
research-automation/claim/rexbench-capability
Beregning

De tre benchmarkene peker samlet mot implementasjon og eksperimentell validitet som en tydelig begrensning, men de kan ikke summeres til én automatiseringsandel.

  • Kvalitativ triangulering, ikke en metaanalyse eller felles score.
research-automation/claim/experimental-bottleneck
Begrensning

Modulen publiserer ingen samlet FoU-automatiseringsprosent fordi benchmarkene ikke måler samme oppgave, agent eller suksesskriterium.

  • Et målegap, ikke bevis for null automatisering.
research-automation/claim/no-aggregate
SPORBAR FAKTALOGG / 8 KILDEFAKTAÅpne logg +
research-automation/fact/rexbench/best-with-hints
below 44%

Best RExBench performance with human-written hints

Edwards et al. · v3 abstract revised 2026-04-21
research-automation/fact/rexbench/tasks
12

RExBench realistic research extension tasks

Edwards et al. · Abstract
research-automation/fact/mlr/tasks
201

MLR-Bench open-ended ML research tasks

Chen et al. · Abstract
research-automation/fact/mlr/stages
4: idea, proposal, experimentation, paper writing

MLR-Agent research workflow stages

Chen et al. · Abstract and workflow description
research-automation/fact/mlr/invalid-results
frequently, e.g. 80% of cases

Coding-agent fabricated or invalidated experiment results

Chen et al. · Abstract
research-automation/fact/mlrc/tasks
7

MLRC-Bench competition tasks

Zhang et al. · Abstract
research-automation/fact/mlrc/gap-closed
9.3%

Best agent share of baseline-to-top-human gap closed

Zhang et al. · Abstract
research-automation/fact/coverage/no-aggregate
not published

Cross-benchmark aggregate automation score

Edwards et al. · Module methodology; intentional non-derivation
FORTOLKNINGSGRENSE

Resultatene er ikke tidsseriekompatible.

Forskjellige evaluatorer gir forskjellige feilkilder.

Ingen av benchmarkene observerer hemmelig eller kommersiell laboratoriepraksis.

MODULSTATUSINCOMPLETE

Tre separate benchmarklinser; eksperimentell validitet er den tydeligste flaskehalsen