VVARDARKSINGULARITY / ANALYSIS
TRACKER/AGENT-HORIZON/RELIABILITY

BESLUTNINGSVISNING / AGENTER

Horisont er et pålitelighetsvalg

Den samme frontierkohorten ser radikalt forskjellig ut ved 50 og 80 prosent suksess. Suitedekningen setter en hard fortolkningsgrense.

OBSERVASJONca. 1,5 tOffentlig frontier ved 80 % suksess
HVORDAN DEN SKAPER VERDIVelg pålitelighetsnivå før du tolker autonomi, og stopp når benchmarkens lange oppgaver ikke lenger bærer estimatet.

Det strengere målet er ofte mer beslutningsrelevant enn P50.

HORISONTPLOTT / USIKKERHET + RELIABILITET

Pålitelighet komprimerer den brukbare horisonten

Punktet er modellert horisont; streken er kildeintervallet. Logaritmisk x-akse gjør 50 minutter og 61 timer lesbare i samme plot.

30m1t2t4t8t16t32t64t16t · OVER HER UPÅLITELIGOpus 4.5 / P50320 minFrontier / P50ca. 12 tFrontier / P80ca. 1,5 t
Samme frontierkohortTidligere navngitt modellLog-skala · ekspertminutter, log-skala
PÅLITELIGHETSFALL
ca. 12 t @ 50 %ca. 1,5 t @ 80 %
8× kortere

Punktestimater for samme offentlige frontierkohort.

MÅLEUTVIKLING
Opus 4.5: 320 minFrontierkohort: ca. 720 min
ulike vurderinger

Vises som kontekst, ikke som ren modelltrend.

50 % SUKSESSSIGNAL

Hvor langt ved myntkast-pålitelighet?

Offentlig frontier ligger rundt 12 timer, men intervallet er 5–61 timer og går inn i metningsområdet.

OBSERVASJONca. 12 t [5–61]

Offentlig frontier, 50 % · Kohortresultat, bred usikkerhet.

80 % SUKSESSSIGNAL

Hvor langt ved høyere pålitelighet?

Punktestimatet faller til ca. 1,5 timer med intervall 50 minutter–2 timer 40 minutter.

OBSERVASJONca. 1,5 t [50m–2t40m]

Offentlig frontier, 80 % · Strengere suksesskrav.

FØLSOMHETBEGRENSNING

Hvor mye betyr suksesskravet?

De avrundede P50- og P80-punktestimatene skiller åtte ganger.

TOLKNING

P50/P80 punktestimat · 720 / 90 ekspertminutter.

SUITEDEKNINGBEGRENSNING

Hvor mye langt arbeid finnes i målegrunnlaget?

31 av 228 oppgaver er 8+ timer; bare fem av hele suiten er lange oppgaver med menneskelig baseline.

TOLKNING228 oppgaver

TH1.1 task suite · 31 er 8+ timer; fem har menneskelig baseline.

TOLKNING13,6 % / 2,2 %

Langoppgavedekning · Andel 8t+ / andel 8t+ med menneskelig baseline.

MÅLEGAPMÅLEGAP

Når bør tallet ikke brukes?

METR markerer horisonter over 16 timer som upålitelige med dagens suite.

MÅLEGAP>16 t upålitelig

Målegrense · Kildeoppgitt begrensning.

KILDER / PROVENIENS3 kildeposter
primary-measurementMETRTime Horizon 1.1
Hentet
2026-08-12
Data
2026-01-29
Lisens
Cited public research release; analysis repository license applies to its code/data

Public, task-suite-specific agent horizon estimates; this module records only stated values, not a copied raw dataset.

Åpne originalkilde ↗
measurement-methodologyMETRTask-Completion Time Horizons of Frontier AI Models
Hentet
2026-08-12
Data
2026-05-08
Lisens
Cited public web source; repository license applies separately

Defines time horizon and explicitly marks estimates above 16 hours unreliable in the current suite.

Åpne originalkilde ↗
primary-measurementMETRFrontier Risk Report: February to March 2026
Hentet
2026-08-12
Data
2026-03-31
Lisens
Cited public research report

Cohort-level public-frontier TH1.1 results at 50% and 80% reliability; saturation and wide intervals are material limitations.

Åpne originalkilde ↗
ETTERPRØVBART GRUNNLAG / 7 PÅSTANDERÅpne grunnlag +

Påstander, beregninger, kilder og kjente grenser for denne visningen. Kildedata og dashboardtolkning holdes adskilt.

Observasjon

METR TH1.1 rapporterer 320 minutter [170–729] for Claude Opus 4.5 ved modellert 50 % suksess.

METR: Time Horizon 1.1 1 målepunkt1 kildefakta
  • Spesifikk modell, suite og agentoppsett.
agent-horizon/claim/opus-p50
Observasjon

METRs vurdering for februar–mars 2026 setter offentlig frontier til omtrent 12 timer [5–61] ved 50 % suksess.

  • Kohortestimat med bredt intervall og suite nær metning.
agent-horizon/claim/public-frontier-p50
Observasjon

Samme METR-vurdering setter offentlig frontier til omtrent 1,5 timer [50 minutter–2 timer 40 minutter] ved 80 % suksess.

  • Kohortestimat, ikke navngitt modellrangering.
agent-horizon/claim/public-frontier-p80
Beregning

Punktestimatet for offentlig frontier er åtte ganger lengre ved 50 % enn ved 80 % suksess, noe som viser sterk følsomhet for pålitelighetskravet.

BEREGNING12 hours / 1.5 hours = 8
  • Forholdet bruker avrundede punktestimater; intervallene er brede.
agent-horizon/claim/reliability-gap
Metode

TH1.1 har 228 oppgaver, hvorav 31 er estimert til å ta minst åtte timer og fem av disse har menneskelig baseline.

METR: Time Horizon 1.1 1 målepunkt1 kildefakta
  • Ikke representativ arbeidsmarkedsfordeling.
agent-horizon/claim/suite-coverage
Beregning

Bare 13,6 % av TH1.1-oppgavene er åtte timer eller lengre, og 2,2 % av hele suiten er slike oppgaver med menneskelig baseline.

BEREGNING31 / 228 = 13.6%; 5 / 228 = 2.2%
METR: Time Horizon 1.1 1 målepunkt1 kildefakta
  • Oppgaveantall sier ikke noe om representativitet eller kvalitet.
agent-horizon/claim/long-task-coverage
SPORBAR FAKTALOGG / 5 KILDEFAKTAÅpne logg +
agent-horizon/fact/metr/opus-4-5-p50
320 [170,729] minutes

Claude Opus 4.5 TH1.1 P50

METR · Changes to Model Horizon Estimates table
agent-horizon/fact/metr/suite
228 tasks; 31 at 8h+; 5 human baselined

TH1.1 task suite

METR · Task suite description
agent-horizon/fact/metr/public-frontier-p50
about 12h [5h,61h]

Public frontier TH1.1 P50

METR · Table 1: public frontier Feb–Mar 2026
agent-horizon/fact/metr/public-frontier-p80
about 1.5h [50m,2h40m]

Public frontier TH1.1 P80

METR · Table 1: public frontier Feb–Mar 2026
agent-horizon/fact/metr/limit
above 16h unreliable

Long task reliability boundary

METR · Methodological Details
FORTOLKNINGSGRENSE

Frontierkohorten er ikke en navngitt modellrangering.

Intervallene er brede og metning påvirker P50.

Programvareoppgaver kan ikke generaliseres direkte til vanlig kunnskapsarbeid.

MODULSTATUSSPARSE

Offentlig frontier: ca. 12 t ved 50 % suksess, men ca. 1,5 t ved 80 %