Punktestimater for samme offentlige frontierkohort.
BESLUTNINGSVISNING / AGENTER
Horisont er et pålitelighetsvalg
Den samme frontierkohorten ser radikalt forskjellig ut ved 50 og 80 prosent suksess. Suitedekningen setter en hard fortolkningsgrense.
Det strengere målet er ofte mer beslutningsrelevant enn P50.
Pålitelighet komprimerer den brukbare horisonten
Punktet er modellert horisont; streken er kildeintervallet. Logaritmisk x-akse gjør 50 minutter og 61 timer lesbare i samme plot.
Vises som kontekst, ikke som ren modelltrend.
Hvor langt ved myntkast-pålitelighet?
Offentlig frontier ligger rundt 12 timer, men intervallet er 5–61 timer og går inn i metningsområdet.
Offentlig frontier, 50 % · Kohortresultat, bred usikkerhet.
Hvor langt ved høyere pålitelighet?
Punktestimatet faller til ca. 1,5 timer med intervall 50 minutter–2 timer 40 minutter.
Offentlig frontier, 80 % · Strengere suksesskrav.
Hvor mye betyr suksesskravet?
De avrundede P50- og P80-punktestimatene skiller åtte ganger.
P50/P80 punktestimat · 720 / 90 ekspertminutter.
Hvor mye langt arbeid finnes i målegrunnlaget?
31 av 228 oppgaver er 8+ timer; bare fem av hele suiten er lange oppgaver med menneskelig baseline.
TH1.1 task suite · 31 er 8+ timer; fem har menneskelig baseline.
Langoppgavedekning · Andel 8t+ / andel 8t+ med menneskelig baseline.
Når bør tallet ikke brukes?
METR markerer horisonter over 16 timer som upålitelige med dagens suite.
Målegrense · Kildeoppgitt begrensning.
- Hentet
- 2026-08-12
- Data
- 2026-01-29
- Lisens
- Cited public research release; analysis repository license applies to its code/data
Public, task-suite-specific agent horizon estimates; this module records only stated values, not a copied raw dataset.
Åpne originalkilde ↗- Hentet
- 2026-08-12
- Data
- 2026-05-08
- Lisens
- Cited public web source; repository license applies separately
Defines time horizon and explicitly marks estimates above 16 hours unreliable in the current suite.
Åpne originalkilde ↗- Hentet
- 2026-08-12
- Data
- 2026-03-31
- Lisens
- Cited public research report
Cohort-level public-frontier TH1.1 results at 50% and 80% reliability; saturation and wide intervals are material limitations.
Åpne originalkilde ↗ETTERPRØVBART GRUNNLAG / 7 PÅSTANDERÅpne grunnlag +
Påstander, beregninger, kilder og kjente grenser for denne visningen. Kildedata og dashboardtolkning holdes adskilt.
METR TH1.1 rapporterer 320 minutter [170–729] for Claude Opus 4.5 ved modellert 50 % suksess.
- Spesifikk modell, suite og agentoppsett.
agent-horizon/claim/opus-p50METRs vurdering for februar–mars 2026 setter offentlig frontier til omtrent 12 timer [5–61] ved 50 % suksess.
- Kohortestimat med bredt intervall og suite nær metning.
agent-horizon/claim/public-frontier-p50Samme METR-vurdering setter offentlig frontier til omtrent 1,5 timer [50 minutter–2 timer 40 minutter] ved 80 % suksess.
- Kohortestimat, ikke navngitt modellrangering.
agent-horizon/claim/public-frontier-p80Punktestimatet for offentlig frontier er åtte ganger lengre ved 50 % enn ved 80 % suksess, noe som viser sterk følsomhet for pålitelighetskravet.
12 hours / 1.5 hours = 8- Forholdet bruker avrundede punktestimater; intervallene er brede.
agent-horizon/claim/reliability-gapTH1.1 har 228 oppgaver, hvorav 31 er estimert til å ta minst åtte timer og fem av disse har menneskelig baseline.
- Ikke representativ arbeidsmarkedsfordeling.
agent-horizon/claim/suite-coverageBare 13,6 % av TH1.1-oppgavene er åtte timer eller lengre, og 2,2 % av hele suiten er slike oppgaver med menneskelig baseline.
31 / 228 = 13.6%; 5 / 228 = 2.2%- Oppgaveantall sier ikke noe om representativitet eller kvalitet.
agent-horizon/claim/long-task-coverageMETR markerer anslag over 16 timer som upålitelige med dagens task suite.
- Ikke et utsagn om faktisk maksimal autonomi.
agent-horizon/claim/long-task-limitSPORBAR FAKTALOGG / 5 KILDEFAKTAÅpne logg +
agent-horizon/fact/metr/opus-4-5-p50Claude Opus 4.5 TH1.1 P50
METR · Changes to Model Horizon Estimates tableagent-horizon/fact/metr/suiteTH1.1 task suite
METR · Task suite descriptionagent-horizon/fact/metr/public-frontier-p50Public frontier TH1.1 P50
METR · Table 1: public frontier Feb–Mar 2026agent-horizon/fact/metr/public-frontier-p80Public frontier TH1.1 P80
METR · Table 1: public frontier Feb–Mar 2026agent-horizon/fact/metr/limitLong task reliability boundary
METR · Methodological DetailsFrontierkohorten er ikke en navngitt modellrangering.
Intervallene er brede og metning påvirker P50.
Programvareoppgaver kan ikke generaliseres direkte til vanlig kunnskapsarbeid.
Offentlig frontier: ca. 12 t ved 50 % suksess, men ca. 1,5 t ved 80 %