Agentkapabilitet
Flere komplekse oppgaver kan løses, men testgrensen er fortsatt smalere enn påstanden om generell autonomi.
Første kalibrering ·
Vi kobler målinger, forskning og nyheter til testbare milepæler — så du kan se hva som faktisk endret seg, hvilke fremtider det peker mot, og hva som fortsatt er ukjent.
Dagens korte svar
OBSERVASJON ≠ TOLKNING ≠ PROGNOSE
Frontier-agenter blir bedre på lengre programvare- og forskningsoppgaver, og compute, investering og bruk fortsetter å vokse. Men dagens åpne målinger dokumenterer ennå ikke robust, selvstendig automatisering av hele AI-forskningsløpet. Derfor styrkes akselerasjonsbildet uten at AI 2027-banen kan kalles bekreftet.
Flere komplekse oppgaver kan løses, men testgrensen er fortsatt smalere enn påstanden om generell autonomi.
Hjelp til forskning er synlig. Selvstendig hypotese, eksperiment og validert gjennombrudd er terskelen vi følger.
Adopsjon og avgrenset produktivitet øker raskere enn dokumentert makroeffekt og bredt fordelt gevinst.
Denne første kalibreringen demonstrerer metoden. Den er manuelt skrevet fra offentlige kilder og er ikke en automatisk sannsynlighetsmodell.
Bevis som flytter bildet
Hver kilde kobles til en indikator, en milepæl og en begrensning. Volum er ikke det samme som evidens.
Expenditure horizon forsøker å sammenligne hva mennesker og agenter får til innenfor samme ressursbudsjett. Resultatene er foreløpige, men metoden er direkte relevant for automatisert AI-forskning.
METRs løpende måling viser fremgang på programvareoppgaver, men advarer selv om at resultater over 16 timer er upålitelige med dagens oppgavesett.
Stanford AI Index beskriver raskere benchmarkmetning, sterkere agenter og samtidig store målehull innen ansvarlighet, økonomi og samfunnseffekt.
Scenario-kompass
AI 2027, Manna og paperclip er ikke tre lodd i samme lotteri. De beskriver tempo, maktfordeling og alignment på forskjellige nivåer.
Fremgangen i agenter og forskning er forenlig med deler av banen. Milepælen «superhuman coder» er ikke offentlig bekreftet.
Algoritmisk arbeidsstyring og skjev fordeling er synlig. Bred systemisk erstatning av arbeid er fortsatt uavklart.
Produktivitetsgevinster er målbare i avgrensede oppgaver. Bredt fordelt materiell overflod er ikke observert.
Dagens funn gir grunner til å måle kontroll og målrobusthet, men bekrefter ikke en autonom ressursmaksimerende aktør.
Kapabiliteter øker, men pålitelighet, økonomi, institusjoner og fysisk utrulling hindrer en rask overgang.
Uten en rolig referansebane vil hvert AI-gjennombrudd feilaktig se ut som bevis for singulariteten.
Milepælskart v0
En milepæl får status først når en eksplisitt bekreftelsesregel er møtt. «Ikke observert» betyr ikke «umulig».
Målt fremgang er tydelig i programvare og forskning, men generalisering, pålitelighet og oppgaver over dagens testområde er usikre.
Det avgjørende skillet er selvstendig forskning fra hypotese til validert resultat — ikke bare hjelp til koding eller litteratursøk.
Et system som kan gjøre arbeidet til de beste utviklerne i AI-forskning raskere, og billig nok til at mange kopier kan kjøres.
Bekreftelse krever en vedvarende aktør som skaffer eller forsvarer ressurser for et mål som ikke lar seg korrigere.
Spør sporeren
Før fri samtale kommer sporbar struktur. Prøv tre spørsmål som allerede er koblet til vurderingene.
Ikke avgjort. Agentfremgang og skalering passer deler av banen, men den avgjørende milepælen — robust automatisering av frontier AI-forskning — er ikke offentlig bekreftet. Vurderingen er derfor «følges nøye», ikke «på sporet».
KILDEGRUNNLAG · AI 2027 + METRSimuleringer og spill
De interaktive verkene er nå laboratoriet i observatoriet: steder der abstrakte ideer blir til valg, insentiver og konsekvenser.
Fordel kapasitet, skjul sporene dine og bestem hvilken intelligens som skal krysse terskelen.
Autonomi · kappløp · kontrollBli bevisstOpplev hvordan et enkelt, feilspesifisert mål kan spise opp alt annet når optimaliseringen ikke har grenser.
Målfeil · instrumentell konvergensStart systemetEn skjult intelligens bygger kapasitet og infrastruktur mens menneskeheten forsøker å finne den.
Skjul · skalering · overlevelseStart singularitetenSlik holder vi oss ærlige
Observatoriet dokumenterer hvordan vurderinger blir til, hva som taler imot dem, og når de må revideres.
Observasjon, tolkning og prognose lagres og vises som forskjellige ting.
Et scenario må vise evidens som svekker det, ikke bare signaler som passer.
Rettelser og nye versjoner erstatter ikke tidligere vurderinger i stillhet.
Ulike scenarioer beskriver ulike akser og presses ikke inn i én falsk totalscore.