Mennesker scorer 93,1 % der beste modell stopper på 53,6 % på ny visuell test
Scale Labs lanserte 7. oktober 2026 benchmarken Humanity's Sixth Sense (HSS), som måler noe eksisterende visuelle tester knapt har berørt: den raske, intuitive resonneringen mennesker gjør «med et blikk». Ifølge selskapets egen artikkel når menneskelige deltakere 93,1 prosent nøyaktighet, mens den sterkeste multimodale modellen — GPT-6-astra — bare når 53,6 prosent, selv med maksimal resonneringsinnsats.
Hva HSS faktisk tester
Ifølge artikkelen fra Scale Labs omfatter HSS ulike bilde- og videoinndata, organisert under en strukturert taksonomi, der hvert element parres med menneskeskrevne oppgaver. Oppgavene utforsker implisitt temporal, romlig, sosial og abstrakt struktur — altså det folk uten anstrengelse leser ut av et bilde: hva som nettopp har skjedd, hvordan elementer forholder seg til hverandre i rommet, hva en situasjon handler om sosialt, og hvilke abstrakte mønstre som ligger bak.
Navnet peker på poenget: dette er en evne Scale Labs beskriver som en «sjette sans» — noe mennesker gjør automatisk, men som ifølge selskapet aldri har blitt gjort til et målbar kapabilitetsakse for maskiner. Artikkelen konkluderer med at HSS «etablere intuitiv visuell resonnering som en målbar akse» og retter oppmerksomhet mot en kapabilitet som skalering på eksisterende benchmarks «så langt har etterlatt seg».
Hvorfor eksisterende benchmarks ikke fanger dette opp
Scale Labs' egen begrunnelse for hvorfor dette feltet har vært udekket, er at eksisterende visuelle benchmarks enten tester «bevisst analysering på ekspertnivå» eller «lavnivåpersepsjon» — ikke den intuitive resonneringen folk faktisk utfører i hverdagen. Med andre ord: de fleste tester målir enten tung, langsiktig analyse av komplekst materiell, eller grunnleggende gjenkjenning av objekter og tekst. Intuisjonen som ligger imellom — å forstå en situasjon raskt uten å tenke seg om — har ifølge selskapet stort sett ikke blitt testet i det hele tatt.
Det er også en del av nyhetsverdien her. Frontiermodellene scorer svært høyt på mange eksisterende visuelle benchmarks, men ifølge Scale Labs' artikkel sier ikke det nødvendigvis noe om denne typen evne — noe som tyder på at det kan finnes kapabilitetsakser som dagens trenings- og evalueringsregimer rett og slett ikke har fanget opp.
Tallene og den agentiske varianten
Hovedresultatet, slik det presenteres i Scale Labs' materiale, er altså 93,1 prosent for menneskelige deltakere mot 53,6 prosent for GPT-6-astra — den sterkeste modellen på benchmarken — selv når modellen kjører med maksimal resonneringsinnsats. Det er et betydelig gap, og det er verdt å understreke at dette er selskapets egne rapporterte resultater, ikke uavhengig verifiserte.
Artikkelen utforsker også en agentisk variant: et oppsett som anvender dynamisk visuell manipulering på HSS-oppgavene. Ifølge Scale Labs reduserer dette gapet mellom mennesker og modeller, men lukker det ikke. Det er altså en indikasjon på at modellene kan kompensere noe ved å interagere mer aktivt med det visuelle materialet — men den underliggende svakheten i intuitiv resonnering forsvinner ikke. Detaljene i dette agentiske oppsettet er imidlertid ikke utdypet i det tilgjengelige sammendraget, så det gjenstår å se nøyaktig hva «dynamisk visuell manipulering» innebærer i praksis og hvilke modeller det gagner mest.
Hva vi ikke vet ennå
Det finnes flere åpne spørsmål som det tilgjengelige materialet fra Scale Labs ikke besvarer:
- Metodologi og datasettstørrelse: Antall oppgaver, hvor de kommer fra, og hvordan taksonomikategoriene er fordelt, er ikke spesifisert i sammendraget.
- Deltakergruppe: Hvor mange mennesker som ble testet, og hvem de var, er ikke oppgitt.
- Resultater per kategori: Om temporal, romlig, sosial og abstrakt resonnering differrer systematisk mellom mennesker og modeller fremgår ikke av det tilgjengelige materialet.
- Uavhengig verifisering: Tallene og navnet «GPT-6-astra» — og hvordan denne modellen forholder seg til andre frontiermodeller — er ikke verifisert utenfor Scale Labs' egen rapportering.
Disse hullene er ikke nødvendigvis et tegn på at studien er svak — de er ganske enkelt detaljer som ligger i selve artikkelen, ikke i sammendragssiden den er presentert på. Men før det finnes uavhengige replikasjoner eller gjennomgang av metodikken, bør tallene leses som selskapets egen måling.
Hvorfor det betyr noe
Hvis Scale Labs' resultater holder, peker de på noe viktig i debatten om hvor langt AI egentlig har kommet: at fremgang på eksisterende benchmarks ikke nødvendigvis oversettes til brede, menneskelignende evner. En modell kan yte på ekspertnivå på testbare, avgrensede oppgaver og samtidig falle langt kort på noe så tilsynelatende grunnleggende som å forstå en situasjon «med et blikk».
HSS hevder å måle en slik akse. Om den faktisk fanger en reell, generell kapabilitet — eller om den kan «gamestes» med mer trening og bedre arkitekturer — er et spørsmål de neste månedene med forskning og replikasjon får svare på.

