51 forskere bak preprint om feilvurderte fysikk-benchmarks
En ny preprint på arXiv med 51 oppførte forfattere hevder at ledende fysikk-benchmarks for frontier-modeller er «ødelagte» som evalueringer og nær metning – men så langt finnes påstanden bare i artikkelens tittel.

51 forskere bak preprint om feilvurderte fysikk-benchmarks
En ny preprint på arXiv med 51 oppførte forfattere hevder at ledende fysikk-benchmarks for frontier-modeller er «ødelagte» som evalueringer og nær metning – men så langt finnes påstanden bare i artikkelens tittel. AIMag har ingen bekreftede detaljer utover de bibliografiske fakta, og ingen fagfellevurderingsstatus er bekreftet i den tilgjengelige dokumentasjonen.
Hva som faktisk er verifisert
De verifiserte fakta er snevert bibliografiske, og de stammer fra arXiv-listingen selv (arXiv:2609.13009). Artikkelen finnes på arXiv, den ble innsendt 11. september 2026, registreringsnummeret er arXiv:2609.13009, og forfatterlisten er oppgitt som Ali Ansari og 50 andre forfattere – 51 personer til sammen.
Alt annet er forfatternes egen påstand slik den fremgår av tittelen. Ifølge listingens tittel argumenterer forfatterne for to ting på én gang: at ekspertbasert re-vurdering viser at ledende fysikk-evalueringer feilvurderer frontier-modeller, og at disse evalueringene er nær metning, slik at de knapt lenger skiller mellom ledende systemer. AIMag har verifisert at tittelen fremmer denne påstanden, men har ingen bekreftet informasjon om studiens metode, hvilke benchmarks som ble re-vurdert, hvilke modeller som ble testet, eller noen numeriske resultater. Ingen detaljer utover tittel- og metadata-nivå er tilgjengelige i materialet som er utlevert til denne artikkelen.
En påstand på tittelnivå, ikke et etablert funn
Det er viktig hvordan hovedpåstanden rammes inn. «Ødelagte evalueringer og nesten metning» er ikke et publisert, fagfellevurdert funn på dette tidspunktet; det er en påstand forfatterne fremsetter i artikkelens tittel. Preprinten har ingen bekreftelse på fagfellevurdering i den tilgjengelige dokumentasjonen, og AIMag kjenner ikke til noen uavhengig replikering av resultatene. Selve innholdet i artikkelen – sammendrag, metode og funn – har AIMag ikke gjennomgått, og påstanden kan derfor verken bekreftes eller avkreftes her.
Dersom påstanden holder, ville konsekvensene være betydelige. Benchmark-tall har reell vekt i KI-bransjen: Laboratorier bruker dem i produktkommunikasjon, investorer bruker dem til å vurdere fremdrift, og myndigheter bruker dem til å resonnere om kapabiliteter og risiko. En dokumentert svikt i ledende fysikk-benchmarks' evne til å skille frontier-modeller – eller et dokumentert mønster av rettefeil – ville satt et mye brukt måleverktøy i tvil, og det samme spørsmålet kunne reises for andre fagfelt med lignende evalueringsoppsett.
Men denne resonneringskjeden hviler foreløpig på en tittel. Hvordan forfatternes ekspertbaserte re-vurdering var utformet, hvilke kriterier den brukte, og hvor store eventuelle rettefeil faktisk er, kan ikke vurderes ut fra det materialet som foreligger her.
Hvorfor artikkelen likevel betyr noe nå
Preprinten lander midt i en pågående debatt om hva frontier-modellenes toppscorer på krevende evalueringer egentlig betyr. At en gruppe på 51 forskere ledet av Ali Ansari hevder, i tittelen sin, at ledende fysikk-benchmarks er «ødelagte» som evalueringer og nær metning, er i seg selv et bemerkelsesverdig innspill i den debatten – uansett artikkelens videre skjebne. Det signaliserer at minst én stor forskergruppe anser den vanlige lesningen av fysikk-benchmark-tabeller som upålitelig.
De åpne spørsmålene
Flere ting må skje før påstanden kan behandles som etablert. For det første må hele artikkelen – sammendrag, metode, hvilke benchmarks og modeller som er involvert, og de numeriske funnene – gjennomgås; ingen av disse detaljene finnes i den utleverte dokumentasjonen. For det andre bør fagfellevurderingsstatusen bekreftes når og hvis den endres. For det tredje vil uavhengige kommentarer eller responser fra laboratorier hvis modeller er vurdert, hjelpe med å teste om andre kan replikere re-vurderingens tilnærming og resultater.
Inntil videre er den riktige lesningen at en stor gruppe forskere har fremsatt en påstand på tittelnivå om at ledende fysikk-benchmarks feilvurderer frontier-modeller og knapt klarer å skille mellom dem. Det er et dokumentert innspill i evalueringsdebatten – og på dette stadiet ikke mer enn det.