Sakana AIs KI-vurdering finner 73 % av planlagte feil, men bare 16 % i tilbakkalte artikler

Sakana AIs nye fagfelvurderingssystem imponerer på eget benchmark, der det finner 73,43 % av kjernepåstand-feil til rundt 0,47 dollar per vurdering.

Illustrasjon: rene glasstestplater i en laboratoriemodul, mens én skitten, sammenkrøplet plate ligger forkastet ved siden – et bilde på kunstig fagfelvurdering som fungerer på kontrollerte tester, men strander på virkelige artikler.
Illustrasjon

Sakana AIs KI-vurdering finner 73 % av planlagte feil, men bare 16 % i tilbakkalte artikler

Sakana AIs nye fagfelvurderingssystem imponerer på eget benchmark, der det finner 73,43 % av kjernepåstand-feil til rundt 0,47 dollar per vurdering. Men på virkelig tilbakkalte artikler faller treffsikkerheten til 16,11 % – og det er den kløften som avgjør om KI kan hjelpe fagfelvurderingen i praksis.

Sakana AI har publisert forskningsartikkelen «Beyond Imitation» i TMLR, som beskriver et system for KI-assistert fagfelvurdering bygget rundt feildeteksjon. Artikkelen presenterer to ting samtidig: et eget benchmark for å måle om språkmodeller faktisk finner feil i artikler, og et vurderingssystem kalt Multi-Layered Review (MLR) som er utformet for å slå eksisterende baselines på dette benchmarket.

Tallene er hentet fra MarkTechPosts gjengivelse av artikkelen (10. oktober 2026); selve TMLR-artikkelen har AIMag ikke verifisert uavhengig, og alle resultater nedenfor er altså oppgitt i annenhåndskilde.

Hvordan MLR fungerer

Multi-Layered Review er et agentbasert system bygget på standard Claude-modeller – Sonnet 4 og Haiku 3.5. Tre agenter skal forstå en forskningsartikkel før de kritiserer den, og arbeidet er organisert som en trefasers promptkjede som er inspirert av Keshavs kjente «Three-Pass Approach» for å lese vitenskapelige artikler. Kostnaden er ifølge MarkTechPost omtrent 0,47 dollar per gjennomført vurdering.

Det er altså ikke en ny modell, men en orkestrering av eksisterende modeller med en lesestrategi. Den tilgjengelige dekningen beskriver ikke i detalj hva hver av de tre fasene konkret gjør i systemet.

Benchmarket: motsetninger satt inn etter oppskrift

For å kunne måle feildeteksjon bygget teamet et «Contradiction Benchmark». De samlet 257 artikler med CC-lisens fra ACL, AISTATS, CVPR og ICML 2025, pluss NeurIPS 2024. Deretter bygde Gemini 2.5 Pro en kunnskapsgraf av hver artikkel – påstander, evidens og metoder – og GPT-4.1 omskrev én node per grafavstand til en motsetning. Avstanden fra artikkelens «hovedpåstand» bestemmer alvoret: avstand 0 treffer kjernen av artikkelen, større avstander treffer detaljer. Slik blir 257 artikler til 1 164 innsatte motsetninger.

Vurderingene scores av en o3-dommer som scorer hver vurdering ti ganger. På rene artikler nådde dommeren 99,9 % nøyaktighet, og på manuelt bekreftede funn viste den 86,8 % sensitivitet – noe som ifølge MarkTechPost antyder at rapporterte deteksjonstall kan være konservative, altså snarere for lave enn for høye.

Resultatene – og hva de ikke viser

Med fire vurderinger fanget MLR ifølge MarkTechPosts oppsummering 73,43 % av motsetningene på avstand 0 (kjernepåstander) og 40,95 % samlet. Den beste baselineen, AgentReview, fanget 14,81 % på avstand 0. MarkTechPost rapporterer altså en klar margin over den sterkeste baselineen, men fullstendige resultater for samtlige baselines er ikke gjengitt i den tilgjengelige dekningen.

På ICLR 2025-innsendinger korrelerte MLRs predikerte score med menneskelige vurdereres score med en Pearson-korrelasjon på 0,586 – mot en referanse på 0,742 for korrelasjonen mellom menneskelige vurderere seg imellom. Systemet er altså ikke på nivå med menneskelig samsvar, men heller ikke langt unna.

Det vesentlige forbeholdet kommer på virkelige data: På 211 tilbakkalte arXiv-artikler fra datasettet WithdrarXiv-Check krymper forspranget betydelig. MLR scoret 26,07 % på «lignende» treff og 16,11 % på «eksakte» treff, mot 18,48 % og 9,00 % for de sterkeste baselineene. Forspranget er der, men absolutt nivået er lavt: systemet finner ikke de fleste av de feilene som faktisk førte til tilbakkallelse.

Forklaringen kan ligge i hvordan de to testsettene skiller seg. Benchmark-feilene er konstruert etter en deterministisk oppskrift – en kunnskapsgraf, en node omskrevet til en motsetning, alvorlighet målt i grafavstand. Slike feil har en struktur som en agent som leser i faser kan lære å lete etter. Feilene i tilbakkalte artikler er derimot oppstått i naturen: inkonsekvente data, overdrevne konklusjoner, metodeproblemer. At treffprosenten faller fra 73,43 % til 16,11 % på eksakte treff, er et direkte uttrykk for den kløften.

Hvorfor dette lander nå

Debatten om hvorvidt KI-generert forskning kan stoles på, er i full gang. 8. oktober 2026 skrev TechCrunch om artikkelen «lost in translation», der matematikere argumenterer for at OpenAIs naturspråklige bevis og andre autoformaliserte Lean-bevis ikke bør stoles på uten videre, men må gjennomgå samme fagfelvurderingsprosess og gransking som andre bevis. Sakana AIs MLR kan leses som ett svar på nettopp det tillitsproblemet: hvis KI genererer mer forskning, trengs verktøy som kan avlaste – ikke erstatte – menneskelig fagfelvurdering.

MarkTechPosts oppsummering rapporterer også at systemet fortsatt er sårbart for skjult prompt-injection, altså at ondsinnede instruksjoner gjemt i en artikkel kan manipulere gjennomgangen. Dette punktet er underdokumentert i tilgjengelig dekning, og omfanget av sårbarheten kan ikke verifiseres uten artikkelen selv.

Hva som gjenstår å svare på

De åpne spørsmålene er konkrete. Kan MLRs tilnærming overføres fra planlagte motsetninger til reelle feiltyper, eller trengs helt annen trening og andre lesestrategier? Hvor representativ er ICLR-korrelasjonen på 0,586 på tvers av felter og konferanser? Og hvor alvorlig er prompt-injection-sårbarheten i praksis, når manipulerte artikler er et kjent angrepsmønster mot automatiserte anmeldere?

Foreløpig støtter beviset én konklusjon: MLR er en lovende assistent for feildeteksjon med tydelige målbare styrker – og en benchmark-ytelse som ennå ikke har vist seg på de feilene som betyr mest.

Kilder: MarkTechPost (10. oktober 2026), TechCrunch (8. oktober 2026).

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.