MIT og Sakana AI: SIFT nådde 35,1 prosent på Polyglot etter bare 30 steg
Forskere ved MIT og Sakana AI beskriver et rammeverk som lar en språkmodell dømme kandidater i stedet for å kjøre dyre benchmark-tester på hver endring – med rapporterte resultater over Darwin Gödel Machine til rundt en tiendedel av ressursene.
Forskere ved MIT og det japanske laboratoriet Sakana AI har beskrevet et rammeverk kalt SIFT, kort for Self-Improvement via Fast Tree-search, som skal gjøre det vesentlig billigere å la kodeagenter forbedre seg selv. Ifølge en rapport fra Cryptobriefing (Diego Almada Lopez, 2. oktober 2026) oppnådde SIFT 35,1 prosent på kode-benchmarken Polyglot etter bare 30 utvidelsessteg. Sammenligningspunktet er Darwin Gödel Machine (DGM), en tidligere tilnærming som nådde 30,7 prosent på samme benchmark – men først etter 80 noder.
Alle tallene nedenfor er som rapportert fra artikkelen, ikke uavhengig verifisert.
Hvorfor evalueringen er flaskehalsen
Selvforbedrende kodeagenter fungerer ved å generere mange kandidatendringer i sin egen kode og velge de beste. Problemet er valget: Å avgjøre om en endring faktisk gjør agenten bedre krever tradisjonelt full benchmark-kjøring for hver kandidat. Det gjør søket dyrt i regnekraft og tid, og begrenser hvor bredt man kan lete.
Hvordan SIFT fungerer
SIFT bytter ut de dyre kjøringene med en dommer. I stedet for å benchmarke hver endring lar rammeverket en stor språkmodell sammenligne to kandidatmodifikasjoner og si hvilken som ser bedre ut, ifølge Cryptobriefings beskrivelse av artikkelen.
Dommeravgjørelsene kombineres deretter med en regularisert Bradley-Terry-modell, en statistisk metode for å gjøre parvise preferanser om til en samlet rangering. Selve evalueringen kjøres asynkront, slik at bare kandidatene som kommer på shortlisten møter den virkelige benchmarken.
Poenget er altså ikke å fjerne benchmark-kjøringer helt, men å bruke dem langt mer selektivt: språkmodellen siler, benchmarken bekrefter.
De rapporterte tallene
I tillegg til Polyglot-resultatet rapporteres forbedringer på to andre benchmarks:
- TerminalBench 2.1: fra 29,2 til 36,7 prosent, en økning på 7,5 prosentpoeng.
- SWE-60: fra 40,0 til 52,1 prosent, en økning på 12,1 prosentpoeng fra utgangspunktet.
Kostnadssiden er kanskje det mest iøynefallende. En SIFT-konfigurasjon bygget på den åpne modellen Qwen3-Coder-30B skal ha fullført hele søket på 224 CPU-timer med omtrent 34 dollar i API-kostnader – rundt en tiendedel av ressursene DGM forbruker, ifølge rapporten. Artikkelen oppgir ikke DGMs nøyaktige ressursbruk som detaljert grunnlag.
Hvem står bak, og når
Artikkelen er forfattet av Xinghong Fu ved MIT, sammen med Aravinth Kulanthaivelu og Yutaro Yamada, med Sakana AI som samarbeidende laboratorium. Den ble publisert på arXiv rundt 18. september 2026, og omtale spredte seg i ukene etter.
Hva det betyr
Hvis tallene holder, endrer SIFT økonomien i forskning på selvforbedrende agenter. Søk som tidligere krevde store regneressurser, blir tilgjengelige for mindre team – konfigurasjonen som er rapportert, bruker dessuten en åpen vektmodell, ikke en lukket kommersiell tjeneste. For laboratorier som eksperimenterer med agent-arkitekturer, betyr billigere evaluering flere søk, bredere søk, eller begge deler.
Det er verdt å understreke at dette er en artikkelresultat, ikke dokumentert produksjonsbruk.
Hovedinnvendingen: dommeren
Den sentrale ubesvarte risikoen, som også Cryptobriefing-peker på, er dommerkvaliteten. Hvis språkmodellen foretrekker feil patcher, blir det billigere søket styrt feil – raskere, men i gal retning. Hvor ofte dette skjer, og hvor godt Bradley-Terry-rangeringen motvirker det, er ikke kvantifisert i det tilgjengelige grunnlaget.
Åpne spørsmål
Flere detaljer forblir ubekreftet: det nøyaktige arXiv-identifikatoren, artikkelens fullstendige tittel og fullstendig forfatterliste er ikke bekreftet. DGMs eksakte ressursgrunnlag bak «en tiendedel»-sammenligningen er ikke spesifisert i rapporten, og feilratene til LLM-dommeren er ukjente. Siden alle tall stammer fra én sekundær kilde som refererer artikkelen, gjenstår uavhengig verifisering – særlig av hvorvidt resultatene generaliserer utenfor de tre benchmarkene som er rapportert.

