Liten LIFT-modell skal slå like store transformere trent på åtte ganger mer data
Et fersk forskningsarbeid foreslår en måte å løse en av transformermodellenes mest grunnleggende begrensninger på: at informasjon mellom genereringstrinn bare kan flyte gjennom den dekodede token. Arbeidet, publisert som preprint på arXiv, presenterer resultater fra modeller på 135 millioner til 1 milliard parametre – men alt er foreløpig forskernes egne tall.
Hva som er nytt
Den 29. september 2026, klokken 17:57:40 UTC, lastet Dor Tirosh, Ido Amos og Mor Geva opp versjon 1 av preprinten «Pretraining Latent Information Feedback Transformers with Teacher Supervision» på arXiv (arXiv:2609.38149). Artikkelen introduserer LIFT – Latent Information Feedback Transformer – en arkitektur og treningsmetode som ifølge forfatterne gjør det mulig for språkmodeller å propasgere tilstand på tvers av genereringen.
Det betyr i praksis at modellen ikke lenger er avhengig av å klemme alt den har lært mellom ett genereringstrinn og det neste inn i ett enkelt utdatatoken. I stedet sender den en lært, latent tilstand direkte fra ett steg til neste – noe som ellers bare er kjent fra rekurrente nettverk, men her på en måte som bevarer transformerens parallelle forhåndstrening.
Problemet LIFT retter seg mot
I en standard transformer er informasjonsflyten ensrettet: representasjoner i de dype lagene blir aldri sendt tilbake til de grunnere lagene, og den eneste kanalen for informasjon å flyte nedover mellom genereringstrinn er det dekodede tokenet. Det skriver forfatterne i abstractet. Denne smale kanalen tvinger ifølge dem modellene til å beregne mellomresultater på nytt og til å forkaste alternative fortsettelser.
Med andre ord: Når modellen genererer et ord, er alt annet den «tenkte» underveis tapt, med mindre det tilfeldigvis finner veien inn i det valgte tokenet. LIFT tar ifølge forfatterne sikte på å fjerne denne flaskehalsen under forhåndstrening.
Hvordan mekanismen fungerer
Kjernetrikket i LIFT er å gjøre læring av rekurrent tilstand om til et prediksjonsproblem med lærer-tvang (teacher forcing). Hvert inndatatoken parres med en informasjonstett tilstand som er utledet fra neste-token-fordelingen til en ferdig trent språkmodell som hentes fra hyllen. Modellen trenes så til å predikere både neste token og neste tilstand.
Dette gir en praktisk fordel: Siden inndatatilstandene er forhåndsberegnede, forblir forhåndstreningen fullt parallell på tvers av posisjoner – den enorme effektivitetsgevinnen som gjør transformere trenbare i stor skala, går ikke tapt.
Ved inferens endrer bildet seg. Der får ikke modellen lærertilstander lenger; i stedet mates dens egne predikerte tilstander tilbake til neste steg. Det fører til en økning i beregningskostnad, men ifølge forfatterne en beskjeden én – og overheaden avtar med modellstørrelsen. Det er altså en avveining: parallell trening med lærertilstander, tilbakemating av egne tilstander ved generering.
Hva forskerne rapporterer
Alle resultatene nedenfor stammer fra forfatternes egen abstract og er ikke uavhengig verifisert.
Ifølge forfatterne viser eksperimenter med forhåndstrente modeller fra 135 millioner til 1 milliard parametre at LIFT jevnlig overgår standard transformere og baselines på tre typer oppgaver under token-matchede budsjetter: språkmodellering, nedstrøms resonneringsoppgaver og prosessuelle oppgaver. I sammenligninger med beregnings-matchede transformere er LIFT ifølge dem på nivå med eller foran.
Det mest detaljerte resultatet gjelder en kontrollert studie av en tilstandssporingsoppgave (state tracking) – en oppgavetype der modellen må holde rede på en intern tilstand gjennom en sekvens. Der rapporterer forfatterne at en liten LIFT-modell overgikk like store transformere som var trent på åtte ganger mer data. Mer slående: Dette gjaldt til og med når LIFT ble trent med lærertilstander hentet fra en transformer som selv ikke klarte oppgaven. Med andre ord skal metoden ifølge forfatterne kunne trekke ut nyttig tilstandsinformasjon fra en lærer som feiler på selve oppgaven – noe som antyder at lærerens neste-token-fordeling inneholder mer struktur enn dens endelige svar.
Hva som ikke er vist ennå
Flere vesentlige spørsmål står åpne, og de bør veie tungt i lesingen av resultatene:
- Skalering. Evidensen dekker modeller opp til 1 milliard parametre. Om tilbakematingen av egne, predikerte tilstander fortsatt fungerer ved langt større modeller – eller om små feil i de selv-genererte tilstandene akkumulerer over lange generasjoner – er uavklart i det tilgjengelige materialet.
- Kvaliteten på egne tilstander ved inferens. Under trening ser modellen nøyaktige lærertilstander; under generering ser den sine egne prediksjoner. Abstractet oppsummerer denne overgangen, men kvantifiserer ikke hvor god tilstanden faktisk er.
- Praktisk kostnad. Mekanismen krever at lærertilstander forhåndsberegnes fra en eksisterende forhåndstrent modell for hele treningsdataene. Abstractet beskriver overheaden ved inferens, men ikke den praktiske kostnaden ved selve forhåndsberegningen.
- Uavhengig etterkontroll. Detaljerte benchmarktabeller, baselines, modellkonfigurasjoner og eventuell kodeavailabilitet kan ikke verifiseres ut fra abstractet alene, og det foreligger foreløpig ingen sekundær dekning eller ekstern faglig kommentar til arbeidet.
Hvorfor avveiningen kan bety noe
Hvis resultatene holder ved etterkontroll og skalering, peker LIFT på en interessant mellomposisjon i debatten om språkmodellarkitekturer. Transformeres styrke er full parallellitet under trening; rekurrente modellers styrke er eksplisitt tilstand på tvers av steg. LIFT foreslår å få begge deler: tilstandspropagasjon som en prediksjonsoppgave under trening, tilbakemating som en liten kostnad ved kjøring.
Den åpne utfordringen ligger i overgangen mellom de to regimene. Modellene trenes med lærertilstander, men kjører med egne – og om det gapet lukkes pent ved større skala, er det spørsmålet som må besvares før noe annet i resultatene kan tolkes som mer enn et lovende signal fra et ferskt forskningsarbeid.

