Selvkritikk som treningsmetode: UniEvo-VL løfter GenEval-score uten ekstern lærer

Et nytt arXiv-papir beskriver en treningsmetode der en multimodal modell forbedrer sin egen bildegenerering ved å kritisere seg selv – med forfatterrapporterte fremskritt på GenEval og GenEval2 Soft-TIFA.

Illustrasjon: Fem trykk av samme bueform hengt på rekke i en studiovegg, der de tidligste trykkene er skjeve og uferdige og det siste er skarpt og komplett. En lupen på hylla peker tilbake mot rekken.
Illustrasjon
Gi artikkelen

Selvkritikk som treningsmetode: UniEvo-VL løfter GenEval-score uten ekstern lærer

Et nytt arXiv-papir beskriver en treningsmetode der en multimodal modell forbedrer sin egen bildegenerering ved å kritisere seg selv – med forfatterrapporterte fremskritt på GenEval og GenEval2 Soft-TIFA. Men forbedringen er ikke jevn over alle oppgaver.

En forskergruppe ledet av Fang Wu, med 18 medforfattere blant dem Jure Leskovec og Yejin Choi, sendte 30. september 2026 inn papiret «UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement» til arXiv (2609.38721). Papiret beskriver en selvdistilleringsmetode der én multimodal modell fungerer som både lærer og elev – og bruker sine egne selvkritikker som «privilegert informasjon» for å bli bedre til å generere bilder.

Hva som er nytt

Vanlig distillering lar en mindre «elevmodell» lære av en større, separat «lærermodell». UniEvo-VL bryter med dette oppsettet. «I stedet for å stole på en separat, ofte større, lærer, utnytter vi deres selvkritikker som privilegert informasjon og ber en enkelt multimodal modell opptre som både lærer og elev med ulike kontekster», skriver forfatterne i abstraktet.

Metoden er bygget på toppen av Qwen-image-2512, en bildesynmodell med åpen kildekode. Arbeidet er et konkret, målbart bidrag til forskningslinjen om rekursiv selvforbedring – men det gjelder forbedring av bildegenerering på spesifikke benchmarks, ikke en dokumentert generell kapabilitet for selvforbedring.

Hvordan metoden fungerer mekanisk

I stedet for å la en ytre modell dømme og belønne, lar UniEvo-VL modellen selv generere kritikk av egne resultater under test-tid beregning. Denne selvkritikken fungerer som «privilegert informasjon» i lærerkonteksten. Treningen minimerer deretter per-state divergens mellom lærerens og elevens denoising-diffusjonsdistribusjoner, målt over elevens egne sampling-trajektorier.

Det betyr, slik abstraktet beskriver det, at elevmodellen under trening genererer bildene sine selv (on-policy), og at lærerkonteksten – samme modell, men med tilgang til selvkritikken – fungerer som et referansepunkt. Divergensminimering trekker elevens denoising-prosess mot det læreren «ville gjort» med samme informasjon, uten at noen ekstern aktør trengs for å lage en label eller en belønning.

Tallene forfatterne rapporterer

Forfatterne oppgir følgende resultater på Qwen-image-2512:

BenchmarkFørEtter
GenEval0,7470,808
GenEval2 Soft-TIFA32,9735,53

Disse tallene er forfatterrapporterte og ikke uavhengig verifiserte. Det offentlig tilgjengelige grunnlaget for papiret er foreløpig abstraktet, og detaljer om treningsoppsett, referansemodeller og ablasjoner kan ikke bekreftes utover det abstraktet gir. Papirets DOI er for øyeblikket oppført som «pendlende registrering» på arXiv-siden.

Hva resultatene antyder om taket for selvforbedring

Forfatterne har også prøvd metoden med sterkere eksterne kritikere, som GPT5.6-Luna (også dette er forfatterrapportert). Funnet deres er at multimodale modeller med sterk dømmekraft kan forvente et høyere tak for egenutvikling. Med andre ord: Jo bedre modellen er til selv å vurdere kvaliteten på sitt eget arbeid, jo mer ser det ut til at den kan lære av seg selv. Dette er en interessant observasjon, men også en som avhenger av at dømmekraften faktisk er god – ellers risikerer modellen å forsterke sine egne feiltolkninger.

Blandede resultater på tekstgjengivelse

Forfatterne er selv tydelige på at metodens gevinster ikke er jevnt fordelt: «blandede tekstgjengivelsesresultater viser at våre selvforbedringer kanskje ikke er ensartede på tvers av ulike oppgaver», skriver de. Tekstgjengivelse i bilder er en velkjent svakhet for diffusjonsbaserte modeller, og dette antyder at selvkritikkbasert læring ikke automatisk overføres til alle deloppgaver innen bildegenerering.

Åpne spørsmål

Flere sentrale detaljer gjenstår å verifisere fra fullteksten:

  • Hvor stor beregningskostnad krever den on-policy selvdistilleringen sammenlignet med tradisjonell distillering?
  • Hvilke referansemodeller ble brukt i GenEval-sammenligningen?
  • Hvilke ablasjoner ble kjørt for å isolere effekten av selvkritikk som privilegium, kontra andre komponenter i treningsopplegget?
  • Hvordan generaliserer metoden til andre multimodale modeller enn Qwen-image-2512?

Disse spørsmålene er relevante for å vurdere om UniEvo-VL representerer en robust, replikerbar tilnærming eller en spesifikk gevinst knyttet til akkurat denne basemodellen og benchmarks.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.