Visuell derivasjon: Hvordan RLVR gjør et sjekkbar svar om til en gradientoppdatering
De fleste forsterkningslærings-algoritmer som brukes til å trene språkmodeller — fra PPO til GRPO — er ifølge en ny forklarer elaborasjoner av ett og samme konsept: policygradienten. Tyler Romero publiserte 27. september 2026 innlegget «Policy Gradient for LLMs, Explained Visually» på tylerromero.com, en derivasjon fra bunnen av av REINFORCE for en språkmodell som løser et problem med sjekkbar fasit.
Modell som policy
Romeros utgangspunkt er å se språkmodellen gjennom forsterkningslæringens briller. I RL-termer er modellen en policy: For hvert steg ser den på prefikset den har produsert så langt, og gir en sannsynlighetsfordeling over neste token, hvorfra ett token samples.
Sannsynligheten for en hel generert tekst blir da produktet av sannsynlighetene for hvert enkelt token. Det er denne serien av valg, token for token, som skal justeres når modellen skal lære av erfaring.
Hvorfor summene ikke kan regnes ut direkte
Her oppstår det beregningsmessige kjerneproblemet som innlegget bygger videre på. Målfunksjonen summerer over alle mulige fullføringer av en prompt — og hvis den summen lot seg evaluere, kunne man differensiert den direkte. Men det kan den ikke: Med et vokabular på rundt 150 000 tokens har selv en fullføring på 100 tokens flere enn 10^500 muligheter, ifølge Romeros egen illustrasjon. Tallet bør leses for det det er — en illustrasjon av skalaen fra forfatteren selv, ikke en uavhengig verifisert måling — men poenget står seg: Summen kan rett og slett ikke listes opp.
Løsningen, som innlegget deriverer visuelt fra bunnen av, er å estimere gradienten ved sampling i stedet for eksakt utregning — kjernen i REINFORCE-metoden.
Sjekkbare belønninger: RLVR
For å gjøre derivasjonen konkret følger innlegget ett eksempel med sjekkbar fasit — av typen «hva er 17 × 24?». Belønningsfunksjonen i slike oppsett er ofte en verifikator som returnerer R(x, y) = 1 hvis sluttsvaret er riktig og 0 ellers. Dette kalles ofte forsterkningslæring med verifiserbare belønninger, eller RLVR. Matematikkoppgaver med kjent svar og programmeringsoppgaver med enhetstester er de vanligste eksemplene, skriver Romero.
Fordelen med slike oppsett er at belønningen er objektiv og billig å beregne: Enten stemmer svaret, eller så gjør det ikke det. Det gjør det mulig å koble en binær dom direkte til gradientoppdateringen som styrer hvilke tokenvalg som gjøres mer eller mindre sannsynlige neste gang.
PPO, GRPO og én felles idé
Det er her innleggets hovedpoeng ligger. Policygradient-metoder skiller seg fra verdibaserte metoder som Q-learning, som lærer hvor god hver handling er og handler ut fra de estimeringene, i stedet for å justere policyen direkte. Termen «policy gradient» ble standardisert med Sutton et al. (2000), ifølge Romero, og metoder som trenes ved å estimere og følge gradienten kalles policy gradient-metoder. REINFORCE, PPO og GRPO er alle eksempler.
De tre deler samme mål — maksimere forventet belønning — men PPO og GRPO endrer også selve oppdateringen, ved å klippe eller revektere den for å holde treningen stabil. Med andre ord: De to algoritmene som dominerer diskusjonen om trening av språkmodeller i dag, er ifølge forfatteren varianter av samme grunnidé som REINFORCE, med stabiliseringsmekanismer lagt oppå. Derav at en forståelse av policygradienten er nøkkelen til å forstå både PPO, GRPO og RLVR-basert trening.
Hvorfor dette er verdt å lese
Mye av den offentlige diskusjonen om RL-trening av språkmodeller går i forkortelser — PPO, GRPO, RLVR — uten at grunnideen blir forklart. Romeros innlegg gjør motsatt: Det starter ved neste-token-fordelingen og ender ved gradientoppdateringen, gått gjennom steg for steg med visuelle illustrasjoner, for ett enkelt eksempel med sjekkbar fasit.
Innlegget er pedagogisk materiale, ikke en nyhet: Det er én persons tekniske forklaring, publisert 27. september 2026, og derivasjonene og tallillustrasjonene er forfatterens egen fremstilling. Selv om det underliggende stoffet om policygradienter er standard pensum, er en full gjennomgang av derivasjonene i innlegget — inkludert detaljene i hvordan PPO og GRPO klipper og revekterer oppdateringen — verdt å hente hos kilden selv.
Den komplette derivasjonen, med alle figurene og stegene, ligger på tylerromero.com.
Åpne spørsmål
Innlegget reiser også noen spørsmål det ikke selv besvarer: Hvor langt varianter som PPO og GRPO faktisk avviker fra ren REINFORCE i praksis, og hvilke stabiliseringsvalg som betyr mest for treningens utfall, er temaer som fortsatt diskuteres aktivt i feltet. For lesere som vil gå dypere, er Romeros framstilling et utgangspunkt — ikke sluttpunktet — for den diskusjonen.

