Ablasjon kan få språkmodeller til å gi feil svar om hvordan de fungerer
En ny arXiv-artikkel argumenterer for at en vanlig teknikk for å kartlegge språkmodeller måler feil objekt: den avlusede modellen, ikke den originale. Forfatternes svar er et rammeverk kalt WISE — og et verktøy hvis virkemåte dekningen ikke forklarer.
Nyheten
Fem forskere — Sankaran Vaidyanathan, Rafal Urbaniak, Emily Bunnapradist, Michelangelo Naim og Daniel Waxman — lastet opp artikkelen «Slaying the Hydra: Interaction-Aware Circuit Discovery in Language Models» til arXiv 2. oktober 2026. Beskrivelsen her er basert på TechTimes' dekning av artikkelen, publisert 6. oktober 2026 (TechTimes).
Påstanden er alvorlig for feltet: ifølge TechTimes' karakterisering har en utbredt teknikk for å forstå hva som skjer inni språkmodeller en strukturell feil som har undergravd tolkbarhetsforskning siden 2023. Det nye bidraget består ifølge dekningen av en formalisering av problemet — og et forslag til hvordan det kan omgås.
Mekanismen: hvorfor ablasjon kan måle feil ting
«Circuit discovery» går ut på å identifisere hvilke komponenter i en modell — nevroner, attention-hoder, lag — som utfører en bestemt oppgave. Standardmetoden er ablasjon: man «slår av» en komponent og ser hvor mye modellens ytelse faller. Jo større fall, desto viktigere komponenten antas å være.
Problemet er at modeller reagerer på ablasjon. Når en komponent fjernes, kan andre komponenter tre inn og kompensere. Dette fenomenet kalles Hydra-effekten, navngitt i en Google DeepMind-artikkel fra 2023 av Thomas McGrath og kolleger — oppkalt etter uhyret som fikk nye hoder når gamle ble hogd av. (TechTimes oppgir at McGrath nå er Chief Scientist hos selskapet Goodfire; dette er ikke verifisert mot primærkilder.)
Konsekvensen: per-komponent-skorer blander sammen komponentens reelle bidrag med den intakte modellens kompensasjonsmekanisme. Målingen gjenspeiler ikke hva komponenten gjør i den originale modellen, men hva systemet gjør når den er borte.
Konkret eksempel: GPT-2 og backup-hodene
Det klassiske eksempelet er GPT-2 og oppgaven «indirekte objektidentifikasjon» (IOI) — setninger av typen «Da John og Maria dro til butikken, ga John sekken til ___» — kartlagt i en artikkel av Wang og kolleger fra 2022. IOI-kretsen inneholder «backup name-mover heads» som normalt er stille. Først når de primære name-mover-hodene slås ut ved ablasjon, aktiveres backup-hodene og tar over.
Det betyr at en ablasjonsstudie av de primære hodene kan underestimere deres betydning: modellen har allerede et beredskapssystem som demper skaden — og det er backup-hodene, ikke den opprinnelige funksjonen, som preger målingen.
Angrepet på etablerte verktøy
Ifølge TechTimes argumenterer artikkelens forfattere for at de store automatiserte circuit discovery-verktøyene — ACDC, Edge Attribution Patching (EAP), Edge Pruning og andre — deler samme grunnleggende begrensning: de skorer komponenter isolert. Kjernen i argumentet gjengis slik: «den felles effekten av et hvilket som helst komponentsett inkluderer kryssinteraksjoner for hver kombinasjon av dets medlemmer, noe per-komponent-skorer ikke kan skille ut» (TechTimes). Med andre ord: interaksjoner mellom komponenter kan ikke fanges opp ved å måle dem én og én.
Forslaget: WISE — og et uavklart verktøy
Artikkelens teoretiske bidrag er witness-integrated set effect (WISE): en familie av kausale estimander som tar forventninger over sett med årsaker og «vitner» samtidig, i stedet for å evaluere komponenter én for én. «Vitnene» er hentet fra det kausale inferensrammeverket til Judea Pearl og Joseph Halpern, og skal brukes til å skille ekte bidrag fra kompensatoriske responser.
Dekningen nevner i tillegg et verktøy kalt JuntaLearner, omtalt sammen med WISE som en del av det nye bidraget. Hvordan verktøyet fungerer, går ikke frem av tilgjengelig dekning. Heller ingen empiriske resultater eller benchmark-tall fra artikkelen er synlige i den tilgjengelige rapporteringen.
Hva som gjenstår uavklart
Flere forbehold bør følge denne saken:
- Én sekundær kilde. Alle tekniske påstander her støtter seg på TechTimes' gjengivelse. Den underliggende arXiv-artikkelen bør leses før tekniske detaljer behandles som fullt dokumenterte.
- Forfatternes argument, ikke etablert virkning. At WISE og JuntaLearner «fikser» circuit discovery, er forfatternes påstand. Metodene er ikke validert av uavhengig empiri, og ingen resultater er tilgjengelige i den tilgjengelige dekningen.
- Karrieredetaljer uverifisert. Opplysningen om at McGrath leder forskning hos Goodfire stammer fra samme sekundære dekning.
Historien er likevel forankret i etablert forskning: Hydra-effekten er et kjent fenomen siden DeepMind-artikkelen i 2023 og Wang-artikkelen i 2022, og kritikken retter seg mot veletablerte verktøy som ACDC, EAP og Edge Pruning. Hvis WISE holder mål i praksis, kan den endre hvordan kretser i språkmodeller kartlegges — men det må bekreftes av uavhengig empiri.

