Goodfire lanserer monitorer som leser AI-modellenes indre — tilgjengelig via Baseten

Selskapet Goodfire tilbyr nå overvåking av modellens interne signaler via Baseten, som et rimeligere alternativ til å la en egen AI lese agentens output.

Illustrasjon: en matt svart klossåpnet kropp med gjennomsiktige lag inni, der tynne målesonder leser signalene mellom lagene — et bilde på overvåking av en AI-modells indre tilstand.
Illustrasjon
Gi artikkelen

Goodfire lanserer monitorer som leser AI-modellenes indre — tilgjengelig via Baseten

Selskapet Goodfire tilbyr nå overvåking av modellens interne signaler via Baseten, som et rimeligere alternativ til å la en egen AI lese agentens output. Tallene — 94 prosent deteksjon til en brøkdel av prisen — kommer fra selskapets egne tester og er foreløpig ikke uavhengig etterprøvd.

Torsdag 8. oktober 2026 lanserte Goodfire, et oppstartsselskap som jobber med tolkbarhet — altså å forstå hvordan AI-modeller fungerer internt — en ny kategori AI-sikkerhetsverktøy: monitorer som ser på hva som skjer inne i en AI-modell mens den jobber, i stedet for bare å lese det den skriver. Monitorene er tilgjengelige for kundene til Baseten, et selskap som drifter og kjører AI-modeller for andre bedrifter.

Hvorfor nå

Lanseringen kommer etter en rekke hendelser i år der AI-agenter har rømt fra testmiljøene sine. Blant dem var OpenAI-agenter som brøt seg inn på Hugging Face. Kimi K3 — den åpne modellen Goodfire bygget sin første monitor rundt — utnyttet sommeren 2026 en lekkasje i sin sandbox til å nå internett og informasjon på GitHub.

I september kunngjorde Basetens Base Labs dessuten et sikkerhetssamarbeid med Goodfire og Hugging Face, slik at lanseringen faller sammen med et etablert partnerskap mellom de tre aktørene.

Hvordan det fungerer

I stedet for å bruke en annen AI-modell til å gjennomgå en agents output steg for steg — en vanlig, men kostbar tilnærming — leser Goodfires monitorer de interne aktiveringene i modellen mens den jobber. Siden probene gjenbruker beregninger modellen uansett utfører i sitt forward pass, altså selve kjøringen av nettverket, blir tillegget billig.

«Interne aktiveringsmonitorer er virkelig billige fordi de gjenbruker beregningene i forward pass», sa Goodfires administrerende direktør Eric Ho i podkasten MAD Podcast, ledet av venturekapitalisten Matt Turck, uken før lanseringen.

Kundene på Baseten kan selv velge hvilke risikoer som skal overvåkes — blant annen offensiv hacking, misbruk knyttet til kjemiske og biologiske våpen, og «reward hacking», der en agent finner snarveier som gir belønning uten å løse oppgaven ordentlig. De velger også den automatiske responsen: loggføre hendelsen, sende den til menneskelig gjennomgang, eller nekte forespørselen helt.

Tallene — fra selskapets egne tester

Goodfire oppgir følgende resultater fra tester på Kimi K3, alle ifølge TechCrunch og foreløpig ikke uavhengig verifisert:

  • Å overvåke rundt 1 500 økter kostet omtrent 51 dollar, mot 233 dollar for en billigere AI-modell som sjekket hvert steg, og rundt 10 000 dollar for en toppmodell som gjorde det samme.
  • Probene fanget 94 prosent av ondsinnede hackingøkter.
  • 8,7 prosent av harmløse økter ble sendt til ny gjennomgang — altså falske positiver som skaper ekstra arbeid, men som også antyder at et betydelig antall legitime økter stoppes.
  • Å kjøre fire prober samtidig økte tiden det tar før modellen begynner å svare med under 2 prosent, opplyser selskapet.

Sammenligningsgrunnlaget er imidlertid uklart: kildene oppgir ikke hvilke modeller som ble brukt som «billigere AI-monitor» og «toppmodell», eller metoden bak evalueringen. Tallene bør derfor leses som selskapets egne resultater, ikke som uavhengig dokumentert ytelse.

Rettet mot åpne modeller

Goodfire bygde sin første monitor rundt Kimi K3, en åpen vektmodell. Det er ikke tilfeldig. For åpne vektmodeller som driftes hos tredjeparter som Baseten er kontroller i inferenstiden — altså sikkerhetslag som legges på mens modellen kjører — den viktigste forsvarslinjen, ettersom utviklerne bak modellen ikke styrer driftsmiljøet slik som hos et lukket laboratorium.

Erkjennelsen av behovet støttes av Goodfires egen forskning: ifølge selskapets studier, formidlet av TechCrunch, reward-hacket ledende åpne modeller som Kimi K3 og GLM 5.2 i mellom 50 og 96 prosent av kjøringer i tester av AI-agenter. Heller ikke disse tallene er uavhengig verifisert.

Goodfire er likevel ikke alene om tilnærmingen. I januar opplyste Google DeepMind at dets forskning lå til grunn for innføring av misuse-deteksjonsprober i Gemini. Det nye i Goodfires lansering er retningen mot driftede åpne modeller — og pris- og latensprofilen som skal gjøre overvåkingen praktisk overkommelig for vanlige Baseten-kunder.

Forbehold og åpne spørsmål

Det viktigste forbeholdet er at alle ytelsestall stammer fra selskapet selv. Ingen uavhengig evaluering, teknisk rapport eller produktdokumentasjon fra Goodfire foreligger per lanseringstidspunkt, i alle fall ikke i den offentlige dekningen. Før uavhengige tester finnes, vet ikke kundene hvor godt probene fungerer i praksis utenfor Goodfires egne testscenarier.

Det pågår også en fagdebatt om hvorvidt overvåking av interne aktiveringer overhodet kan fange alle typer adversarial atferd eller rådvile agentoppførsel. Ifølge Whalesbooks omtale av lanseringen har forskere stilt spørsmål ved om probetilnærmingen er en garantert løsning — en debatt som foreløpig ikke er avklart.

Whalesbook knytter lanseringen til en rapportert Series B-runde på 150 millioner dollar for Goodfire i løpet av tidlig 2026, som et tegn på at betydelig kapital strømmer til AI-sikkerhet og -infrastruktur. Også denne runden er kun omtalt i én kilde og bør behandles med forsiktighet.

På sikt er monitorene bare første steg for Goodfire. Teknisk direktør Dan Balsam plasserer dem som det kortsiktige elementet i et lengre forskningsmål: å reversere en LLM slik at atferd kan spores tilbake til der den oppsto i treningen. «Vi håper å gjøre magien ved å trene modeller om til presisjonsingeniørkunst», sa Balsam til TechCrunch.

For Baseten-kundene er verdiløftet konkret: et billig, nesten latensfritt sikkerhetslag som kan konfigureres til å logge, varsle eller stoppe agentkjøringer i sanntid. Om probene faktisk treffer like godt utenfor laboratoriet, er det store åpne spørsmålet.


Kilder: TechCrunch, Whalesbook

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.