OpenAI stanset distillingsangrep mot ChatGPT – med over 15 000 kontoer involvert
Selskapet peker på den kinesiske konkurrenten Moonshot AI – men innrømmer selv at den fulle attribusjonen er uavklart. Kampanjen skal ha pågått siden tidlig juli med over 15 000 kontoer på det meste.
OpenAI hevder å ha avbrutt en koordinert «adversarial distillation»-kampanje mot ChatGPT – et omfattende forsøk på å trekke ut skjult informasjon om hvordan selskapets modeller resonnerer. Ifølge OpenAIs egen kunngjøring, som Bloomberg omtalte 30. september 2026 og The Independent og The News dekket 1. oktober, startet aktiviteten i tidlig juli med lavt volum, økte utover måneden og ble avbrutt 28. juli. Ved avbruddet skal selskapet ha identifisert over 15 000 brukerkontoer knyttet til aktiviteten.
Tiltalen retter seg delvis mot Moonshot AI, det kinesiske selskapet bak den populære Kimi-modellen. Men OpenAI legger selv viktige forbehold: Selskapet oppga ifølge Bloomberg at det ikke kunne knytte alle operatørene til én aktør, men at Moonshot-assosierte brukere spilte «en betydelig rolle» i kampanjen. Moonshot AI har ikke svart på The Independents henvendelser om kommentar.
Hva er distillering – og hva ville angriperne oppnå?
Distillering er i utgangspunktet en etablert og utbredt teknikk i maskinlæring: man bruker en stor, kapabel modell til å generere utdata som en mindre modell trenes på, slik at teknologien under en gitt modell kan overføres eller gjenskapes. The Independent beskriver metoden som en populær, kraftfull og voksende måte å trekke ut teknologien bak spesifikke AI-modeller på, slik at andre selskaper kan bruke den.
Angrepet OpenAI beskriver er en fiendtlig variant av dette. Ifølge Bloomberg forsøkte brukerne å dechiffrere skjult informasjon om hvordan modellene resonerer gjennom problemer – altså den interne resonneringsprosessen som normalt er utilgjengelig for brukerne. OpenAI hevder, som Bloomberg gjengir det, at målet var et bredt omfattende forsøk på å trekke ut data fra GPT-systemene som kunne brukes til å reprodusere resonneringen og evnene til selskapets mest avanserte modeller.
Det er verdt å understreke hva som ikke er etablert: Ingen av kildene i saken oppgir at OpenAI har dokumentert at noen modellkapabilitet faktisk ble reprodusert. Det som foreligger, er en beskrivelse av forsøk og avskjært aktivitet – ikke et bevist resultat.
Tidslinjen og tallene – to målinger som ikke kan forenes
Kronologien er konsistent på tvers av dekningen: Start i tidlig juli med lavt volum, økende intensjon utover måneden, evolusjon over tid, og avbrudd 28. juli. The Independent skriver at kampanjen eskalerte gjennom juli før den ble stoppet.
Tallene er derimot ikke entydige. The Independent og The News oppgir begge over 15 000 brukere respektive brukerkontoer knyttet til aktiviteten. Bloomberg oppgir en topp på 16 000 forespørsler senere i juli. Dette kan være to ulike målinger – antall kontoer versus antall forespørsler – men de to tallene kan ikke forenes ut fra tilgjengelig dekning, og bør ikke blandes sammen. Det poenget er verdt å merke seg, er skalaen: tusenvis av koordinerte kontoer og forespørsler rettet mot ett mål over nesten en måned.
Hvordan ble angrepet stanset?
OpenAI beskriver en flerlags respons, ifølge The News og The Independent:
- Stenging av mistenkte kontoer, inkludert arbeid med tredjepartsleverandører for å lukke kontoer utenfor OpenAIs eget system.
- Lukking av feil som hadde gjort det mulig å se de normalt skjulte resonneringsprosessene systemene bruker for å lage svarene sine.
- Deling av funn med både selskaper og myndigheter.
Det siste punktet peker utover denne enkeltvisningen: Resonneringsmodeller eksponerer i økende grad deler av tankeprosessen sin i utdataene, og det er nettopp denne typen eksponering angriperne kan utnytte. At OpenAI deler funnene med andre aktører, tyder på at selskapet ser metodene som relevante for bransjen som helhet – men dekningen sier ikke hvilke selskaper eller myndigheter som er involvert.
Hvorfor OpenAI rammer det inn som sikkerhetsrisiko
OpenAIs argument har to bein. Det første er sikkerhet: Slike angrep kan ifølge selskapet utgjøre «sikkerhets- og nasjonale sikkerhetsrisikoer» ved at modeller kan kopieres uten at deres sikkerhetsguider følger med – altså at en kopi av en modells evner kan eksistere uten de vernene originalen har.
Det andre er økonomisk og geopolitisk: Metoden gjør det ifølge OpenAI mulig for rivaliserende selskaper – The News knytter rammeverket eksplisitt til Kina – å omgå de enorme investeringene i treningsdata, regnekraft og energi som ligger bak gjennombrudd i front av modellutviklingen. I en tid med skjerpet amerikansk-kinesisk konkurranse om AI-teknologi er det ikke tilfeldig at tiltalen rettes mot en kinesisk aktør.
«Vi forventer at forsøk på fiendtlig distillering blir mer sofistikerte etter hvert som frontmodellene blir bedre og aktørene ser etter billigere måter å etterligne evnene deres på», skrev OpenAI i kunngjøringen, ifølge The Independent. «Å forsvare seg mot denne aktiviteten krever lagdelte kontroller og kontinuerlig tilpasning.»
Hva som forblir uavklart
Saken hviler i sin helhet på OpenAIs egne påstander, gjengitt gjennom sekundærdekning fra Bloomberg, The Independent og The News. OpenAIs blogginnlegg foreligger ikke i dekningen som primærkilde, og det betyr at bakgrunnen for Moonshot-attribusjonen – hvilken konkret dokumentasjon OpenAI har – ikke er tilgjengelig for verifisering.
Attribusjonen er dessuten, som nevnt, eksplisitt delvis: OpenAI sier ikke at Moonshot sto bak hele kampanjen, bare at Moonshot-assosierte brukere spilte en betydelig rolle, og at ikke alle operatører kunne knyttes til én aktør. Moonshot AI har ikke svart på henvendelser, og det finnes derfor ingen motpartsvurdering i saken.
Tre spørsmål står åpne: Hvor mye av den skjulte resonneringsinformasjonen angriperne faktisk fikk ut, er uopplyst. Hvorvidt den ble brukt til å trene noe, er uopplyst. Og det numeriske avviket mellom «over 15 000 kontoer» og «topp 16 000 forespørsler» kan ikke avklares ut fra eksisterende dekning.
Det OpenAIs avsløring uansett viser, er at modellverdien ikke lenger bare ligger i vektene selv, men i den skjulte resonneringen rundt dem – og at beskyttelsen av den nå er blitt en driftsoppgave på linje med cybersikkerhet ellers: kontinuerlig, lagdelt og aldri helt ferdig.

