Bodleian-samlingen havnet i OpenAIs treningssett

Da Universitetet i Oxford og OpenAI kunngjorde samarbeidet i mars 2025, var fortellingen at OpenAIs programvare skulle digitalisere tekster fra det verdensberømte Bodleian-biblioteket, slik at innholdet ble lettere tilgjengelig for…

Illustrasjon: en stabel gamle lærinnbundne bøker forsvinner ned i en smal svart åpning i et bord.
Illustrasjon
Gi artikkelen

Bodleian-samlingen havnet i OpenAIs treningssett

Da Universitetet i Oxford og OpenAI kunngjorde samarbeidet i mars 2025, var fortellingen at OpenAIs programvare skulle digitalisere tekster fra det verdensberømte Bodleian-biblioteket, slik at innholdet ble lettere tilgjengelig for studenter og forskere. Intern modelloping ble ikke nevnt. Ikke desto mindre viser interne dokumenter, ifølge The Guardians reportasje 26. september 2026, at det digitaliserte Bodleian-materialet er brukt til å «fylle OpenAIs treningssett». Saken setter søkelys på hvordan universiteter og biblioteker dokumenterer – og unnlater å dokumentere – hva de faktisk gir selskaper som trenger ferske treningsdata.

Hva ble delt, og hvor mye

Omfanget er delvis dokumentert. Per juni 2025 hadde 125 000 bilder skannet fra historiske avhandlinger blitt delt med OpenAI fra Bodleians samling, blant dem doktoravhandlinger fra europeiske og amerikanske universiteter skrevet på 1800- og 1900-tallet. I tillegg ble en sjelden samling på 10 000 skillingsviser fra 1500-tallet skannet – viser med sangtekster og noter som en gang ble spredt på Tudor-tidens gatehjørner (The Guardian, 26. september 2026).

En talsperson for Universitetet i Oxford, sitert via The Guardian, beskrev digitaliseringen som «beskjeden i omfang» og sa at den bare omfattet materiale utenfor opphavsrett. Bodleian beholder rettighetene til skannene, som skal begynne å publiseres åpent på nettet i løpet av få måneder. Opplysningene er også gjengitt i en japansk bransjerapport som bygger på The Guardian, og som ifølge Oxford begrenser materialet til det der opphavsrettsbeskyttelsesperioden har utløpt, med rettighetene værende hos biblioteket (Hon no Kenkyusha, september 2026). Den japanske kilden er maskinoversatt og bygger på The Guardian, og må derfor behandles som bekreftelse av den samme rapporten, ikke som uavhengig verifikasjon.

Det er verdt å merke seg presisjonen som mangler: Kildene dokumenterer hva som ble delt med OpenAI, men sier lite om hvor mye av dette som reelt ble brukt til modelloping, i motsetning til digitalisering alene. Skillet er ikke dokumentert i det tilgjengelige kildematerialet.

Intern motstand, dokumentert via offentlighetsloven

Møtereferater fra Oxford, innhentet gjennom en forespørsel etter offentlighetslovgivningen (freedom of information), viser at ansatte – deriblant medlemmer av Bodleians styringskomité – uttrykte bekymring for omdømmerisikoen ved å samarbeide med OpenAI, og for effekten på universitetets miljøforpliktelser ved å inngå en avtale som involverer en energikrevende teknologi. Referatene registrerer altså bekymringene som fremsatte synspunkter, ikke som konstaterte skader.

Samme referater diskuterte også opprettelsen av en chatbot kalt «Ask the Bod», og avtalen med OpenAI reiser ifølge The Guardian muligheten for massedigitalisering av Bodleians samling på 23 millioner enheter. Det er et fremtidsperspektiv reist i internt arbeid, ikke en vedtatt plan.

Mønsteret: NextGenAI og jakten på papir

Oxford-avtalen står ikke alene. OpenAI har inngått lignende avtaler med amerikanske forskningsbiblioteker som Boston Public Library, Caltech, MIT og University of Michigan under prosjektet NextGenAI, der Oxford er det eneste britiske medlemmet. Mønsteret peker, slik The Guardian ramer det inn, mot en knapphet: Modellselskaper leter etter ferske data, og det som gjenstår av unikt materiale, befinner seg i stor grad i fysiske samlinger som aldri er skannet.

Den samme logikken preger en parallell reportasje i The Guardian om antikvariske bokhandlere som har registrert en bølge av massebestillinger på obskyne titler – for eksempel en guide om jordbruksredskaper i Afrika på 1700-tallet eller biografier over bilførere på 1950-tallet. Bokhandlerne har spekulert i at nettopp disse titlene, som sjelden finnes digitalisert på nett, representerer ferske data som neste generasjons KI-modeller kan konsumere. Det er viktig å understreke: Dette er bokhandlernes spekulasjon, ikke dokumenterte fakta. Bestillingene er ikke bekreftet som KI-relaterte på dette tidspunktet.

Hva partene sier

En talsperson for OpenAI sa, ifølge The Guardian, at selskapet var «stolt» av å sikre at «dagens KI-modeller bevarer verdens historiske kunnskap for fremtiden», og at det med over en milliard brukere er viktig at teknologien gjenspeiler ulike kulturer, historier og perspektiver. Oxfords talsperson understreket, som nevnt, det beskjedne omfanget og fraværet av opphavsrettsbeskyttet materiale.

Leseren bør merke seg hvordan de to partene snakker forbi hverandre: OpenAI snakker om bevaring og kulturell bredde; Oxford snakker om omfang og opphavsrett. Ingen av de offisielle utsagnene adresserer selve avsløringshullet – at treningsbruk ikke ble nevnt i den opprinnelige kunngjøringen.

Åpne spørsmål

Flere forhold forblir uavklart. For det første er samarbeidets varighet uklar: Én kilde, en japansk KI-nyhetsoppsummering, beskriver det som et «femårig partnerskap» (E&A Forlag, 27. september 2026), men den opprinnelige rapporten fra The Guardian oppgir ingen varighet, og detaljen bør derfor behandles som ubekreftet. For det andre er fordelingen mellom skannet materiale og materiale reelt brukt til modelloping uklar. For det tredje står spørsmålet om transparensprinsippet: Hvis treningsbruk kan være en del av en biblioteksavtale uten å bli nevnt i den offentlige kunngjøringen, vil andre biblioteker som vurderer lignende avtaler da forplikte seg til mer fullstendig informasjon – eller følge Oxfords praksis?

Bodleian-saken er ikke en skandale i klassisk forstand: Materialet var utenfor opphavsrett, rettighetene til skannene forblir hos biblioteket, og publikum skal ifølge Oxford få tilgang. Men den illustrerer et spørsmål som vil bli aktualisert når modellselskaper vender blikket mot fysiske arkiver: Verdien ligger ikke lenger i det som allerede er digitalt tilgjengelig, men i det som kun finnes på papir – og det er universitetene og bibliotekene som må forhandle fram vilkårene, helst før kunngjøringen skrives, ikke etterpå.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.