Biohub skal standardisere NIH-data for AI-trening i ny 1,8 milliarder dollar-satsing
Onsdag 7. oktober 2026 kunngjorde den ideelle organisasjonen Biohub at USAs energidepartement, NIH, Meta, Google DeepMind og Isomorphic Labs slutter seg til organisasjonens Virtual Biology Initiative – og løfter de totale forpliktelsene til 1,8 milliarder dollar, ifølge Biohubs egne tall oppgitt til Reuters. Målet er å bygge åpne treningsdatasett for AI-modeller i biologien.
Men kunngjøringen bærer på en spenning som er verdt å se nøye på: Initiativet markedsføres som åpen vitenskap, der datasettene skal være en felles ressurs for hele forskersamfunnet. Samtidig får kommersielle finansieringsaktører en karanteneperiode – ifølge Biohubs vitenskapelige leder Alex Rives omtrent ett år – der de kan jobbe med dataene de har finansiert, før de gjøres offentlig tilgjengelige. Det er altså samme data som Biohub mener er nødvendige for å trene en «universell virtuell celle», som først går gjennom en kommersiell gate.
Hvem bidrar med hva
Tallet på 1,8 milliarder dollar er Biohubs egen oppgitte sum, rapportert av Reuters (Krystal Hu), og består av svært ulike elementer:
- Meta, Google DeepMind og legemiddeloppdagelsesselskapet Isomorphic Labs investerer til sammen 300 millioner dollar.
- Energidepartementet (DOE) investerer over 500 millioner dollar fordelt på fem år, i laboratoriemålinger, modellering og beregninger.
- NIH koordinerer datasett og databaser bygget med over 500 millioner dollar i tidligere føderal finansiering, som Biohub skal standardisere for AI-trening.
- Biohub selv bidro med 500 millioner dollar da initiativet ble lansert i april.
Det er verdt å understreke at dette ikke er 1,8 milliarder dollar i ny kontant. NIH-delen består av ressurser som allerede er finansiert, som nå koordineres og standardiseres – verdifullt, men av en annen karakter enn nye investeringer. Kildene som foreligger, gir heller ikke informasjon om hvordan delene summerer seg presist til totalen på 1,8 milliarder, og ingen primærkilder fra Biohub, DOE eller NIH er tilgjengelige i tilfanget materiale. Alle tall bør dermed leses som Biohubs egne oppgivelser, videreformidlet gjennom Reuters og Axios.
Hvordan dataordningen fungerer
Kjerneideen er enkel: Biohub samler og standardiserer biologiske celldata i stor skala, og gjør dem tilgjengelige for AI-trening. Det er fordelingen over tid som er den interessante delen.
«Med kommersielle finansieringsaktører har vi karanteneperioder, der det er en periode gruppene kan jobbe med dataene, før de blir tilgjengelige som en offentlig vitenskapelig ressurs», sa Biohubs vitenskapelige leder Alex Rives til Reuters.
Overfor Axios var han mer konkret, og beskrev lengden slik: «Vi må ha et eller annet insentiv for at kommersielle aktører skal være med på dette, og karanteneperioden skaper det. Men det er en karantene på ett år. Så det betyr at dataene raskt blir bredt tilgjengelige for vitenskapelig innsats.»
Offentlig finansiert forskning skal ifølge Rives ikke ha slike begrensninger. Logikken er at et års forsprang – tid til å jobbe med ferske data før noen andre – skal være insentiv nok til at selskaper som Meta, Alphabet-eide DeepMind og Isomorphic Labs stiller med kapital. Men det finnes foreløpig ingen tilgjengelig policy eller kontraktsdokumentasjon som beskriver vilkårene i detalj; det vi vet om karantenen, kommer fra Rives' egne beskrivelser til journalister.
Det vitenskapelige målet – og hvor hypotetisk det er
Ifølge Rives består dagens datasett av hundrevis av millioner celler, mens en nøyaktig prediktiv modell krever milliarder og til slutt billiarder. Å lukke det gapet er hele poenget med initiativet.
Første fase skal bygge et bredt kart over cellebiologien, som samler ulike typer informasjon om celler og hvordan de responderer på endringer. Lengre ut, ifølge Rives, kunne en nøyaktig prediktiv modell for biologien dramatisk akselerere vitenskapelige oppdagelser: «En nøyaktig prediktiv modell for biologi kunne dramatisk akselerere vitenskapelige oppdagelser ved å muliggjøre at forskere kan utføre eksperimenter digitalt», sa han, ifølge Dow Jones Newswires. Axios beskriver hans visjon som modeller som kan forutsi de molekylære årsakene til enkeltsykdommer – en slags «digitale eksperimenter» som erstatter noe av laboratoriearbeidet.
Her må man skarpt skille mellom påstand og projeksjon. Tidslinjene Rives trekker opp – første datasett i løpet av omtrent et år, prediktive modeller innen fem år – er hans egne fremskrivninger, ikke dokumenterte milepæler. Og det grunnleggende vitenskapelige spørsmålet er uavklart: om biologien i det hele tatt følger nyttige skaleringslover, slik språkmodeller har gjort med tekst. Axios pekte selv på dette som et åpent spørsmål. Hvis cellebiologi ikke skalerer forutsigbart med datamengde, kan milliarder og billiarder av celler vise seg å kjøpe mindre enn håpet.
Åpen vitenskap, med fotnote
Priscilla Chan, Biohubs medgrunnlegger, forsvarte den åpne profilen i et Reuters-intervju: «Biologien har til nå vært en slags kvikk, oppdagelsesbasert vitenskap», sa hun. «Vi har alltid behandlet dette som en felles ressurs for samfunnet, ikke bare for én gruppe, slik at det kan bygge på seg selv over tid.»
Det er motsetningen som gjør saken lesverdig: Datasettene beskrives som en samfunnseiendel som skal bygge verdi over tid – men i første omgang er de, for finansierende selskaper, et konkurransefortrinn i opptil tolv måneder. Ett år er kort tid i AI-utviklingstakt, og Rives' poeng om at data raskt blir «bredt tilgjengelige» er reelt. Men rekkefølgen betyr noe: den gruppen som finansierer et datasett, får jobbe med det før noen andre. Om det er en rimelig pris for å få privat kapital inn i offentlig forskningsinfrastruktur, eller en utvanning av åpen-vitenskap-idealet, er en verdivurdering – ikke noe kildene svarer på.
Konteksten: kappløpet om biologidata
Kunngjøringen lander midt i et tydelig mønster. De store AI-labbene kjøper seg inn i biologidatagenerering: Anthropic har satset videre på biologi med et våtlaboratorium, mens OpenAI Foundation har startet et tilskuddsprogram på over 125 millioner dollar for å finansiere biologiske og medisinske datasett for AI-forskning. Biohub-avtalen skiller seg ut ved å involvere offentlige institusjoner så direkte, men felles for alle disse initiativene er erkjennelsen av at neste generasjon bio-AI-modeller trenger data som ikke finnes fra før.
Hva som er verdt å følge
Det mest nærliggende å se på fremover er to ting. For det første: Det første datasettet forventes i løpet av rundt et år, ifølge Rives – en tidslinje som lar seg sjekke relativt raskt. For det andre: Om karanteneordningen holder i praksis som en ekte åpen-vitenskapsmodell, eller om ett års kommersielt forsprang blir en presedens som andre store forskningsinitiativer kopierer – og om vilkårene noen gang blir dokumentert offentlig, slik at de kan holdes til rette.

