Illumina oppgir 17 prosent flere sykdomsassosierte varianter med SpliceAI2, testet på Genomics England-data

Etterfølgeren til 2019-modellen SpliceAI – siteret i over 3 400 publikasjoner og innarbeidet i ClinGen-anbefalinger – bruker kun DNA-sekvens til å forutsi hele transkripter.

Makroillustrasjon av en DNA-lignende tråd der et lite segment lyser svakt, som metafor for å identifisere flere sykdomsassosierte varianter i genomsekvens.
Illustrasjon
Gi artikkelen

Illumina oppgir 17 prosent flere sykdomsassosierte varianter med SpliceAI2, testet på Genomics England-data

Etterfølgeren til 2019-modellen SpliceAI – siteret i over 3 400 publikasjoner og innarbeidet i ClinGen-anbefalinger – bruker kun DNA-sekvens til å forutsi hele transkripter. Men alle tallene kommer fra Illumina selv, og klinisk status er fortsatt et åpent spørsmål.

  1. oktober 2026 lanserte Illumina SpliceAI2, en genomisk AI-modell fra selskapets BioInsight AI Lab som forutsier hvordan genetiske varianter endrer RNA-spleising (Unite.AI). I en vanlig produktsammenheng ville det vært en mindre nyhet. Men originalen fra 2019 er ifølge Illumina sitert i mer enn 3 400 publikasjoner og er innarbeidet i anbefalingene for tolkning av splice-varianter fra ClinGen, et klinisk forskningsorgan som setter standarder for klinisk genomikk. Et verktøy med den posisjonen påvirker ikke bare ett selskaps produktportefølje – det berører en etablert praksis i genomikken for sjeldne sykdommer verden over.

Spørsmålet er derfor ikke bare om SpliceAI2 er teknisk bedre, men hva en oppdatering av et så brukt referanseverktøy betyr for forskere og klinikere som har bygget arbeidsflyten sin rundt forrige versjon.

Hvordan modellen fungerer

Det tekniske hoppet ligger i hva modellen leverer ut fra samme inndata. SpliceAI2 krever kun en DNA-sekvens, sier Illumina, og det skal ifølge selskapet gjøre det mulig å gjøre transkriptnivå-analyse uten RNA-data fra vev som er vanskelig å få biopsi av.

Ifølge et manuskript som beskriver arbeidet, behandler modellen 196 608 basepar genomisk sekvens med om lag 13 millioner trenbare parametre. Spleisingsseter og spleisingskryss predikeres og integreres i en såkalt splice-graf, hvorfra komplette transkripter og deres brukfrekvenser infereres. Det er en vesentlig utvidelse i forhold til kun å predikere lokale spleisingshendelser: Modellen skal altså si noe om hvordan hele transkriptet settes sammen, og i hvilken grad ulike isoformer faktisk brukes.

Opplæringen: over hundre ganger større datasett

Illumina sier at SpliceAI2 er trent på et datasett mer enn hundre ganger større enn forgjengerens. Ifølge manuskriptet ble modellen trent ende-til-ende på 314 745 RNA-sekvenseringsprøver fra menneske og ni andre pattedyrarter, som til sammen dekker mer enn 46 millioner observerte spleisingskryss etter filtrering. I tillegg kom 330 long-read RNA-sekvenseringsprøver fra det offentlige ENCODE-prosjektet – data som gir full-lengde transkripter og dermed trener evnen til å rekonstruere hele isoformer, ikke bare lokale spleisingshendelser.

Tallene – og hvem som står bak dem

Ifølge manuskriptet, slik det er gjengitt i sekundær rapportering, slo SpliceAI2 originalen SpliceAI, Pangolin og AlphaGenome på flere benchmarks:

  • GTEx, kryptiske splice-varianter: auPRC 0,77 mot 0,66 for den nest beste modellen.
  • Kvantifisering av spleisingssetebruk: Spearman-korrelasjon 0,63 mot 0,47 – den største relative forbedringen blant resultatene.
  • sQTL-klassifisering (splicing quantitative trait loci): auROC 0,76 mot 0,73.
  • OpenSplice, en masseparallell reportørprøve: Spearman 0,59 mot 0,55.

Ifølge rapporteringen ble sammenligningene med AlphaGenome kjørt av samarbeidspartnere ved University of Oxford.

Det viktigste tallet er likevel det klinisk forskningsnære: I en analyse av 7 504 probander fra Genomics England 100 000 Genomes Project skal varianter prioritert av SpliceAI2 være signifikant beriket i fenotype-matchede sykdomsgener, med 17 prosent flere sykdomsassosierte varianter enn noen annen testet spleisingsmodell – ved matchede konfidensterskler. At tersklene er matchet, er relevant: det betyr at gevinsten ikke bare kan forklares med at modellen flagger flere varianter, men at den skal ha rangert dem riktigere på samme strenghetsnivå.

Et forbehold gjør seg imidlertid gjeldende for samtlige av disse tallene: De kommer fra Illumina og manuskriptet, formidlet gjennom sekundær rapportering, og er ikke uavhengig verifisert. Konklusjonen «17 prosent flere varianter» gjelder altså Illuminas egne benchmarks og ett bestemt datasett – ikke en dokumentert gevinst i generell klinisk praksis.

Hvor det kan bety noe

Den praktiske gevinsten ligger først og fremst i sjeldne sykdommer. Verktøy som originalen SpliceAI har allerede en fast plass i prioriteringsarbeidet for varianter som påvirker spleising. En modell som både skal treffe flere kryptiske varianter og rekonstruere hele transkripter, kan i teorien flytte flere varianter fra «av ukjent betydning» til «handlingsrettet kandidat» – uten at laboratoriet trenger vevsspesifikt RNA-materiale.

SpliceAI2 plasseres også i en større strategi. Modellen slutter seg til PromoterAI og PrimateAI-3D i Illuminas serie genomiske AI-modeller, som til sammen dekker splice-, promoter- og missense-varianter. Illumina sier at de tre modellene samlet lar forskere identifisere opptil dobbelt så mange varianter med forutsagt biologisk effekt – også det en selskapsangivelse, ikke en uavhengig måling.

De åpne spørsmålene

Flere sentrale spørsmål er ubesvart i det som hittil er rapportert:

  • Forskning eller klinikk? Det er ikke angitt om SpliceAI2 er ment for klinisk bruk eller kun forskning, og ingen regulatorisk status er nevnt.
  • Vil ClinGen følge etter? Originalen er innarbeidet i ClinGen-anbefalinger for splice-varianttolkning. Det er uklart om eller når anbefalingene vil referere til etterfølgeren – og inntil det skjer, vil mange laboratorier fortsette med 2019-modellen.
  • Publiseringsstatus. Det fremgår ikke av den tilgjengelige rapporteringen om manuskriptet er fagfellevurdert eller en preprint.
  • Uavhengig etterprøvbarhet. Siden benchmarks stammer fra utvikleren selv, vil uavhengige replikasjoner – gjerne på andre kohorter enn Genomics England – være den reelle prøven.

SpliceAI2 er dermed foreløpig en lovende, men selvevaluert oppdatering av et av genomikkens mest siterte AI-verktøy. Hvor mye den endrer praksisen rundt spleisingsvarianter, avhenger mindre av benchmark-tallene enn av svarene på spørsmålene som gjenstår.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.