← Tilbake
AI-nyheter

Kinesisk studie: AI-modell som kombinerer ultralyd og DBT hevet spesifisiteten i brøfttriage uten sensitivitetstap

Forskere ved Sun Yat-sen Memorial Hospital i Guangzhou har utviklet en dyp lærings-modell som slår sammen ultralyd og digital brøsttomosyntesi til én risikovurdering per brøft.

AIMag.no
AIMag.no
25. september 2026 · 5 min
To gjennomskinnelige medisinske filmlag legger seg oppå hverandre på en lysbord, der overlappingen danner én tydelig silhuett – en illustrasjon av hvordan ultralyd og tomosyntese slås sammen til én risikovurdering.

Kinesisk studie: AI-modell som kombinerer ultralyd og DBT hevet spesifisiteten i brøfttriage uten sensitivitetstap

Forskere ved Sun Yat-sen Memorial Hospital i Guangzhou har utviklet en dyp lærings-modell som slår sammen ultralyd og digital brøsttomosyntesi til én risikovurdering per brøft. I en patologi-bekreftet kohort på 500 brøfter rapporteres spesifisitet på 0,955 – men resultatene hviler foreløpig på en enkelt pressemelding, og forfatterne selv advarer mot å tolke modellen som et frittstående screeningsverktøy.

Forskere ved Sun Yat-sen Memorial Hospital, tilknyttet Sun Yat-sen-universitetet i Guangzhou, og samarbeidende institusjoner har utviklet og validert et parallelt dyp lærings-rammeverk for risikoklassifisering på brøftnivå, basert på parrede ultralydundersøkelser (US), digital mammografi (DM) og digital brøsttomosyntesi (DBT). Studien er publisert i Precision Clinical Medicine, årgang 9, nummer 3, 2026 (DOI: 10.1093/pcmedi/pbag023), og ble kunngjort via en pressemelding 24. september 2026.

Det konkrete funnet er at kombinasjonen av to modaliteter ser ut til å løfte nettopp det målet som betyr mest for triage: evnen til å ikke sette feil positive flagg. I den patologi-bekreftede kohorten nådde US–DBT-modellen en spesifisitet på 0,955 (95 % konfidensintervall 0,927–0,975) og en positiv prediktiv verdi på 0,958 (0,931–0,977), ifølge pressemeldingen. Sensitiviteten var 0,850 (0,807–0,887) og skilte seg ikke signifikant fra sammenligningsmodellene. Fordelen var altså ikke at modellen fant flere krefttilfeller – den var at den gjorde færre feilaktige bekymringer.

Tallet det hele handler om

Modellen ble trent på 2 187 brøfter og evaluert i to kohorter: en intern valideringskohort på 632 brøfter og en uavhengig kohort på 500 brøfter bekreftet med histopatologi som referansestandard. US–DBT-modellen oppnådde den høyeste observerte arealen under ROC-kurven (AUC) i begge: 0,944 (95 % CI 0,926–0,963) internt og 0,934 (95 % CI 0,913–0,955) i den patologi-bekreftede kohorten.

Pressemeldingen oppgir ikke detaljerte AUC-tall for enkeltmodale sammenligningsmodeller, så det er ikke mulig å si hvor stor avstanden til eksempelvis en ren ultralyd- eller ren DBT-modell var. Det som kan sies fra materialet er at US–DBT hadde den høyeste observerte AUC i begge kohorter, og at sensitiviteten ikke skilte seg signifikant fra hovedsammenligningsmodellene. Gevinsten beskrives av forfatterne som «forbedret spesifisitet uten et signifikant tap av sensitivitet» – altså et triage-relevant resultat, ikke et gjennombrudd i hvor mye kreft som oppdages.

Hvordan modellen er bygget

Arkitekturen består av modalitetsspesifikke grener som behandler ultralyd og DBT hver for seg, før de slås sammen. For DBT-siden brukes en modifisert 2.5D ResNet18 med grupperte konvolusjoner – en tilpasning til tomosyntesens stabledede bildestrimler, som skiller seg fra vanlige todimensjonale mammografibilder. En CBAM-oppmerksomhetsmodul (Convolutional Block Attention Module) brukes til å vekte hvilke bildeområder som påvirker vurderingen, og funksjonene fra de to grenene fusjoneres på funksjonsnivå før en flerlags perceptron (MLP) klassifiserer.

Hver modell produserer en sannsynlighetsscore per brøft, med en på forhånd fastsatt terskel på 0,50. Det betyr at utdataene er en binær risikovurdering per brøft – ikke en diagnose per lesjon, og ikke en erstatning for radiologens lesing.

Hvorfor spesifisitet veier tungt i triage

I et triageoppsett der modellen skal hjelpe til å prioritere hvilke brøfter som bør følges opp, er kostnaden ved falske positive ikke bare unødvendige oppfølgningsundersøkelser, men også pasientbekymring og belastning på kapasiteten. En modell som holder sensitiviteten stabil mens spesifisiteten stiger, vil i praksis peke ut færre brøfter som «mistenkelige» uten å miste krefttilfeller – det er dette forfatterne peker på som modellens mest konsistente fordel.

Det er verdt å merke seg at dette er klassifisering på brøftnivå, ikke pasientnivå eller lesjonsnivå, og at studien bruker histopatologi som gylne standard. Det er en metodisk styrke i den eksterne kohorten, men den betyr også at resultatene gjelder populasjoner der biopsi allerede er foretatt – ikke et generelt screeningspublikum.

Forfatternes egne forbehold

Forfatterne understreker at modellen ikke er ment som et frittstående screenings- eller diagnostisk system, og at prospektiv, multippelsenter-validering er nødvendig før klinisk implementering. De peker også på at det retrospektive, singlesenter-designet begrenser generaliserbarheten: bredere bruk vil avhenge av ekstern validering på tvers av institusjoner, avbildningsplattformer og pasientpopulasjoner, samt prospektiv testing av arbeidsflyt i sanntid og klinikernes tillit til verktøyet.

Med andre ord: resultatene er lovende internt, men det finnes foreløpig ingen dokumentasjon på hvordan modellen oppfører seg i en annen avdeling, på en annen ultralydmaskin, eller i en prospektiv klinisk hverdag.

Sourcing: alle tall stammer fra én pressemelding

AIMag har ikke hatt tilgang til den fagfellevurderte artikkelen selv. Alle tall og sitater i denne saken kommer fra pressemeldingen som ble distribuert via news-medical og Newswise, datert 24. september 2026. De to tilgjengelige kopiene er tekstlig identiske og stammer fra samme utgivelser, slik at de ikke utgjør uavhengig bekreftelse av funnene. Pressemeldingen er utgitt via West China Hospital of Sichuan University, men forholdet mellom denne institusjonen og Sun Yat-sen-teamet er ikke forklart i kildene. Artikkelen er forfattet av Tan Y. med medforfattere, ifølge referansen i pressemeldingen.

De rapporterte ytelsestallene bør derfor leses som det studiet selv rapporterer, ikke som uavhengig verifiserte resultater. Det er heller ikke kjent fra tilgjengelig materiale hvor store forskjellene til enkeltmodale baselinemodeller var i praksis.

Hva som gjenstår

Før modellen kan brukes klinisk, må den valideres prospektivt på flere sentre, på tvers av ulike avbildningsplattformer og pasientgrupper. Forfatterne peker også på behovet for å teste hvordan et slikt verktøy faktisk fungerer i en sanntids screeningsarbeidsflyt – inkludert om klinikere stoler på det nok til å handle i tråd med dets vurderinger. Inntil slike studier foreligger, er det rimelige bildet et lovende triageverktøy med en klar mekanisme (sammenslåing av komplementære modaliteter) og et konkret, men ennå ubekreftet, løfte om bedre spesifisitet.

Kilder

  1. New multimodal AI model improves breast cancer screening accuracy — www.news-medical.net
  2. AI Model Combining Ultrasound and Digital Breast Tomosynthesis Improves Specificity in Breast Cancer Triage | Newswise — www.newswise.com