FDA finansierer LLM-jury som skal vurdere KI-radiologirapporter på én million undersøkelser

En 18 måneder lang forskningskontrakt skal avklare om flere språkmodeller som graderer radiologirapporter parallelt kan måle kvaliteten på autonome KI-systemer bedre enn menneskelige leserstudier med noen hundre tilfeller.

Illustrasjon: en vifte av hundrevis identiske røntgenbilder på et bord, hvor ett løftes opp og granskes under en lampe.
Illustrasjon
Gi artikkelen

FDA finansierer LLM-jury som skal vurdere KI-radiologirapporter på én million undersøkelser

En 18 måneder lang forskningskontrakt skal avklare om flere språkmodeller som graderer radiologirapporter parallelt kan måle kvaliteten på autonome KI-systemer bedre enn menneskelige leserstudier med noen hundre tilfeller.

Det amerikanske legemiddel- og matvaretilsynet FDA har tildelt selskapet Cognita Imaging en forskningskontrakt på 1,29 millioner dollar for å bygge og validere et såkalt «LLMs-as-a-jury»-rammeverk: et system der flere store språkmodeller samtidig vurderer radiologirapporter skrevet av mennesker og av generativ KI. Kontrakten løper over 18 måneder, trådte i kraft 22. juni 2026 og er finansiert under FDAs Broad Agency Announcement-program for forskning og utvikling i regulatorisk vitenskap. Det melder bransjepublikasjonen HIT Consultant 16. september 2026, som foreløpig er den eneste kilden for kontraktsfaktaene.

Prosjektet har tittelen «Virtual Subject Matter Expert Agents for Radiology Report Evaluation» og ledes av dr. Akshay Chaudhari, medgründer av Cognita og førsteamanuensis i radiologi og biomedisinsk data science ved Stanford University. Medgründer og administrerende direktør dr. Louis Blankemeier er medundersøker. Cognita er et heleid datterselskap av Mosaic Clinical Technologies og opererer innenfor det bredere Radiology Partners-miljøet. Kontrakten er et forskningsoppdrag, ikke en godkjenning: Ifølge HIT Consultants gjengivelse skal den «fremme standarder for regulatorisk vitenskap» og «utgjør ikke formell FDA-produktgodkjenning eller kommersiell klarering».

Problemet kontrakten peker på

Godkjenning av medisinsk KI hviler tradisjonelt på leserstudier, der radiologer vurderer verktøyets resultater mot en grunnsannhet. Slike studier omfatter typisk bare noen hundre tilfeller. Det betyr at sjeldne kanttilfeller, subtile avvik mellom utstyrsleverandører og regionale variasjoner i arbeidsflyt knapt fanges opp – akkurat idet autonome generative KI-systemer som skriver radiologirapporter uten menneskelig forhåndskontroll nærmer seg utrulling i sykehusmiljøer. Prosjektets begrunnelse, slik HIT Consultant beskriver den, er nettopp dette gapet mellom små evalueringer og store, varierte pasientpopulasjoner.

Hvordan LLM-juryen fungerer

Rammeverket Cognita skal bygge lar flere store språkmodeller jobbe samtidig med samme oppgave: å granske og krysseksaminere både menneskeskrevne og KI-genererte bildediagnostiske rapporter. Poenget med flere modeller er å redusere skjevheter ved at én enkelt modells blindsoner ikke alene bestemmer dommen – samme logikk som i en jury, der flere stemmer skal motvirke én persons skjevheter.

Systemet bygger på GREEN (Generative Radiologist Evaluation and Error Notation), et åpen kildekode-rammeverk Cognita har utviklet tidligere for å fange klinisk meningsfulle avvik mellom radiologens grunnsannhetsrapport og KI-generert tekst. Juryen står altså ikke fritt, men måles mot rapporter skrevet av menneskelige radiologer.

Et nøkkelgrep er menneskelig eskalering. Plattformen isolerer avvik med stor diskrepans og klinisk betydningsfulle uenigheter, og sender dem til ekspertvurdering. Radiologene skal da avgjøre hvor feilen kommer fra: hos genereringsmodellen som skrev rapporten, hos uenigheten innad i LLM-juryen selv, eller hos tvetydigheten i den opprinnelige menneskeskrevne grunnsannheten. Denne tredelingen er essensiell for regulatorisk bruk, fordi en lav poengsum altså ikke nødvendigvis betyr at KI-systemet har sviktet – det kan også være juryen eller referansestandarden som feiler.

Skalaen og valideringsplanen

Evalueringssystemet skal, planen lyder, anvendes på omtrent én million pasientundersøkelser fra et variert amerikansk kohort. Analysen skal kartlegge ytelsesvariasjon på tvers av demografi, behandlingssetting, produsenter av bildediagnostisk utstyr og patologier med lav forekomst. I tillegg inngår en sensitivitetsanalyse av utvalgsstørrelse, som skal kvantifisere hvor mange kanttilfallsfeil små evalueringsdatasett faktisk overser – tall som kan begrunne hvorfor leserstudier alene ikke strekker til.

Initiativet bygger på kliniske arbeidsflyter og datapipelines fra MosaicOS og Radiology Partners-nettverket, som ifølge selskapene selv dekker over 4 000 radiologer og årlig tolker mer enn 55 millioner undersøkelser. Disse skalatallene er altså egne oppgitte tall fra økosystemet, ikke uavhengig verifiserte. Detaljene i ansvarsfordelingen mellom Cognita, Mosaic Clinical Technologies og Radiology Partners er ikke beskrevet i det tilgjengelige kildematerialet.

Leveranser – og grensene for dem

Cognita skal levere tre ting til FDA: programvarekode med åpen kildekode, retningslinjer for benchmarking av multiagent-LLM-jurys, og sammenlignende ytelsesanalyser som kan brukes både i forbindelse med forhåndsgodkjenning (premarket) og i overvåking etter markedsføring (postmarket).

Grensene er like viktige som leveransene. Dette er regulatorisk vitenskap – metodeutvikling for tilsynet – og ikke godkjenning av noe produkt. Og mer grunnleggende: Alt som foreligger per nå er planer. Metoden er ikke validert for regulatoriske beslutninger, og effekten av LLM-jury-tilnærmingen er uavklart. Én million undersøkelser er et mål, ikke et faktum; verken datatilgang, personvernregimer eller etisk godkjenning for datasettet er dokumentert i kildematerialet.

Åpne spørsmål

Tre forhold bør følges. For det første hviler alle kontraktsfakta – beløp, datoer, datasettstørrelse – foreløpig på én enkelt sekundær kilde, HIT Consultant. Verken FDAs egen kunngjøring, offentlige kontraktsregistre eller en pressemelding fra Cognita foreligger i materialet, så tallene kan ikke krysskontrolleres.

For det andre er dataflyten uavklart: Hvordan skal rundt én million pasientundersøkelser fra et kommersielt radiologinettverk flytes inn i et FDA-finansiert forskningsprosjekt, og med hvilke personverngarantier? Det er et spørsmål som får betydning langt utover dette prosjektet, siden lignende ordninger kan bli malen for fremtidig medisinsk KI-regulering.

For det tredje er det ubesvart om en LLM-jury faktisk er pålitelig nok til å inngå i regulatoriske beslutninger. Uenighetene mellom jurymedlemmene må tolkes av mennesker – noe prosjektet selv forutser gjennom eskaleringsmekanismen. Om juryen klarer å skille KI-systemets feil fra grunnsannhetens tvetydighet i praksis, er nettopp det kontrakten over 18 måneder skal finne ut av.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.