Føderert trening slo sentralisert baseline på bryst-røntgen, med rundt to prosentpoeng bedre Macro-AUC

En studie publisert i tidsskriftet Machine Learning, omtalt av [Bioengineer.org](https://bioengineer.org/hospitals-can-now-train-ai-together-without-sharing-a-single-x-ray/) 25.

Illustrasjon: adskilte glassplater med svake beinlignende former forbundet med tynne metalltråder til én sentral plate, som en metafor for føderert trening av modeller på røntgenbilder uten sentralisert datainnsamling.
Illustrasjon
Gi artikkelen

Føderert trening slo sentralisert baseline på bryst-røntgen, med rundt to prosentpoeng bedre Macro-AUC

En studie publisert i tidsskriftet Machine Learning, omtalt av Bioengineer.org 25. september 2026, rapporterer at føderert trening ikke bare beskyttet pasientbildene, men også ga høyere skår enn sentralisert trening på bryst-røntgen-klassifisering. Forskjellen er beskjeden – omtrent to prosentpoeng i Macro-AUC – og alle tallene stammer fra simulerte eksperimenter på et offentlig datasett, ikke fra ekte sykehus. Men hvis funnet holder, utfordrer det en langvarig antakelse i medisinsk KI: at man må samle dataene på ett sted for å få den beste modellen.

Hva som er nytt

Forskergruppen bak studien ledes av Suresh Arumugam ved Dayananda Sagar University i Bengaluru, med kollegaer fra tre andre indiske institusjoner. De introduserer FedXAI-Health, et rammeverk for føderert læring rettet mot multi-etikett-klassifisering av thoraxsykdommer på røntgen – altså å oppdage flere mulige funn i samme bilde (Bioengineer.org).

Det nye i rapporteringen er ikke selve ideen om føderert læring, som lenge har vært foreslått som svar på personvernkrav i helsesektoren. Det er påstanden om resultatet: at den fødererte modellen under alvorlige ikke-uniforme dataforhold – der hver «sykehusklient» har en skjev og ulik fordeling av bilder – oppnådde bedre skår enn en sentralisert modell trent på alle data samlet. Denne fordelen er motintuitiv, og den er foreløpig bare dokumentert gjennom sekundær rapportering av forfatternes egne resultater.

Hvordan føderert læring fungerer

Prinsippet er å sende modellen til dataene, ikke dataene til modellen. Hver deltakende sykehusklient trener et delt nevralt nettverk på sine egne maskiner, lokalt og på egne bilder. Deretter sendes kun modelloppdateringene – ikke pasientbildene – til en sentral server, som slår dem sammen til en oppdatert felles modell. Bildene forlater aldri klienten (Bioengineer.org).

For sykehus som er underlagt personvernregulering som HIPAA i USA og GDPR i Europa, er dette mer enn en teknisk detalj. Ifølge rapporteringen gjør slike lovverk det nesten umulig for medisinske institusjoner å samle røntgenbildene sine i ett treningssett, slik at hver institusjons modell lærer bare av sin egen, ofte smale pasientpopulasjon. Et opplegg der bildene holdes lokalt kan derfor åpne for samarbeid om medisinske modeller der datapooling ville vært blokkert.

Algoritmen som ble brukt til å samle oppdateringene, er FedAvg, den klassiske algoritmen for føderert gjennomsnittsberegning. Ryggraden i nettverket er EfficientNetB0, ifølge rapporteringen. Rammeverket er med andre ord bygget på kjente, etablerte komponenter.

Tallene – og hvordan de ble frembrakt

Eksperimentet er en simulering, ikke en distribusjon. Teamet opprettet et nettverk av fem simulerte sykehusklienter, der hver klient fikk en ulikt fordelt del av det offentlig tilgjengelige NIH Chest X-ray 14-datasettet, med multi-etikett-klassifisering av thoraxfunn som oppgave (Bioengineer.org).

For å etterligne det virkelige problemet – at ulike sykehus ser ulike pasientpopulasjoner – ble dataene partisjonert med Dirichlet-fordelinger med konsentrasjonsparametere fra 0,1 til 5,0. En parameter på 0,1 gir ekstremt skjeve klientdatasett; en parameter på 5,0 nærmer seg en jevn fordeling. Ifølge rapporteringen validerte teamet robustheten over hele dette spekteret.

Hovedresultatet, slik det gjengis: FedAvg med EfficientNetB0 oppnådde en Macro-AUC på 0,8060 ± 0,0048, mens den sentraliserte baselinemodellen – trent på alle data samlet – klarte 0,7859 ± 0,0142. Kilden oppgir forskjellen som «2,0 prosent»; tallene tilsier at det dreier seg om omtrent to prosentpoeng (0,8060 − 0,7859 = 0,0201) til fordel for den fødererte tilnærmingen (Bioengineer.org).

Macro-AUC måler hvor godt modellen skiller positive fra negative tilfeller på tvers av alle diagnoseetikettene, gjennomsnittlig. Alle disse tallene hviler på sekundærkildens gjengivelse av forfatternes resultater.

Hvorfor resultatet er overraskende

Den vanlige forventningen i feltet har lenge vært at føderert læring er en avveining: man får personvern, men betaler med lavere modellskår, fordi skjeve lokale data gir skjeve lokale oppdateringer som er vanskeligere å sammenveie enn en samlet treningsprosess.

At FedAvg i denne studien slo baselinjen direkte, er derfor ikke bare en praktisk detalj – det antyder at noe i opplegget gir en reell fordel, ikke bare unngår et tap. Rapporteringen gjengir imidlertid ingen fullstendig forklaring fra forfatterne på hvorfor den fødererte modellen vant. Den motintuitive fordelen står dermed som en påstand som krever verifisering mot den primære artikkelen, ikke som et forklart funn.

Viktige forbehold

Den viktigste innskranken er at dette foregikk i simulering på et offentlig datasett, med fem konstruerte klienter – ikke i et levende sykehusnettverk. De kunstige Dirichlet-partisjoneringene fanger bare visse former for skjevhet. Ekte sykehusforskjeller omfatter også ulike scannere, protokoller, etiketteringspraksiser og pasientgrupper, og hvordan rammeverket ville klare seg i en slik virkelighet, er ikke testet her.

I tillegg hviler alle tallene på Bioengineer.org sin omtale av studien i Machine Learning; funnene bør derfor leses som forfatternes egne resultater slik de er gjengitt, ikke som uavhengig verifiserte resultater.

Hva det kan bety

Hvis resultatene holder i replikering, har de konsekvenser utover ett enkelt eksperiment. De antyder at personvernvennlig samarbeidstrening ikke nødvendigvis er en kompromissløsning – og at antakelsen om at datapooling er nødvendig for best mulig modell, kan være verdt å teste på nytt. For regulerte sykehusmiljøer under HIPAA og GDPR kan det å senke terskelen for flerinstitusjonell modelltrening bety tilgang til mer varierte treningsdata, og dermed modeller som generaliserer bedre på tvers av pasientpopulasjoner.

Åpne spørsmål

Tre ting mangler før dette kan sies å være avgjort. For det første: en forklaring på hvorfor føderert trening slo sentralisert trening, som ikke er fullstendig gjengitt i rapporteringen. For det andre: uavhengig replikering av tallene, gjerne av grupper uten tilknytning til studien. For det tredje: ytelse i virkelige sykehusnettverk, med ekte klienter, ekte nettverk og ekte reguleringskrav – forhold simuleringen kun antyder noe om. Til den tid er det rimeligste standpunktet at teamet har rapportert et interessant resultat som, hvis det bekreftes, vil være verdt å ta på alvor.


Federated training beat a centralized baseline on chest X-rays, by about two percentage points of Macro-AUC

A study published in the journal Machine Learning, reported by Bioengineer.org on 25 September 2026, found that federated training not only protected patient images but also outscored centralized training on chest X-ray classification. The difference is modest – about two percentage points in Macro-AUC – and all the figures come from simulated experiments on a public dataset, not from real hospitals. But if the finding holds, it challenges a long-standing assumption in medical AI: that data must be gathered in one place to get the best model.

What is new

The research group behind the study is led by Suresh Arumugam of Dayananda Sagar University in Bengaluru, with colleagues from three other Indian institutions. They introduce FedXAI-Health, a federated learning framework aimed at multi-label classification of thoracic diseases on X-rays – that is, detecting multiple possible findings in the same image (Bioengineer.org).

What is new in the reporting is not the idea of federated learning itself, which has long been proposed as an answer to privacy requirements in healthcare. It is the claimed result: that under severe non-uniform data conditions – where each "hospital client" has a skewed and different distribution of images – the federated model achieved better scores than a centralized model trained on all the data pooled together. That advantage is counterintuitive, and so far it is documented only through secondary reporting of the authors' own results.

How federated learning works

The principle is to send the model to the data, not the data to the model. Each participating hospital client trains a shared neural network on its own machines, locally and on its own images. Only the model updates – not the patient images – are then sent to a central server, which merges them into an updated common model. The images never leave the client (Bioengineer.org).

For hospitals subject to privacy regulation such as HIPAA in the United States and GDPR in Europe, this is more than a technical detail. According to the reporting, such laws make it nearly impossible for medical institutions to pool their X-rays into a single training set, meaning each institution's model learns only from its own, often narrow, patient population. A setup in which images stay local can therefore enable collaboration on medical models where data pooling would be blocked.

The algorithm used to aggregate the updates is FedAvg, the classic federated averaging algorithm. The network's backbone is EfficientNetB0, according to the reporting. The framework is thus built on well-known, established components.

The numbers – and how they were produced

The experiment is a simulation, not a deployment. The team created a network of five simulated hospital clients, each client receiving a differently distributed share of the publicly available NIH Chest X-ray 14 dataset, with multi-label classification of thoracic findings as the task (Bioengineer.org).

To mimic the real-world problem – that different hospitals see different patient populations – the data were partitioned using Dirichlet distributions with concentration parameters from 0.1 to 5.0. A parameter of 0.1 yields extremely skewed client datasets; a parameter of 5.0 approaches an even distribution. According to the reporting, the team validated robustness across this entire range.

The headline result, as reported: FedAvg with EfficientNetB0 achieved a Macro-AUC of 0.8060 ± 0.0048, while the centralized baseline model – trained on all the data pooled together – managed 0.7859 ± 0.0142. The source states the difference as "2.0 percent"; the numbers indicate this amounts to roughly two percentage points (0.8060 − 0.7859 = 0.0201) in favor of the federated approach (Bioengineer.org).

Macro-AUC measures how well the model distinguishes positive from negative cases across all the diagnostic labels, on average. All of these figures rest on the secondary source's rendering of the authors' results.

Why the result is surprising

The common expectation in the field has long been that federated learning is a trade-off: you get privacy, but pay with lower model performance, because skewed local data produce skewed local updates that are harder to weigh than a pooled training process.

That FedAvg in this study beat the baseline outright is therefore not just a practical detail – it suggests that something in the setup confers a real advantage, rather than merely avoiding a loss. The reporting, however, does not convey any complete explanation from the authors of why the federated model won. The counterintuitive advantage thus stands as a claim requiring verification against the primary article, not as an explained finding.

Key caveats

The most important limitation is that this took place in simulation on a public dataset, with five constructed clients – not in a live hospital network. The artificial Dirichlet partitions capture only certain forms of skew. Real hospital differences also include different scanners, protocols, labeling practices, and patient groups, and how the framework would fare in that reality was not tested here.

In addition, all the figures rest on Bioengineer.org's coverage of the study in Machine Learning; the findings should therefore be read as the authors' own results as reported, not as independently verified results.

What it could mean

If the results hold up under replication, they have implications beyond a single experiment. They suggest that privacy-preserving collaborative training is not necessarily a compromise solution – and that the assumption that data pooling is necessary for the best possible model may be worth retesting. For regulated hospital environments under HIPAA and GDPR, lowering the barrier to multi-institutional model training could mean access to more varied training data, and thus models that generalize better across patient populations.

Open questions

Three things are missing before this can be considered settled. First: an explanation of why federated training beat centralized training, which the reporting does not fully convey. Second: independent replication of the figures, ideally by groups unaffiliated with the study. Third: performance in real hospital networks, with real clients, real networks, and real regulatory requirements – conditions the simulation only hints at. Until then, the most reasonable position is that the team has reported an interesting result which, if confirmed, will be worth taking seriously.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.