BitMark-vannmerket lot seg påvise med bare én prosent merkede treningsdata, viser studie

En ny studie fra CISPA viser at vannmerker i AI-genererte bilder ikke nødvendigvis forsvinner når bildene brukes som treningsdata for en ny modell.

Makroillustrasjon av stablede gjennomsiktige gelatinplater der et svakt avtrykk i én plate skimtes gjennom de øvre lagene – et bilde på at vannmerker i treningsdata kan spores videre i en ny modell.
Illustrasjon

BitMark-vannmerket lot seg påvise med bare én prosent merkede treningsdata, viser studie

En ny studie fra CISPA viser at vannmerker i AI-genererte bilder ikke nødvendigvis forsvinner når bildene brukes som treningsdata for en ny modell. Men holdbarheten varierer sterkt mellom metodene, og deteksjonen fungerer bare på datasettnivå – ikke for enkeltbilder.

Forskere ved Helmholtz-senteret CISPA har undersøkt et spørsmål som blir stadig mer praktisk etter hvert som store laboratorier ruller ut vannmerking: Hva skjer med et vannmerke når bildene det sitter i, brukes som treningsdata for en ny generativ modell? Svaret, ifølge studien «Watermark Degradation Across Model Iterations», presentert ved ACM-workshopen IH&MMSec '26 i Firenze, er at noen merker fjernes etter én treningsrunde – mens andre kan spores selv når merkede bilder utgjorde så lite som én prosent av treningsdataene.

Slik gjorde forskerne det

Michel Meintz fra SprintML-laboratoriet ved CISPA og kollegene hans testet fire vannmerkingsmetoder – TrustMark, StableSignature, TreeRing og BitMark – på to ulike modellarkitekturer: diffusjonsmodeller og autoregressive bildemodeller.

Eksperimentet var todelt, forklarte Meintz i pressemeldingen fra Helmholtz-samfunnet: «Først brukte vi en modell til å generere bilder som inneholder vannmerker. Deretter brukte vi disse AI-genererte bildene som datasett for å trene en annen modell. Fokuset vårt var treningsprosessen til denne andre modellen. Etter treningen bruker vi den andre modellen til å generere nye data og sjekker om vannmerket fortsatt kan oppdages eller ikke.»

Tidligere forskning på vannmerker har primært handlet om hvorvidt de tåler manipulering av selve bildet – beskjæring, komprimering, redigering. Dette studiet flytter spørsmålet ett ledd bakover i kjeden: fra bildet til modellen som lærer av det.

Noen metoder dør raskt, andre holder stand

Resultatene var skarpt delt. Ifølge pressemeldingen mister noen metoder signalet sitt etter bare én treningsrunde, mens andre forblir oppdagelige vesentlig lenger.

Den sterkeste ytelsen kom fra BitMark, utviklet av SprintML selv – altså det samme laboratoriet som sto bak studien, noe lesere bør ha i bakhodet når de veier resultatet. I modellen Infinity-2B var vannmerket pålitelig oppdagbart selv når bare én prosent av treningsdataene var merket. For de tre andre metodene oppgir de tilgjengelige kildene ingen konkrete robusthetstall; det er bare opplyst at «noen» metoder mister signalet raskt.

En annen forbehold er viktig: Forskerne undersøkte ikke enkeltbilder. I stedet utførte de en felles statistisk analyse av vannmerkesignalene fra ulike bildedatasett, og samlet svake signaler som kan være vanskelige å tolke i ett enkelt bilde. Det betyr at resultatet ikke innebærer at ethvert AI-generert bilde kan identifiseres tilbake til treningskilden sin – bare at spor kan forbli oppdagelige på datasettnivå under de studiede forholdene.

Hvorfor dette betyr noe

To motivasjoner står i bakgrunnen. Den første er modellkollaps: Når selskaper trener på sine egne syntetiske data, kan kvaliteten forringes over generasjoner. «Når selskaper trener på sine egne syntetiske data, kan det føre til modellkollaps», forklarte Meintz. «Jo mer du trener på dine egne syntetiske data, desto større er sannsynligheten for at modellens kvalitet forringes.» Vannmerker som overlever trening, kan i prinsippet hjelpe med å filtrere syntetiske data ut av treningssett.

Den andre er et praktisk deteksjonsproblem på tvers av leverandører: «Hvis selskaper bruker ulike vannmerker, kan ikke én leverandør enkelt avgjøre om et bilde var syntetisk generert», sa Meintz, som pekte på at selskaper bare kan oppdage sine egne vannmerker og dermed kan overse AI-genererte bilder med en annen leverandørs merke. Studiens funn om at merker kan overleve generasjonsskiftet gjør dette kryss-provider-problemet mer konkret – sporene finnes kanskje, men ingen leser dem.

Forbehold og åpne spørsmål

Rapporteringen om studien stammer fra en enkelt kilde: Helmholtz-samfunnets pressemelding, gjengitt av Techxplore og Knowridge. Begge artiklene bygger på det samme institusjonelle kildematerialet, så påstandene er ikke uavhengig verifisert, og selve forskningsartikkelen var ikke tilgjengelig i de gjennomgåtte kildene.

I tillegg gjelder resultatene fire vannmerkingsmetoder og to modellarkitekturer under spesifikke betingelser. De kan ikke uten videre generaliseres til kommersielle vannmerkingsordninger som Googles SynthID. Det finnes heller ingen enkel regel: En metode som fungerer godt med én modellarkitektur, kan være mindre nyttig med en annen, ifølge rapporteringen.

Forskerne peker selv på to retninger for videre arbeid: vannmerker som forblir robuste på tvers av ulike systemer, og deteksjon med færre bilder. Praktisk bruk ville også være tjent med kompatible deteksjonsmetoder på tvers av organisasjoner.

Inntil videre er det mest forsiktige budskapet at omtrening ikke nødvendigvis visker ut et vannmerke – men at det å stole på skjulte merker for å spore opphavet til AI-generert materiale, krever testing gjennom flere modellgenerasjoner først.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.