16 140 transaksjoner replayet: Hver ny AI-modellversjon fanget opp mindre svindel hos Coinbase

Et internt benchmark utført av Coinbase selv viste at nyere versjoner av tre store AI-modellfamilier fanget opp færre svindeltransaksjoner og en mindre andel av svindelverdien enn forgjengerne — selv om beslutningspolicyen var uendret.

Illustrasjon: Tusenvis av svarte brikker renner nedover en metallrenne, og et slitt sil fanger bare noen få røde brikker mens resten glir forbi.
Illustrasjon

16 140 transaksjoner replayet: Hver ny AI-modellversjon fanget opp mindre svindel hos Coinbase

Et internt benchmark utført av Coinbase selv viste at nyere versjoner av tre store AI-modellfamilier fanget opp færre svindeltransaksjoner og en mindre andel av svindelverdien enn forgjengerne — selv om beslutningspolicyen var uendret. Funnene ble offentliggjort 7. oktober 2026 og gjengitt av CryptoSlate 10. oktober, og de utfordrer en utbredt antakelse i bransjen: at en oppgradering til nyeste grensemodell automatisk forbedrer produksjonssystemene den settes inn i.

Hva som ble målt

Evalueringen var en historisk avspilling — en «replay» — av svindelsiltingen i Coinbases Onramp-tjeneste, der kryptovaluta kjøpes med tradisjonelle betalingsmidler. I følge CryptoSlates gjengivelse av Coinbases publiserte resultater ble 16 140 transaksjoner fra 7 293 brukere spilt av på nytt, inkludert 813 bekreftede svindeltransaksjoner. Kohorten dekket ni uker før Coinbases risikoagent ble rullet ut i produksjon, og oppsettet beholdt alle utmodne svindelforløp mens legitim trafikk ble samplinget.

Slik kunne Coinbase kjøre samme historiske trafikk gjennom ulike modellversjoner og sammenligne dem under identiske vilkår — samme beslutningspolicy og samme svindelgrunnsannhet, bygget på trafikken som faktisk inntraff før risikoagenten ble satt i drift.

Modellene og tallene

Coinbase sammenlignet tre modellpar: Opus 4.5 mot Opus 5, Sonnet 4.6 mot Sonnet 5, og GPT-5.4 mot GPT-5.6 (sol). Ifølge tallene gjengitt av CryptoSlate hadde hver eneste nyere versjon lavere gjenkalling (recall — andelen av den faktiske svindelen som blir fanget opp), lavere F1 (kombinert presisjons- og gjenkallingsscore) og lavere dollervektet gjenkalling (andel av svindelverdien som blir oppdaget).

Spredningen mellom parene var betydelig:

  • Sonnet fikk det største fallet: gjenkallingen sank 22,2 prosentpoeng, og dollervektet gjenkalling falt 22,9 poeng. Også presisjonen ble dårligere — en mindre andel av transaksjonene modellen flagget som svindel, var faktisk svindel.
  • Opus viste et langt mindre, men fortsatt reelt fall: gjenkallingen gikk ned 0,8 poeng, med lavere presisjon også for den nye versjonen.
  • GPT avslørte et annet mønster: presisjonen økte med 11,5 prosentpoeng, men gjenkallingen falt 20,7 poeng og dollervektet gjenkalling 21,8 poeng. Flaggene ble altså mer nøyaktige — samtidig som flere svindelforløp og mer svindelverdi slapp gjennom avspillingen uoppdaget.

Hvorfor ett tall kan skjule en regresjon

GPT-tilfellet er kjernen i hva slags feil denne typen evaluering avdekker. Et team som overvåker en enkelt metrikk — for eksempel presisjon, som måler hvor «riktige» svindelflaggene er — kunne sett en forbedring på over elleve poeng og konkludert med at oppgraderingen var vellykket. Men presisjon og gjenkalling peker i motsette retninger når en modell blir mer konservativ: den flagger færre transaksjoner, og blant dem den flagger, stemmer flere. Resultatet er renere flagg og mer svindel som passerer.

For en produksjonsscreener i et betalingssystem er det gjenkallingen — ikke presisjonen alene — som bestemmer hvor mye svindel faktisk blir stoppet. Derfor er dollervektet gjenkalling kanskje den mest talende metrikkken i evalen: den veier hver tapte gjenkalling etter transaksjonens verdi, og der falt alle tre nye modellversjonene.

Det operasjonelle budskapet er ikke at nye modeller er dårligere i generell forstand, men at en modelloppgradering endrer modellens atferd på måter som kan forskyve balansen mellom falske positiver og tapte svindelforløp — selv når policyen, tersklene og reglene rundt modellen er helt uendret. Coinbases eval illustrerer verdien av å spille historisk trafikk gjennom den nye modellen før utrulling, med metrikkkjeden intakt, i stedet for å oppdatere og håpe på det beste.

Forbehold og åpne spørsmål

Funnene har klare begrensninger, og de fleste er stablet opp i kildematerialet selv.

For det første fastslår replayen ikke reelle kundetap. Avspillingen måler modellatferd i en spesifikk testkonfigurasjon — ni ukers historisk trafikk, fast policy, samplinget legitim trafikk — ikke hva som faktisk skjedde med Coinbases brukere i produksjon. CryptoSlate gjengir eksplisitt dette forbeholdet.

For det andre hviler alle tall i denne saken på én sekundær kilde. Coinbases egen bloggpost eller evalrapport er ikke tilgjengelig i kildegrunnlaget her, så metodikkdetaljer, modellversjonsnavn og alle deltasifre stammer fra CryptoSlates gjengivelse og kan ikke verifiseres mot primærkilden. Versjonsbetegnelser som «Opus 5» og «GPT-5.6 (sol)» er ikke krysssjekket mot noen offisiell utgivelse i det tilgjengelige materialet.

For det tredje er Coinbases oppgitte tiltak ukjent. Kildeteksten er avkortet midt i en setning — ifølge CryptoSlate oppga Coinbase at den kunne identifisere regresjonene med, men setningen stopper der — slik at hva selskapet gjorde med funnene, hvilke modeller som faktisk ble rullet ut, og hvorvidt policyen senere ble justert, forblir åpne spørsmål.

Det er også verdt å merke seg hva evalen ikke sier: den sier ingenting om hvorfor de nyere modellene presterte dårligere, om mønsteret gjelder utenfor dette datasetet, eller om andre modellfamilier ville vist det samme. Det den dokumenterer — hvis tallene holder — er noe mer spisset og nyttig: at en oppgradering av grensemodeller kan gjøre et produksjonssvindelfilter dårligere uten at beslutningslogikken er endret, og at kun en full replay-evaluering med riktige metrikkker avdekker det før kundene gjør det.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.