Kina eller USA foran? LiveBench og CAISI gir motstridende svar på AI-innhenting

Et notat fra Bloomberg Intelligence hevder at gapet mellom Kinas og USAs beste modeller er nede i 3 prosent, drevet av DeepSeek V4.1 Flash. Men NISTs evalueringsenhet CAISI konkluderte i mai med åtte måneders forskjell.

To nestenhøye stabler av grå måleblokker med en skyvelær mellom seg, som illustrerer et lite men omdiskutert måleggjennop i AI-kappløpet mellom Kina og USA.
Gi artikkelen

Kina eller USA foran? LiveBench og CAISI gir motstridende svar på AI-innhenting

Et notat fra Bloomberg Intelligence hevder at gapet mellom Kinas og USAs beste modeller er nede i 3 prosent, drevet av DeepSeek V4.1 Flash. Men NISTs evalueringsenhet CAISI konkluderte i mai med åtte måneders forskjell. Begge kan ha rett – og det er nettopp det som gjør målingslandskapet så vanskelig å navigere for bedrifter.

Tidlig i oktober 2026 publiserte Robert Lea, senioranalytiker i Bloomberg Intelligence, et notat som dokumenterer et rekordlavt 3 prosent gap mellom Kinas og USAs beste AI-modeller. Drivkraften er DeepSeek V4.1 Flash, utgitt 10. september. Ifølge LiveBench-øyeblikksbildet fra 4. oktober scorer DeepSeek 77,3 på agentbasert koding, mot Anthropics Claude Fable 5.1 Max Effort på 66,1. På den samlede LiveBench-score står det 81,1 mot 83,4 – en forskjell på 2,3 poeng, som rundes til omtrent 3 prosent av Anthropics score.

Tallet er verdt å ta på alvor, men også å plassere nøyaktig. Det kommer fra en analystas notat, formidlet gjennom sekundærkilder, og det beskriver et gap målt på ett konkret benchmark-øyeblikk. NISTs Center for AI Standards and Innovation (CAISI) konkluderte i sin mai-vurdering av DeepSeek V4 Pro – forgjengeren til V4.1 Flash – med noe helt annet: omtrent åtte måneders utviklingsforsprang for USA, målt over ni forhåndsplukkede benchmarks på tvers av fem domener.

Dette er ikke en motsetning som lar seg løse redaksjonelt. Det er en reell metodisk uenighet, og den sier noe viktig om hvor lite «gapet mellom Kina og USA» er én tekst som kan leses ut entydig.

Hva tallene faktisk viser

Gaphistorikken som Lea tegner, er i seg selv en nyhet. Tidligere i 2026 lå gapet på rundt 15 prosent. I mai var det nede i rundt 9 prosent. Nå, etter V4.1 Flash, altså 3 prosent.

Agentbasert koding er dimensjonen som vekker mest oppsikt, fordi den bryter med et vedvarende argument: at Vesten leder nettopp der enterprise-kundene faktisk bruker modellene – koding i agentiske arbeidsflyter. LiveBench-øyeblikksbildet fra 4. oktober viser DeepSeek 11,2 poeng foran Anthropic på denne dimensjonen, mens gapet på samlet score er minimalt.

Men det finnes et andre talllag som krever større forsiktighet. DeepSeeks egen tekniske rapport hevder at V4.1 Flash scorer 74,2 prosent på DeepSWE v1.1, beskrevet som en krevende agentbasert kodebenchmark. Det plasserer modellen foran Anthropics Opus 5 (74,0 prosent) og OpenAIs GPT-5.6 Sol (73,0 prosent). Rapporteringen flagger imidlertid selv at disse tallene er selvevaluering, og at ingen uavhengig tredjepart har publisert validering av dem. Det er altså to forskjellige kunnskapsstatus: LiveBench-tallene er tredjepartsmålinger sitert av en analytiker, DeepSWE-tallene er produsentens egne påstander. De bør ikke blandes.

Hva V4.1 Flash er

En del av forklaringen på hvorfor akkurat denne modellen flytter tallene, ligger i tekniske valg som kutter kostnadene ved inferens.

V4.1 Flash bruker en Mixture of Experts-arkitektur med 748 milliarder parametre totalt – 552 milliarder i selve kjernebackbonen og 196 milliarder Engram-parametre, en ny komponent for vedvarende hukommelse introdusert i denne modellgenerasjonen. Under inferens aktiveres bare et sparsomt utvalg av parametrene per token, noe som holder regnekostnadene nede til tross for den store totale modellstørrelsen.

Modellen støtter et kontekstvindu på opptil 1 million tokens med output på opptil 384 000 tokens, og legger til native bildeforståelse som forgjengeren manglet. Prisingen er oppgitt til 0,30 dollar per million input-tokens og 1,20 dollar per million output-tokens i toppbelastning, med halv pris utenfor toppbelastning.

Kombinasjonen av stort kontekstvindu, sparsom aktivering og aggressiv prising er klassisk rettet mot akkurat de agentiske kodearbeidsflytene der LiveBench nå viser ledelse. Agentiske flyter genererer mange tokens og krever lange kontekster – der slår prismatching og arkitektoniske valg direkte inn i benchmark-ytelse og brukskostnad.

Hvorfor de to målingene krangler

CAISI-vurderingen fra mai og Leas LiveBench-analyse skiller seg på tre punkter som hver for seg er nok til å forklare avviket.

For det første: ulike modeller. CAISI vurderte V4 Pro, ikke V4.1 Flash. Siden V4.1 Flash ble utgitt etter CAISI-vurderingen, måler de to analysene ulike teknologipunkter.

For det andre: ulik tid. Mai er ikke oktober. I en bransje der gaphistorikken ifølge Lea beveget seg fra 15 til 9 til 3 prosent på et halvt år, er et åtte måneder gammelt anslag per definisjon et historisk dokument.

For det tredje: ulik metode. CAISI brukte ni forhåndsplukkede benchmarks på tvers av fem domener – en bredere, mer låst måte å konkludere på. LiveBench gir et øyeblikksbilde på én lederbord-sammensetning. En metode forsøker å fange generell utviklingsforsprang, den andre fanger gjeldende toppytelse på en spesifikk rangering. Begge kan være metodisk forsvarlige og komme til ulike svar.

Det betyr at spørsmålet «har Kina innhentet USA?» ikke har ett svar å hente. Det har minst to, og begge er verdt å kjenne til.

Bredde og bunn

En nyanse som lett drukner i overskriftene: innhentingen skjer ved fronten, ikke på tvers av feltet. Bare tre av de 15 beste modellene på LiveBench er kinesiske. Lea peker også på at det kinesiske markedet nå huser over 1 100 store språkmodeller, og at han ikke forventer at den kinesiske AI-sektoren blir lønnsom før tidligst etter 2030.

Med andre ord: 3 prosent-gap ved toppen sameksisterer med fragmentering i bunn og et uløst lønnsomhetsspørsmål. Lea selv attribuerer innhentingen til kinesiske laboratoriers tekniske fremdrift og optimalisering for innenlandsk maskinvare – noe han mener reiser spørsmål om hvor effektive de amerikanske eksportkontrollene på brikker faktisk er. Det er en konsekvensantagelse, ikke et resultatmål, og den bør leses som det.

Hva en enterprise-kjøper kan og ikke kan trekke ut av dette

Selve benchmark-landskapet gir kjøpere tre konkrete lærdommer.

Én: skill mellom selvevaluering og uavhengig måling. DeepSWE-tallene fra DeepSeek er fabrikkoppgitte. LiveBench-tallene er tredjepartsmålte. Et kjøp basert på agentisk koding bør kreve dokumentasjon fra en uavhengig måling, ikke en teknisk rapport fra selgeren.

To: skill mellom front og felt. Tre kinesiske modeller blant topp 15 er ikke det samme som at det kinesiske modellutvalget generelt er jengodt med det amerikanske. Innhentingen er reell, men smal.

Tre: skill mellom benchmark og produksjonsatferd. Agentbasert koding i en leaderboard måler korte, definerte oppgaver under kontrollerte forhold. Produksjonsbruk innebærer pålitelighet, sikkerhet, integrasjon og kostnad over tid – forhold ingen av de siterte målingene fanger opp.

Uteste spørsmål

Det ærlige regnskapet: alt i denne saken hviler på sekundærkilder. Leas notat fra Bloomberg Intelligence, den underliggende Bloomberg-rapporteringen, LiveBench-øyeblikksbildet fra 4. oktober og DeepSeeks tekniske rapport er ikke tilgjengelige i kildematerialet her – de er sitert gjennom tre sekundære dekninger, hvorav to er nesten identiske syndikeringer av samme artikkel. Det gjør ikke tallene feil, men det betyr at ingen av nøkkeltallene kan sjekkes mot primærkilden i denne saken.

Det betyr også at de åpne spørsmålene er konkrete: Vil en uavhengig tredjepart validere DeepSWE v1.1-tallene på 74,2 prosent? Fanger LiveBenchs sammensetning det enterprise-kjøpere faktisk bryr seg om, eller gir CAISIs bredere domene-måling et mer reelt bilde av avstand? Og hvis Lea har rett i at optimalisering for innenlandsk maskinvare driver innhentingen, hva betyr det så for antakelsene bak eksportkontrollregimet – og for hvor raskt gapet kan endre seg igjen?

Det som kan konstateres med rimelig trygghet er dette: på én tredjepartsmåling, på ett dato, er det beste kinesiske sparket svært nær det beste amerikanske – og på agentbasert koding foran. Hvor mye det betyr for utviklingsavstand, for leverandørvalg og for politikk, avhenger av hvilken av de to målingene man vekter høyest. Og det er akkurat det ingen av kildene kan avgjøre for deg.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.