Stanford: Gapet mellom kinesiske og amerikanske AI-modeller er krympet fra 1 300 til 39 poeng

Stanfords AI Index for 2026 meldte i oktober at ytelsesgapet mellom de beste amerikanske og kinesiske modellene har krympet til 2,7 prosent. Samtidig viser evalueringer, priser og bruksdata at ledelsen innen resonnering, regnekraft og…

To nesten like høye tårn av matte betongblokker, et i kald grått og et i dempet rødt, står side om side med bare én tykk blokk igjen som avstand – et bilde på det krympende ytelsesgapet mellom amerikanske og kinesiske AI-modeller.
Gi artikkelen

Stanford: Gapet mellom kinesiske og amerikanske AI-modeller er krympet fra 1 300 til 39 poeng

Stanfords AI Index for 2026 meldte i oktober at ytelsesgapet mellom de beste amerikanske og kinesiske modellene har krympet til 2,7 prosent. Samtidig viser evalueringer, priser og bruksdata at ledelsen innen resonnering, regnekraft og talenter fortsatt er målbar – og ulik.

Høsten 2026 har levert en tett klynge av datapunkter om det amerikansk-kinesiske AI-konkurranseskapet, og de peker i retninger som ikke helt lar seg forene. Ifølge Stanfords AI Index for 2026, slik Bloomberg har rapportert om den og Crypto Briefing oppsummerte den 4. oktober, var ytelsesgapet mellom de beste modellene på hver side nede i 2,7 prosent, eller 39 poeng, i mars 2026. I mai 2023 sto gapet i mer enn 1 300 poeng. Mye av arbeidet med å lukke det, skriver Bloomberg, er gjort av DeepSeek.

Men 2,7 prosent måler én ting: generell ytelse på benchmark. Samme uke som tallet ble kjent, kom andre signaler om at de andre «gapene» – resonneringsevne, regnekraft, priser, talenter, faktisk bruk – beveger seg med ulik hastighet, og i enkelte tilfeller ikke krymper i det hele tatt. Denne artikkelen skiller hva hvert tall faktisk måler fra det det lett leses som.

Hva Stanford-tallet fanger – og ikke fanger

AI Index-tallet (2,7 prosent / 39 poeng per mars 2026) er en samlemåling av benchmark-ytelse. Verdt å merke seg: Rapporteringen som er tilgjengelig spesifiserer ikke hvilken benchmark-aggregat tallet bygger på, eller hvilke modeller som sammenlignes. Det betyr at det skal leses som et uttrykk for at toppmodellene nå scorer nesten likt på generelle tester – ikke som et bevis på generell paritet.

Tidslinjen bak tallene er likevel konkret. DeepSeek lanserte resonneringsmodellen R1 i januar 2025, en lansering som ifølge Crypto Briefing plasserte kinesisk AI godt synlig på det globale kartet. V4-serien begynte å rulle ut i april 2026, med åpne vekter, og V4-Pro er priset til omkring 3,96 dollar per million output-tokens.

Der USA fortsatt har målbar ledelse

En evaluering fra CAISI i mai 2026 fant at selv de beste kinesiske modellene ligger 6–8 måneder bak de amerikanske grensemodellene på kompleks resonnering og cybersikkerhetsoppgaver, slik Crypto Briefing gjengir den. DeepSeek V4 Pro lå ifølge CAISI omtrent åtte måneder bak. Det er altså ikke et spørsmål om om kinesiske modeller når dit – det er et spørsmål om hvor lang forsinkelsen er på de tyngste oppgavene. Også her gjelder forbeholdet at evalueringen kun er kjent gjennom sekundær dekningen.

På infrastrukturen: USA står for omkring 74 prosent av regnekraften, og leder på patenter med høy effekt. Kina leder på antall publikasjoner og noen siteringsmål. Det er ulike typer ledelse, men de er ikke like: Publikasjonsvolum er lettere å skalere enn tilgang på beregningskapasitet.

Bruk og pris: tallene som komplekserer bildet

OpenRouter-data (via Crypto Briefing) viser at kinesiske modeller sto for 50–67 prosent av token-prosessering på plattformen i midten av 2026. OpenRouter ruter utviklerforespørsler på tvers av mange modeller, så tallet frister til én konklusjon: utviklere foretrekker kinesiske modeller. Men en uavhengig analyse av samme plattform (publisert 3. oktober 2026) stiller spørsmål ved den konklusjonen. Analysen fant at jo høyere andel rollespill (roleplay) en modell har, desto mindre synker bruken i helger – «det er fullstendig monotont», skriver forfatteren. deepseek-v3.2, med 87 prosent rollespillsandel, hadde et helgefall på bare 0,966. Det tyder på at en vesentlig del av kinesisk modellbruk på OpenRouter er personlig/underholdningsbruk med høy lojalitet, ikke nødvendigvis arbeidslast hvor utviklere aktivt velger kinesiske modeller for tekniske grunner. Analysen bygger kun på OpenRouter-bruk, ikke hele LLM-markedet.

På pris: Jefferies-analysen (rapportert av Wall Street Journal 1. oktober, gjengitt av MSN/WSJ) fant at gjennomsnittlig prisgap mellom amerikanske og kinesiske modeller utvidet seg fra 60 prosent i august til 70 prosent i september 2026 – kinesiske modeller ligger i gjennomsnitt på 30 prosent av amerikansk pris. Men det er en tendens, ikke en regel: Jefferies peker samtidig på at GPT-6 Luna er 74 prosent billigere enn DeepSeek V4.1 Flash. En amerikansk modell som er billigere enn en kinesisk, bryter med fortellingen «kinesisk = billig», og viser at prismarkedet ikke kan leses på tvers av nivåer med én regel.

Talenter: reverseringen som er verdt å forholde seg til

En studie fra Carnegie China, omtalt av New York Post 26. september 2026, hevder at Kina hyrte 41 prosent av verdens ledende AI-forskere i 2025, mot 34 prosent som gikk til amerikanske selskaper. Det er en reversering fra 2022, da tallene var 46 (USA) mot 27 (Kina). Studien sier også at 57 prosent av eliteforskerne tok sin grunnutdanning (bachelor) i Kina.

Verdt å merke seg: Post rammer tallene inn med «angivelig», og selve studien er ikke i grunnlagsmaterialet for denne artikkelen – det vi har er nyhetsdekningen av den. South China Morning Post, sitert av Post, peker på en konkret mekanisme: DeepSeek og MoonShotAI tilbyr nå lønninger som kan måle seg med Silicon Valley. Det forklarer hvordan Kina kan hente tilbake forskere som har utdanning fra landet uten at lønnsnivået er et argument imot.

Et eksempel på bruk, tydelig merket som anekdote

Takahiro Annos førstepersonsrapport fra 26 intervjuer i Paris i september 2026, publisert 30. september, beskriver den franske regjeringens kryss-departementale AI-gateway: Den gir ikke tilgang til lukkede amerikanske modeller (Astra, Fable, Opus, Gemini), og kjører i stedet åpne modeller på Frankrike-sertifisert skyinfrastruktur. DeepSeek er angivelig den mest brukte modellen, tilsynelatende begrenset til kodeoppgaver. Dette er en anekdote – Annos egen tekst er forsiktig («det ser ut som»), teksten er maskinoversatt, og den dekker kun kodebruk. Den er ikke bekreftelse på noe bredere mønster, men den illustrerer én konkret vei der åpne kinesiske vekter faktisk tas i bruk i offentlig sektor.

De åpne spørsmålene

Flere ting gjenstår før de ulike tallene lar seg sette sammen til ett bilde:

  • Hvilken benchmark ligger bak 2,7 prosent? Uten den spesifikasjonen kan tallet ikke sammenlignes direkte med CAISIs 6–8 måneders lag, som måler noe annet (kompleks resonnering, cybersikkerhetsoppgaver).
  • OpenRouter-metodikk. Spennet 50–67 prosent er vidt, og det underliggende grunnlaget er uklart. Uavhengig analyse tyder på at en stor andel av bruken er rollespill – som er reell bruk, men en annen type bruk enn «utvikleradopsjon».
  • Prisdataene. Jefferies' 70 prosent gjennomsnittsgap og DeepSeek V4-Pro til 3,96 dollar per million tokens er ikke åpenbare å forene, og GPT-6 Luna-eksempelet viser at priser varierer sterkt på tvers av modellnivåer.
  • Om CAISI-laget holder. Evalueringen er fra mai 2026, før noen av V4-seriens senere utgivelser kan ha endret bildet. Om 6–8 måneder er et stabilt avstandsmål eller et øyeblikksbilde, er et åpent spørsmål.

Den praktiske konklusjonen er at «gapet krymper» er sant, men ufullstendig: Grenseparitet på generell benchmark er reell, mens ledelsen på resonneringstunge oppgaver, regnekraft og evnen til å beholde topp-talenter fortsatt er målbar og ujevnt fordelt.


Stanford: The gap between Chinese and American AI models has shrunk from 1,300 to 39 points

Stanford's 2026 AI Index reported in October that the performance gap between the best American and Chinese models has narrowed to 2.7 percent. At the same time, evaluations, prices, and usage data show that leadership in reasoning, compute, and talent remains measurable — and uneven.

Autumn 2026 has delivered a dense cluster of data points about the US–China AI competition, and they point in directions that do not quite reconcile. According to Stanford's 2026 AI Index, as reported by Bloomberg and summarized by Crypto Briefing on October 4, the performance gap between the top models on each side was down to 2.7 percent, or 39 points, as of March 2026. In May 2023, that gap stood at more than 1,300 points. Much of the work of closing it, Bloomberg writes, was done by DeepSeek.

But 2.7 percent measures one thing: general benchmark performance. The same week the figure became known, other signals emerged that the other "gaps" — reasoning capability, compute, prices, talent, actual usage — are moving at different speeds, and in some cases not narrowing at all. This article separates what each number actually measures from what it is easily read as.

What the Stanford Figure Captures — and What It Doesn't

The AI Index figure (2.7 percent / 39 points as of March 2026) is an aggregate of benchmark performance. Worth noting: the available reporting does not specify which benchmark aggregate the figure is built on, or which models are compared. That means it should be read as an expression of top models now scoring nearly identically on general tests — not as proof of overall parity.

The timeline behind the figures is nevertheless concrete. DeepSeek launched its reasoning model R1 in January 2025, a release that per Crypto Briefing put Chinese AI visibly on the global map. The V4 series began rolling out in April 2026, with open weights, and V4-Pro is priced at roughly $3.96 per million output tokens.

Where the US Still Holds a Measurable Lead

A May 2026 evaluation from CAISI found that even the best Chinese models lag 6–8 months behind American frontier models on complex reasoning and cyber tasks, as relayed by Crypto Briefing. DeepSeek V4 Pro was, according to CAISI, roughly eight months behind. So the question is not whether Chinese models will get there — it is how long the delay is on the heaviest tasks. The same caveat applies: the evaluation is known here only through secondary reporting.

On infrastructure: the US accounts for roughly 74 percent of compute and leads on high-impact patents. China leads on publication volume and some citation metrics. These are different kinds of leadership, but they are not equivalent: publication volume is easier to scale than access to computing capacity.

Usage and Price: The Numbers That Complicate the Picture

OpenRouter data (via Crypto Briefing) show that Chinese models accounted for 50–67 percent of token processing on the platform in mid-2026. OpenRouter routes developer requests across many models, so the figure tempts toward one conclusion: developers prefer Chinese models. But an independent analysis of the same platform (published October 3, 2026) questions that conclusion. The analysis found that the higher a model's roleplay share, the smaller its usage drop on weekends — "it is completely monotonic," the author writes. deepseek-v3.2, with an 87 percent roleplay share, had a weekend drop of only 0.966. That suggests a substantial portion of Chinese model usage on OpenRouter is personal/entertainment use with high loyalty — not necessarily workloads where developers actively choose Chinese models for technical reasons. The analysis covers only OpenRouter usage, not the entire LLM market.

On price: the Jefferies analysis (reported by the Wall Street Journal on October 1, relayed via MSN/WSJ) found that the average price gap between American and Chinese models widened from 60 percent in August to 70 percent in September 2026 — Chinese models average 30 percent of the American price. But that is a tendency, not a rule: Jefferies simultaneously points out that GPT-6 Luna is 74 percent cheaper than DeepSeek V4.1 Flash. An American model cheaper than a Chinese one breaks with the "Chinese = cheap" narrative and shows the pricing market cannot be read across tiers with a single rule.

Talent: The Reversal Worth Taking Seriously

A study from Carnegie China, covered by the New York Post on September 26, 2026, claims that China hired 41 percent of the world's leading AI researchers in 2025, versus 34 percent who went to American companies. That is a reversal from 2022, when the figures were 46 (US) versus 27 (China). The study also says 57 percent of elite researchers completed their undergraduate education in China.

Worth noting: the Post frames the figures with "reportedly," and the study itself is not in the source material for this article — what we have is the news coverage of it. South China Morning Post, cited by the Post, points to a concrete mechanism: DeepSeek and MoonShotAI now offer salaries that can compete with Silicon Valley. That explains how China can attract back researchers trained in the country without pay levels being an argument against it.

One Usage Example, Clearly Labeled as Anecdote

Takahiro Anno's first-person report from 26 interviews in Paris in September 2026, published September 30, describes the French government's cross-departmental AI gateway: it does not provide access to closed American models (Astra, Fable, Opus, Gemini), and instead runs open models on France-certified cloud infrastructure. DeepSeek is reportedly the most-used model, apparently restricted to coding tasks. This is an anecdote — Anno's own text is cautious ("it appears"), the text is machine-translated, and it covers only coding use. It is not confirmation of any broader pattern, but it illustrates one concrete way open Chinese weights are actually being taken into use in the public sector.

The Open Questions

Several things remain before the various numbers can be assembled into one picture:

  • Which benchmark underlies the 2.7 percent? Without that specification, the figure cannot be directly compared with CAISI's 6–8 month lag, which measures something else (complex reasoning, cyber tasks).
  • OpenRouter methodology. The 50–67 percent range is wide, and the underlying basis is unclear. Independent analysis suggests a large share of usage is roleplay — which is real usage, but a different kind than "developer adoption."
  • The pricing data. Jefferies' 70 percent average gap and DeepSeek V4-Pro at $3.96 per million tokens are not obvious to reconcile, and the GPT-6 Luna example shows prices vary sharply across model tiers.
  • Whether the CAISI lag holds. The evaluation is from May 2026, before any of the V4 series' later releases may have changed the picture. Whether 6–8 months is a stable gap measure or a snapshot is an open question.

The practical conclusion is that "the gap is narrowing" is true but incomplete: frontier parity on general benchmarks is real, while leadership on reasoning-heavy tasks, compute, and top-tier talent retention remains measurable and unevenly distributed.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.