709 mot 452 tokens per sekund: Inferacts egne målinger plasserer TPU v7 foran GB200 på Kimi K3

Selskapet Inferact, som har flere vLLM-vedlikeholdere på laget, har utgitt åpne «megakjerner» for Google TPU v7, også kjent som Ironwood. Ifølge selskapets egne målinger, formidlet av SemiAnalysis og rapportert av OfficeChai 28.

Illustrasjon: To industrielle prosessortårn side om side, der det høyeste, varmt belyste tårnet representerer raskere ytelse i en sammenligning av chipsgjennomstrømning.
Illustrasjon
Gi artikkelen

709 mot 452 tokens per sekund: Inferacts egne målinger plasserer TPU v7 foran GB200 på Kimi K3

Selskapet Inferact, som har flere vLLM-vedlikeholdere på laget, har utgitt åpne «megakjerner» for Google TPU v7, også kjent som Ironwood. Ifølge selskapets egne målinger, formidlet av SemiAnalysis og rapportert av OfficeChai 28. september 2026, leverer 16 TPU v7-brikker 709 tokens per sekund per bruker på Moonshot AIs Kimi K3 – mot 452 tokens per sekund for 16 Nvidia GB200-GPU-er som kjører vLLMs publiserte oppskrift. Det tilsvarer rundt 1,6 ganger gjennomstrømmingen, eller 56 % bedre, som SemiAnalysis uttrykte det.

Tallene kommer med betydelige forbehold: De stammer fra Inferact selv, som har skrevet både kjernene og sammenligningsmetodikken. Hovedtallet er avhengig av spekulativ dekoding, GB200-baselinen er vLLMs standardoppskrift fremfor en håndoptimalisert kjerne, og resultatene gjelder kun lav batch og én enkelt bruker. Men den underliggende programvare- og maskinvarehistorien – hvordan et TPU-program kan holde en hel modelllags vekter i hurtigminne på chip – er kanskje den viktigste nyheten, spesielt nå som SemiAnalysis beskriver Googles arbeid med å gjøre TPU-er brukbare utenfor egne datasentre som «fullt på».

Megakjerner i Pallas

Megakjernene er skrevet i Googles programmeringsspråk Pallas og pakker alle 92 av Kimi K3s MoE-lag (mixture-of-experts) inn i ett enkelt kall fordelt over 16 brikker. Det er en radikal tilnærming: I stedet for å kjede hvert lag som en rekke mindre operasjoner, med mellomliggende synkronisering og minnetrafikk, styres hele dekodefasen som ett program på tvers av hele brikkeoppstillingen.

Det er her maskinvaredifferensieringen kommer inn. Hver TensorCore har 64 MiB programvarestyrt hurtigminne kalt VMEM – ifølge Inferacts oppgitte spesifikasjoner stort nok til å plassere mesteparten av et lags vekter i forkant, slik at beregningen slipper å vente på henting fra det langsomme hovedminnet. En hel GB200-GPU har til sammenligning rundt 38 MiB sammenlignbart tensor-minne, fordelt på 152 streamingmultiprosessorer.

Utenom minnet er brikkene nesten like. Inferact oppgir 2,31 petaflops BF16-beregning og 7,38 TB/s minnebåndbredde for TPU-en, mot 2,5 petaflops og 8 TB/s for Nvidia-brikken. Med en knapp margin til Nvidia på rå spesifikasjoner peker forskjellen på dekodehastighet altså mot ett sted: hvor mye av arbeidssettet som kan bo nær regnecoenhetene, og hvor mye plasseringen programvaren selv kan styre.

Qwen-resultatet og Cerebras-spørsmålet

På Alibabas Qwen 3.8 27B nådde fire TPU v7-brikker 1 515 tokens per sekund per bruker, mot 695 på fire GB200-er, ifølge Inferacts data. SemiAnalysis' diagram plasserte Cerebras på rundt 1 850 tokens per sekund per bruker på samme modell, noe som fikk analyseselskapet til å si at fire TPU-er hadde kommet «nær» en enkelt gigantisk Cerebras-wafer på interaktivitet.

Dette er historiens svakeste påstand. Cerebras-tallet i SemiAnalysis' diagram er merket som omtrentlig, uten vedlagt metodikk, og Cerebras har ikke svart. Å konkludere med at TPU-er «nærmer seg» Cerebras bygger altså på et anslag uten dokumentert oppsett, målt mot et selskaps egen benchmark. Det er en forskjell leseren bør ta med seg.

Hvor mye av ledelsen er spekulativ dekoding?

Hovedtallet på 709 tokens per sekund hviler på spekulativ dekoding med DSpark-metoden, ved en akseptlengde på seks – teknikken gjetter flere tokens per steg, og aksepterte gjetninger teller som flere genererte tokens. Ved en akseptlengde på tre var gapet mindre: 350 mot 229 tokens per sekund. Hvert dekodingsteg tok rundt 8,5 millisekunder. Uten spekulativ dekoding leverer kjernene ifølge de rapporterte tallene omtrent 1,4 til 2 ganger GB200s dekodegjennomstrømming ved batch-størrelser én til åtte.

Det betyr at det reelle, teknikkuavhengige forsprinnet er betydelig – men langt mer beskjedent enn 56 %. Titteltallet forutsetter både at spekulativ dekoding med høy akseptlengde fungerer godt på arbeidsmengden, og at motstanden ikke er optimalisert.

Og motstanden er ikke optimalisert. GB200-baselinen er vLLMs standardoppskrift på 16 GPU-er – ikke en spesialskrevet kjerne, og ikke et fullt NVL72-rack med Nvidias raskeste koblingstopologi. En rettferdig sammenligning ville stilt to parters beste programvare mot hverandre; her møter et skreddersydd megakerne en generisk kjørerekkefølge.

Hva resultatene faktisk måler

Resultatene gjelder lav batch og én enkelt bruker – altså interaktiv hastighet, som er der svartidene betyr mest for agenter og kodeverktøy. De sier ingenting om maksimal gjennomstrømming med mange samtidige brukere, som er den økonomisk viktigste metrikkken for de fleste inferenstjenester. Kjernenes fordel ved batch 1–8 er dokumentert i det rapporterte materialet; ved høye batch-størrelser foreligger ingen tilsvarende data.

Nøyaktighetsbevaring er også kun dokumentert av Inferacts egne tall: 0,944 på GPQA-Diamond og 0,972 på GSM8K. Ingen uavhengig kontroll av disse tallene foreligger i det tilgjengelige materialet.

Hvorfor det skjer nå

Inferacts utgivelse kommer samtidig med SemiAnalysis' bredere vurdering av at Googles «eksternalisering av programvare» rundt TPU-ene er «fullt på» – at Google aktivt arbeider for å gjøre brikkene brukbare utenfor egne datasentre. Analyseselskapet hadde tidligere funnet at Ironwood leverer opptil 50 % bedre ytelse per dollar enn Nvidias Blackwell Ultra, og TPU-adopsjonen har vokst blant laboratorier som leter etter alternativer til Nvidias brikker.

I den konteksten er de åpne megakjernene mer enn en benchmark: De viser at TPU-programvarestakken er moden nok til at tredjeparter kan skrive ytelseskritisk kode i Googles Pallas og slå referanseimplementasjoner på Nvidias side. For innkjøpere som veier TPU-er mot Nvidia-alternativer er slike tredjepartsbenchmarks nyttige – men nettopp derfor fortjener de grundig gransking.

Åpne spørsmål

Ingen av tallene i denne historien er uavhengig verifisert. Benchmarken er forfattet av leverandøren, som har en åpenbar interesse av resultatene og skrev både kjernene og sammenligningsmetodikken. Det foreligger ingen primærdokumentasjon – Inferacts utgivelse, SemiAnalysis' dashbord eller kildekodelageret – som er gjennomgått i dette grunnlaget; alle tall hviler på én sekundær artikkel som videreformidler selskapets egne resultater (OfficeChai).

De viktigste åpne spørsmålene: Hvordan utfører kjernene ved høye batch-størrelser og reell flerbrukertrafikk? Hva gir en tilsvarende optimalisert GB200-kjerne? Og holder Cerebras-sammenligningen ved nærmere undersøkelse? Inntil slike tester foreligger, er det tryggeste man kan si at Inferact har vist at TPU v7s arkitektur – med 64 MiB programstyrbart minne per TensorCore og et programmeringsspråk som utnytter det – kan vinne på enkeltbruker-dekoding under de rette forholdene. Resten er ennå ubesvart.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.