Persistent kjerner: Programvare kan gi GPUer nesten Cerebras-fart
OpenAIs Ultrafast-modus skal ha flyttet seg fra Cerebras sitt wafer-scale-silisium tilbake til NVIDIA-GPUer – og det reiser et teknisk spørsmål som handler mindre om rå maskinkraft enn om hvor mye data som må flyttes for hvert generert token. Her er mekanismen bak lav forsinkelse, og hvorfor programvare kan ta igjen det andre trenger egen maskinvare for.
Nyhetshendelsen: Ultrafast bytter maskinvare
I august 2026 kunngjorde OpenAI Ultrafast-modus for GPT-5.6 Sol – ifølge en artikkel på den japanske plattformen note.com, som er den eneste kilden bak denne saken. OpenAI beskrev selv modusen som «Powered by Cerebras», skriver forfatteren, som legger til at dette irriterte NVIDIA-aksjonærer. Farten var opptil 750 tokener per sekund i utdata, opptil 14 ganger raskere enn standardversjonen.
Nå skal bildet tilsynelatende være annerledes: Halvlederanalysefirmaet SemiAnalysis skal ha påpekt at GPT-6.1 Sol Ultrafast «kjører på NVIDIA-GPUer ved lave batch-størrelser, ikke Cerebras». Dette er en konkurranseutsatt påstand fra et analysefirma, rapportert gjennom samme sekundærkilde, og den er ikke uavhengig verifisert. Men hvis den holder, peker den på et konkret teknisk spørsmål: Hvordan kan vanlige GPUer i det hele tatt komme i nærheten av wafer-scale-maskinvare når det gjelder forsinkelse per token?
Svaret, slik SemiAnalysis angivelig tegner det, ligger i to deler: en forklaring på hvorfor GPUer underpresterer ved batch-størrelse 1, og en verifisering av programvare som fjerner mye av den overheaden.
Hvorfor hver token er en tur til minnet
En autoregressiv språkmodell genererer én tekstbrikke – ett token – om gangen, og hvert token avhenger av alle de foregående. Som note.com-artikkelen forklarer det (oversatt fra engelsk): «Hver gang det neste ordet genereres, må det aksessere en stor mengde data som modellvekter og KV-cache, utføre beregninger, og deretter skape det neste ordet.»
Poenget er at selve regnearbeidet per token er relativt lite. De store modellvektene må imidlertid leses fra minnet for hvert enkelt token, i tillegg til KV-cachen – mellomlageret av tidligere token-representasjoner. Når en GPU genererer tusenvis av token i parallell (høy batch-størrelse), kan den samme vektflyttingen gjenbrukes til mange beregninger, og GPUens enorme regnekraft utnyttes fullt ut. Men ved batch-størrelse 1 – én bruker som venter på ett svar – er det minneflyttingen som setter farten, ikke regnekraften. Dekodingen er da «minnebåndbreddesbundet»: Hastigheten begrenses av hvor mange terabyte data som kan hentes per sekund, ikke av hvor mange billioner operasjoner brikken kan utføre.
Det er derfor diskusjonen om rask AI-inferens i bunn og grunn er en diskusjon om minnebåndbredde.
GPUens svakhet ved batch-størrelse 1
Hvis minnebåndbredde er flaskehalsen, burde moderne GPUer i prinsippet klare seg godt. NVIDIAs Blackwell Ultra-generasjon (B300/GB300) leverer ifølge tall gjengitt i kilden rundt 8 TB/s HBM3E-båndbredde per GPU. Hele et GB300 NVL72-rack når opptil 576 TB/s HBM-båndbredde fordelt på 72 GPUer, og NVLink-forbindelsen når 130 TB/s per rack.
Problemet er ifølge SemiAnalysis, slik det gjengis i artikkelen, at GPUene aldri får utnyttet denne båndbredden i ultralav-forsinkelses-scenarier. «Mens GPUer er ekstremt sterke ved høy gjennomstrømning, kan de ikke fullt ut utnytte sin iboende minnebåndbredde i ultra-lav forsinkelse-inferens som batch-størrelse 1», analyserer SemiAnalysis ifølge artikkelen. Årsakene listes opp som små ventetider knyttet til fire ting:
- Oppstart av GPU-kjerner (kernel launches): hver liten operasjon i nettverket må startes individuelt.
- Avslutninger av de samme kjernene.
- Synkronisering mellom operasjoner.
- Skriving av mellomdata tilbake til HBM – GPUens eksterne høyhastighetsminne – mellom hver operasjon.
I normal GPU-inferens kjøres en serie små prosesser sekvensielt, som tusenvis av GPU-kjerner. Hver oppstart, hver avslutning og hver runde med mellomlagring koster mikroskopiske ventetider. Ved høy batch-størrelse er disse kostnadene amortisert over enorme mengder arbeid. Ved batch-størrelse 1 utgjør de en vesentlig andel av tiden mellom hvert token – og GPUen sitter i praksis og venter i stedet for å lese vekter.
Maskinvarealternativet: Cerebras og wafer-scale
Cerebras tok en annen vei. Selskapets WSE-3 bruker ifølge firmaets spesifikasjoner, gjengitt i note.com-artikkelen, nesten en hel silisiumplate som én massiv prosessor, med omtrent 44 GB SRAM plassert direkte ved regnekjernene. Den på-brikke minnebåndbredden er offisielt oppgitt til rundt 21 PB/s.
Sammenligningen er slående: 21 PB/s på brikken mot omtrent 8 TB/s HBM per B300-GPU – en faktor på over tusen. Poenget er ikke bare rå båndbredde, men arkitekturen. Fordi modellens vekter kan holdes i SRAM ved siden av regnekjernene, unngår Cerebras mye av den permanente flyttingen av data frem og tilbake mellom prosessor og eksternt minne som GPU-arkitekturen krever per token. Wafer-scale-utformingen bygger altså flaskehalsen ut av systemet.
Det er mot dette bildet at OpenAIs angivelige «Powered by Cerebras»-merkelapp og 750 tokener per sekund ble lest som en direkte utnyttelse av arkitekturfortrinnet ved lav batch-størrelse.
Programvaresvaret: TileRT og persistente kjerner
Men arkitekturfortrinnet er ikke hele historien. I august 2026 verifiserte SemiAnalysis ifølge note.com-artikkelen inferensprogramvare for lav forsinkelse kalt «TileRT» på en NVIDIA B200. Designet er enkelt å beskrive: I stedet for å starte tusenvis av sekvensielle GPU-kjerner, holder TileRT hele modellens dekodingsprosess boende på GPUen som én massiv «persistent kjerne».
Mekanisk betyr det at koden som kjører dekodingen starter én gang og blir værende på brikken gjennom hele genereringen. De mellomliggende trinnene som normalt ville kreve hver sin kjerneoppstart, hver sin avslutning, hver synkronisering og hver skriving av mellomdata til HBM, skjer i stedet inne i den samme, vedvarende prosessen. Hele listen av overheadkostnader som SemiAnalysis identifiserer ved batch-størrelse 1, adresseres altså av programvare – uten at maskinvaren endres.
Dette er kjernen i argumentet, slik kilden fremstiller det: Hastighetshullet mellom GPUer og wafer-scale-maskinvare ved lav batch-størrelse er delvis et programvareproblem, ikke bare et maskinvareproblem. GPUen trenger ikke 21 PB/s for å komme i nærheten av Cerebras-klasse-atferd; den må bare slutte å kaste bort tiden sin på egen administrasjon mellom operasjonene.
Hva vi ikke vet – og hva som er analyse
Det er verdt å være ærlig om evidensgrunnlaget. Alle påstandene i denne saken – OpenAI-kunngjøringen, SemiAnalysis-analysen, TileRT-verifiseringen og påstanden om at GPT-6.1 Sol Ultrafast kjører på NVIDIA – stammer fra én enkelt japansk note.com-artikkel. Verken SemiAnalysis' rapport, OpenAIs uttalelser eller TileRT-dokumentasjon foreligger i primærform her, og ingen av hendelsene i 2026 er uavhengig bekreftet.
For leservennlighetens skyld: Det som i denne artikkelen er merket som SemiAnalysis' analyse, OpenAIs påstander eller firma-spesifikasjoner, er gjengitt slik sekundærkilden rapporterer dem. De forklarende avsnittene om minnebåndbreddesbundet dekoding, amortisering av overhead ved høy batch-størrelse og betydningen av SRAM-arkitekturen er AIMags eget forsøk på å gjøre kildens – og SemiAnalysis' angivelige – resonnement forståelig; de bygger på den samme enkeltkilden og er ikke uavhengig etterprøvd. Konklusjonen i slutten av artikkelen er redaksjonell analyse av det kilden rapporterer, ikke dokumenterte fakta om NVIDIAs produktsatsing.
En merknad om kildens omfang: Det tilgjengelige materialet dekker persistente kjerner, lav batch-størrelse og minnebåndbredde. Kildens videre analyse av hvilke tokenhastigheter NVIDIA faktisk oppnår med slike teknikker er avbrutt i kildeteksten og kan ikke gjengis her.
Det gjenstår også åpne tekniske spørsmål: hvor stor andel av GPU-overheaden persistente kjerner faktisk fjerner i praksis, hvilke avveier TileRT gjør i form av fleksibilitet (en fast, helhetlig kjerne er mindre fleksibel enn en kjerne-sekvens som kan endres), og hvordan denne programvaretilnærmingen skalerer til større modeller og batch-størrelser over 1 – der GPUene ifølge SemiAnalysis allerede er «ekstremt sterke».
Det store bildet er likevel klart nok til å forstå debatten, slik kilden tegner den: Farten på raske AI-svar avgjøres i liten grad av hvor mange beregninger en brikke kan gjøre, og i stor grad av hvor raskt data kan hentes – og av hvor mye tid programvaren klarer å spare mellom hentingene. Cerebras løste det i silisium. Ifølge den rapporteringen denne saken hviler på, er NVIDIA i ferd med å svare i programvare.

