Grok 4.7: 3,74 dollar per målt oppgave, målt av Artificial Analysis
SpaceXAI lanserte frontier-modellen Grok 4.7 21. september 2026 med uendret enhetspris – $2 per million input-tokens og $6 per million output-tokens – men uavhengige målinger fra Artificial Analysis viser at modellen bruker omtrent det…

Grok 4.7: 3,74 dollar per målt oppgave, målt av Artificial Analysis
SpaceXAI lanserte frontier-modellen Grok 4.7 21. september 2026 med uendret enhetspris – $2 per million input-tokens og $6 per million output-tokens – men uavhengige målinger fra Artificial Analysis viser at modellen bruker omtrent det dobbelte antall tokens per oppgave sammenlignet med forgjengeren. Om den lave tokenprisen faktisk gir billigere fullførte oppgaver, er fortsatt et åpent spørsmål.
Hva som ble lansert
SpaceXAI kunngjorde Grok 4.7 mandag 21. september 2026. Modell-ID er grok-4.7, kontekstvinduet er på 500 000 tokens, og API-prisen er $2 input / $6 output per million tokens for prompter under 200 000 tokens, ifølge KintoNavi som gjengir selskapets kunngjøring ([2f46d37c]). Selskapet beskriver selv modellen som sin mest kapable til nå for koding og kunnskapsarbeid (Seeking Alpha, [e782cbc8]).
Modellen ble tilgjengelig samme dag i Cursor, Grok Build og via API, i tillegg til OpenRouter, Vercel og Cloudflare. GitHub Copilot startet en fasert utrulling 21. september for abonnementene Pro, Pro+, Max, Business og Enterprise, med tilgang fra modellvelgeren i VS Code, Visual Studio, Copilot CLI, skyagenter, Copilot-appen, JetBrains, Xcode og Eclipse (わど, [06c0e89f]).
Lanseringen kom omtrent 40 dager etter Grok 4.6 (Morimoto, [a593694c]) – et svært kort intervall for en ny frontier-modell.
Selskapets egne tall
Ifølge SpaceXAI egen benchmarktabell er den største fremgangen på Terminal-Bench 4.0, som steg fra 20,3 % for Grok 4.6 til 38,0 % for Grok 4.7 – en oppgang på 17,7 prosentpoeng (KintoNavi, [2f46d37c]). I selskapets egen tabell leder Grok 4.7 EEBench og Harvey Legal Agent Benchmark.
Men selv i selskapets egne tall leder konkurrentene flere benchmarks: Fable 5.1 slår Grok 4.7 på CursorBench 4.0 (51,8 %) og Terminal-Bench 4.0 (57,9 %), GPT-5.6 Sol leder DeepSWE v1.1 med 72,7 %, og Fable 5.1 leder HealthBench Professional med 62,1 % (KintoNavi, [2f46d37c]).
De uavhengige målingene
Det uavhengige testlaboratoriet Artificial Analysis tegner et mer nyansert bilde. På deres Intelligence Index oppnår Grok 4.7 med høyeste resonneringsnivå xHigh 46 poeng – bare to flere enn Grok 4.6. Det plasserer SpaceXAI blant de fire ledende KI-labene, men modellen ligger fortsatt bak toppmodellene Claude Fable 5.1 og GPT-6 Astra (heise, [4ebc229b]). Artificial Analysis rapporterer samtidig at modellen når nær toppnivå på deltestene AA Briefcase og GDPval-AA ([4ebc229b]).
Det mest iøynefallende tallet gjelder tokenforbruk: Ved xHigh bruker Grok 4.7 i snitt rundt 81 000 output-tokens per oppgave på Intelligence Index. Til sammenligning bruker Grok 4.6 xHigh rundt 38 000 tokens, og GPT-6 Astra Max omtrent 27 000. Det gir en kostnad per oppgave på omtrent $3,74 (heise, [4ebc229b]).
Dette er det som gjør lanseringen interessant utover de vanlige benchmarktabellene: Enhetsprisen er uendret, men tokenforbruket per oppgave er omtrent doblet. Ifølge Morimotos analyse gjenstår det å se om den lave enhetsprisen faktisk gir lavere kostnad for fullførte oppgaver ([a593694c]).
Et uforklart avvik i tallene
Det finnes også en direkte konflikt mellom selskapets og de uavhengige tallene. SpaceXAI oppgir 38,0 % på Terminal-Bench 4.0, mens heise/Artificial Analysis måler 33 % – opp fra 18 % for forgjengeren. Også DeepSWE-tallene avviker (71,0 % oppgitt mot 73 % målt). Avviket skyldes trolig ulike innstillinger for resonneringsinnsats eller ulike testoppsett, men dette kan ikke bekreftes ut fra tilgjengelige kilder, og avviket forblir uforklart her.
Sikkerhetstallene er rene selskapspåstander
SpaceXAI hevder at Grok 4.7 er den modellen selskapet har testet med sterkest nektelses- og jailbreak-motstand, bygget på et helt nytt sikkerhetslag. I kunngjøringen oppgis 62,4 % på LatchBio sitt biosikkerhets-benchmark og at bare 3,3 % av risikable dual-use-prompter slipper gjennom på HackerBench v0.3, samtidig som nektelsesraten for legitimt sikkerhetsarbeid skal være lav. Selskapet tilbyr også invitasjonsbasert red-teaming for utvalgte cybersikkerhetspartnere (iClarified, [b5f11e1f]).
Disse tallene er utelukkende selskapets egne påstander og er ikke uavhengig verifisert.
Kuriositeter og forbehold
Noen detaljer er verdt å merke seg – og å ta med forbehold:
- Grok 4.7 Fast kjører samme modell på raskere infrastruktur til dobbel pris for normal kontekst (lang kontekst i Cursor prises separat). Fast-varianten er ikke tilgjengelig via det offentlige xAI-API-et, kun i Cursor og Grok Build (わど, [06c0e89f]).
- Ifølge heise brukte SpaceXAI anonymiserte workflow-data fra Cursor for å styrke kode- og agentferdighetene, og Cursor skal ha tilhørt SpaceX siden august ([4ebc229b]). Forholdet mellom SpaceXAI, xAI, SpaceX og Cursor-eierskapet er hevdet av sekundærkilder og ikke bekreftet av primærdokumentasjon.
- Kildesituasjonen bør nevnes: Ingen av kildene i denne saken er SpaceXAI sin egen kunngjøring – alle tall spores til sekundær rapportering som siterer selskapet, og flere av kildene er maskinoversatte innlegg. Detaljene om generell chat-tilgang (grok.com, mobilapper, X) er også svakt kildemessig dekket.
Hva du bør måle selv
Det praktiske poenget for de som vurderer å bytte modell, er at kostnad per fullført oppgave – ikke pris per token – er det relevante kjøpskriteriet. De uavhengige målingene antyder at Grok 4.7 løser oppgaver med langt mer resonneringstekst, men fordelaktige egenskaper som lavere feilrate eller færre gjentakelsesrunder kan fortsatt gjøre modellen billig i praksis. Det vet ingen ennå.
Før en eventuell migrering er det fornuftig å måle egne arbeidsflyter: gjennomsnittlig tokenforbruk per faktisk oppgavetype, suksessrate ved første forsøk, latens ved relevante resonneringsnivåer, og sammenligning mot både Grok 4.6 og konkurrentene. Særlig de som kjører store mengder agentiske kodeoppgaver via API, vil merke tokenforbruket direkte på regningen – uansett hva enhetsprisen er.
Kilder
- SpaceXAI Launches Grok 4.7 for Coding and Knowledge Work - iClarified — www.iclarified.com
- Grok 4.7 Arrives | 'Long-Duration Tasks' and Grok Bot: What to Look for Beyond the 500k Token Limit|わど|AI界隈のマスコット — note.com
- Grok 4.7 Released! When to Use It? A Quick Guide to Its Features and Key Points|Yasuhito Morimoto — note.com
- SpaceXAI's new Grok 4.7 improves on coding, maintains cheaper token rates than peers | Seeking Alpha — seekingalpha.com
- SpaceXAI Releases Grok 4.7: Input Price Remains at $2, Terminal-Bench Increases from 20.3% to 38.0%|KintoNavi|kintone+生成AI — note.com
- Grok 4.7: Günstige API trifft auf hohen Tokenverbrauch | heise online — www.heise.de