Tilbake
AI-nyheter

Grok 4.5 tapte fire av fem evaler. xAI kalte den sin sterkeste noensinne.

xAIs egen lanseringsside viser at Fable slår Grok 4.5 på fire av fem programvareevaler — 70 mot 53 på DeepSWE 1.1. Likevel ble modellen lansert som xAIs sterkeste noensinne, og markedet straffet det ikke. En analyse av hva «trent sammen med Cursor» faktisk kjøper.

AIMag.no
AIMag.no
31. august 2026 · 5 min
Papirutklippet søylediagram med tre søyler; den korteste, røde søylen har en snor som løfter den opp og ut av bildet, mens den svarte vinner-søylen ligger urørt.

På xAIs egen lanseringsside står to ting side om side. Den ene er overskriften: Grok 4.5 er «vår sterkeste modell noensinne». Den andre er benchmark-diagrammene, der Fable slår Grok 4.5 på fire av de fem oppførte programvareevalene — inkludert DeepSWE 1.1, der Fable scorer 70 prosent mot Grok 4.5s 53 (xAI, primærkilde).

Dette er trolig den første frontier-lanseringen som ikke later som den leder tabellen. Og markedet er nøye: J.P. Morgan har ifølge Seeking Alpha blitt «increasingly positive» på SpaceXs Grok-satsing, og MSN rapporterer at SpaceX-aksjen får en «Grok-fuelt løft» med henvisning til selskapets store inntektsmål for AI-virksomheten.

Tallene xAI selv publiserte

Modellen ble lansert per xAIs egen nyhetsside datert 16. juli 2026 (primærkilde), som flaggmodell for koding, agentiske oppgaver og kunnskapsarbeid. Tallene på samme side forteller et splittet bilde. På DeepSWE 1.0 scorer Grok 4.5 62,0 prosent, mot Fable (max) 66,1 og GPT 5.5 (xhigh) 64,31. På DeepSWE 1.1 er det 53 mot Fables 70 og GPT 5.5s 67. På SWE Bench Pro løser Grok 4.5 64,7 prosent, mot Fables 80,4. På Terminal Bench 2.1 ligger Grok 4.5 på 83,3 — ett tidels prosentpoeng bak GPT 5.5 og ett bak Fable.

Så én eval der Grok 4.5 vinner: SWE Marathon, med 29,0 prosent oppdagelsesrate (pass@1) mot Opus 4.8s 26,0 og Fables 24,0.

Verdt å merke seg: konkurrenttallene er ikke xAIs egne målinger. De er trukket fra respektive utvikleres publiserte systemkort og ledertavler, skriver xAI, og evalene er delvis laget og kjørt av Datacurve med hver modellleverandørs egne harnesser. Med andre ord: leverandørvalgte rammeverk, ikke nøytrale mål. Men de er xAIs egne valg å publisere — og selskapet valgte å publisere dem.

Hvorfor tallene ser slik ut

xAIs beskrivelse av treningen (primærkilde) forklarer mye av profilen. Grok 4.5 er trent på titusener av NVIDIA GB300-GPU-er, med forsterkningslæring over hundretusener av oppgaver sentrert på flertrinns programvarearbeid. Stacken er bygget for svært asynkron trening: agentiske utrullinger kan kjøre i mange timer mens læringen fortsetter på tvers av titusener av GPU-er. Målet, ifølge xAI, er «per-token intelligence» — mer intelligent og effektivt resonnement på ekte ingeniøroppgaver.

Det er logikk her: en modell optimalisert for lange, flertrinns agentløp kan tape på korte, vurderte evaler og likevel gjøre jobben bedre når oppgavene varer i timevis. SWE Marathon-resultatet, der Grok 4.5 leder, peker i samme retning.

Men den mest konkrete strategiske detaljen er en annen: Grok 4.5 ble «trent sammen med Cursor», ifølge xAI, som lenker til Cursorens egen blogg om samarbeidet. Det betyr i praksis at modellen er kalibrert mot arbeidsflyten der utviklere allerede sitter — og at distribusjonskanalen følger med modellen. Dette er en produktstrategi, ikke en benchmark-strategi. Modellens konkurrerende posisjon er «god nok og til stede der arbeidet skjer», ikke «nummer én på tavlen».

Markedet pris en plattform, ikke en tabellplassering

Konsekvensen er godt dokumentert i finansdekningen. J.P. Morgan sier det har blitt «increasingly positive» på SpaceXs Grok-satsing (Seeking Alpha). MSN beskriver aksjen som «Grok-fueled» og peker på selskapets inntektsambisjoner for AI. Memeburn rammer inn det samme mønsteret fra produktsiden: Grok Voice 2.0, Grok 4.5 og Talekontroller i Tesla samtidig gjør Grok fra chatbot til en bredere AI-plattform.

Med andre ord: investeringsfortellingen handler ikke om om Grok 4.5 slår Fable, men om Grok som inntektsplattform med flere distribusjonsflater. Dagen etter lanseringen av 4.5 fulgte xAI opp med Grok 4.6, ifølge Yourstory og Freepress Journal med fokus på agentiske oppgaver og koding — et tempo som bekrefter at strategien er kadense, ikke krone. En nyanse: flere kilder bruker navnet «SpaceXAI» om selskapet, en sammensmeltning av SpaceX og xAI som reflekterer hvordan de to er vevd sammen i markedsfortellingen; kildene er selv inkonsekvente om selskapsnavnet og aksjeticker.

Motargumentet: distribusjon slår benchmarks — foreløpig

Det finnes en reell risiko i å lese dette som seier. Hvis benchmark-lederskap faktisk forutsier utviklernes valg av standardmodell, holder ikke «godt nok pluss distribusjon» mot Fable og GPT 5.5. Ett sifret prosentpoengs gap kan være støy i leverandørvalgte harnesser; et 17-poengs gap som på DeepSWE 1.1 (53 mot 70) er ikke støy, og Memeburns Grok 4.6-tittel stiller spørsmålet på åpen dør: «But Is It Really Number One?». Selskapets egne tall alene gir ikke grunnlag for å hevde at Grok leder på noe annet enn én av fem evaler.

Men audit-siden av saken fortjener likevekt: xAI publiserte tallene som viser at modellen taper. Det er et sjeldent grep i en bransje der benchmarkdiagrammer ellers kurateres for å vinne. Og markedet belønnet åpenheten med oppmerksomhet, ikke straff — om enn at ingen av de tilgjengelige kildene dokumenterer en konkret kursbevegelse knyttet til lanseringsdagen; det vi vet er at J.P. Morgan ble mer positive og at MSN rapporterer om et «Grok-fuelt løft».

Det etterlater bransjen med et ubesvart spørsmål: Hva betyr «beste modell» når en modell på tredjeplass kan være en vinnerlansering — og hva skjer med benchmark-ledertavlenes verdi når selskaper slutter å trenge å ligge øverst på dem?


Visuell retning: Et trykt ledertavle-diagram skrevet ut på aksjekurspapirstrimmel (ticker tape), der Grok 4.5-raden ligger under Fable, fotografering i redaksjonell stillife-stil.

Hero-bildeprompt: Editorial still life photograph: a long printed benchmark bar chart on matte uncoated paper, showing a third-ranked bar clearly below a leading bar, printed on continuous tractor-feed stock ticker paper curling off the edge of a dark steel desk, single hard directional daylight from the left, generous negative space upper right, restrained palette of warm paper, black ink and one signal-red accent bar, subtle film grain, physically plausible shadows, no screens, no robots, no neon, no visible readable text beyond abstract bars.

Bildetekst: xAI publiserte selv benchmark-diagrammer der Grok 4.5 ligger under Fable på fire av fem evaler — og kalte likevel modellen sin sterkeste noensinne.

Alt-tekst: Trykt benchmarkdiagram på aksjepapirstrimmel der en tredjeplassert søyle ligger tydelig under en ledende rød søyle, fotografert i hardt dagslys mot mørkt stålbord.