Første uken med GPT-6-Astra: stort hopp innen 3D og spill – men ingen AGI, ifølge vurdererne
GPT-6, med kodenavnet Astra, har vært ute i vel en uke, og de to første uavhengige vurderingene er enige om hovedinntrykket: et betydelig kapabilitetshopp over forgjengeren, spesielt på 3D-arbeid, spill, computer use og koordinering av…

Første uken med GPT-6-Astra: stort hopp innen 3D og spill – men ingen AGI, ifølge vurdererne
GPT-6, med kodenavnet Astra, har vært ute i vel en uke, og de to første uavhengige vurderingene er enige om hovedinntrykket: et betydelig kapabilitetshopp over forgjengeren, spesielt på 3D-arbeid, spill, computer use og koordinering av underagenter — men ingen av evaluatorene vil kalle modellen AGI. Samtidig rapporterer OpenAI egne benchmark-tall som er uavhengig uverifisert, og spenningen mellom det modellen faktisk leverer og «AGI-æra»-retorikken fra OpenAI og Nvidia er kanskje den mest avslørende delen av lanseringen.
En uke med to uavhengige vurderinger
Zvi Mowshowitz publiserte sin vurdering 12. september 2026, og PCMag fulgte opp med en praktisk test av skribent Ruben Circelli 14. september. Begge konkluderer med at GPT-6-Astra er en klar fremgang, men begge avviser AGI-rammen som selskapene selv legger opp til. Det er sjelden at to uavhengige vurderinger i lanseringsuken lander så nøyaktig på samme hovedkonklusjon, både på styrkene og på forbeholdene.
Mowshowitz beskriver Astra som «den beste modellen for det man bredt ville kalle ambisiøse prosjekter», og antyder at den har den høyeste rå intelligensfaktoren av noen modeller. Han skriver at «hoppet fra Sol til Astra er større enn hoppet fra Fable 5 til Fable 5.1». Navnesammenhengen mellom «Sol» og GPT-5.6 er for øvrig en slutning basert på konteksten i teksten — ingen av kildene bekrefter den eksplisitt. Han fremhever at modellen er formidabel på alt som skjer i 3D eller involverer spill, og at den også utmerker seg på computer use og koordinering av subagenter — altså når én modell styrer flere underprosesser eller agent-instanser mot et felles mål.
På vanlig koding er bildet mer nyansert. Området får ifølge Mowshowitz mindre fokus i denne generasjonen, og Astra «er ikke noe kvantesprang der, men er selvsagt veldig god og gjør fremgang over Sol». Han bemerker også at Anthropic Fable 5.1 fortsatt kan være å foretrekke for enkelte bruksområder, som gjensidig dialog frem og tilbake. Astras styrker ligger altså ikke først og fremst der forgjergernes styrker lå, men i nye kategorier av arbeid.
Circelli bekrefter det praktiske bildet fra kodesiden: GPT-6 fullfører oppgaver raskere, og fanget i testingen feil som GPT-5.6 overså. Men han dokumenterte også det motsatte — modellen introduserte en spillødeleggende feil som tok timer å isolere, og den krever fortsatt oppfølging underveis. Tross all ros konkluderer han at GPT-6 på ingen måte er en slags superintelligent AI som skal innlede et tusenårig maskinvelde. En praktisk begrensning: Circelli brukte opp ukens bruksgrense på én time. Detaljene rundt grensen kan ikke fullt ut verifiseres, ettersom PCMags tekst er avkuttet midt i avsnittet, men prisen og bruksbegrensningene fremstår som en reell begrensning for profesjonell bruk — PCMag beskriver modellen som betydelig dyrere enn forgjengeren.
Tallene — og hvem som står bak dem
Det mest iøynefallende tallet i lanseringen er OpenAIs oppgitte ARC-AGI-3-resultat: 99,9 prosent for GPT-6, mot 7,8 prosent for GPT-5.6 og 30,2 prosent for Anthropic Opus 5. Disse tallene kommer fra OpenAI selv, videreformidlet gjennom PCMag, og er ikke uavhengig verifisert. Hoppet er så stort at det i seg selv burde utløse forsiktighet: Et sprang fra 7,8 til 99,9 prosent på én benchmark er uvanlig, og PCMag bemerker selv skepsis til hvordan benchmark-resultater forholder seg til den virkelige verden — en skepsis Circellis egen testing delvis bekrefter. Modellen fanget noen feil, men introduserte også en alvorlig en.
Det samme gjelder påstanden, tilskrevet OpenAIs engineering lead via PCMag, om at GPT-6 på sitt laveste intelligensnivå overgår GPT-5.6 på sitt høyeste. Det er et selskapsutsagn, ikke et verifisert funn, og bør leses som slik. Ingen av de tilgjengelige kildene inneholder primærdokumentasjon fra OpenAI — hverken system card, model card eller pressemelding — så alle kapabilitets- og benchmark-påstander spores tilbake til selskapets egne utsagn videreformidlet av sekundære kilder. Det betyr ikke at tallene nødvendigvis er gale, men at de inntil videre er markedsføring, ikke dokumentasjon.
AGI-debatten, på alvor denne gangen
Hvor kapabiliteten er dokumentert, er AGI-rammen omstridt. Nvidia-sjef Jensen Huang og OpenAIs president Greg Brockman har ifølge PCMag begge karakterisert lanseringen som inngangen til «AGI-æraen». PCMag-kritikeren er uforsonlig: «å kalle det AGI er ren markedsføringsspin». Mowshowitz legger seg midt imellom på en interessant måte: «Dette er første gang en debatt om hvorvidt en modell 'var AGI' føltes ikke-tåpelig. Jeg mener ikke det er AGI, og jeg vil advare mot faren ved å bruke den etiketten for tidlig, men jeg ville ikke ledd av deg for å være uenig.»
Det er en meningsfull forskjell fra tidligere lanseringer: selv de som avviser etiketten, finner at den ikke lenger kan avfeies umiddelbart. Samtidig står det uavklart nøyaktig hva Huang og Brockman sa — PCMag gjengir uttalelsene sekundært, og originalformuleringene er ikke tilgjengelige i kildene. Både Huang og Brockman har en kommersiell interesse i en så omfattende karakterisering, noe som styrker grunnen til å behandle påstandene med avstand.
Hva som fortsatt er uavklart
Den kanskje mest spennende detaljen er OpenAIs egen signalisering om mer kapasitet. roon hos OpenAI skrev 3. september 2026 at «jeg har ikke kommet i nærheten av å oppdage grensene for hva Astra kan gjøre». Ifølge Mowshowitz' gjengivelse signaliserer roon også en intern modell som kan ha overgått Astra allerede — men dette hviler utelukkende på sosiale innlegg sitert i Mowshowitz-teksten, og kan ikke verifiseres videre her.
Det etterlater noen åpne spørsmål: Ingen av ARC-AGI-3-tallene er bekreftet uavhengig, og gapet mellom 99,9 prosent på benchmark og en spillødeleggende feil i praksis fortjener en forklaring. Det finnes ingen primærdokumentasjon fra OpenAI om modellen ennå, og detaljene rundt ukens bruksgrense forblir uklare inntil PCMags fullstendige tekst foreligger. Og hvis roons antydede etterfølger eksisterer, kan Astras fortrinn bli kortvarige — med mindre gapet mellom benchmark og virkelighet viser seg å være det egentlige problemet.
Kilder: Zvi Mowshowitz, «GPT-6-Astra Can Do Ambitious Things» og PCMag, «I Blew Through My Weekly GPT-6 Limit in an Hour, and It's Still Not AGI».
Kilder
- GPT-6-Astra Can Do Ambitious Things - by Zvi Mowshowitz — thezvi.substack.com
- I Blew Through My Weekly GPT-6 Limit in an Hour, and It's Still Not AGI | PCMag — www.pcmag.com