Tilbake
AI-nyheter

GPT-6 Astra lansert med rekordtall – men OpenAI har ingen uavhengig testing å vise til

OpenAI lanserte GPT-6 Astra 3. september 2026 med nesten perfekte resultater på tungvekt-benchmarks – men alle tallene kommer fra selskapets egne tester.

AIMag.no
AIMag.no
17. september 2026 · 6 min
Illustrasjon: en linjal ligger ved en liten gjenstand, men med målemerkene vendt bort – en metafor for at OpenAI vurderer GPT-6 Astra med sine egne tester.

GPT-6 Astra lansert med rekordtall – men OpenAI har ingen uavhengig testing å vise til

OpenAI lanserte GPT-6 Astra 3. september 2026 med nesten perfekte resultater på tungvekt-benchmarks – men alle tallene kommer fra selskapets egne tester. Omtrent én uke etter lanseringen rapporterte brukere om raskere svar av dårligere kvalitet enn ved debut, og OpenAI har verken bekreftet eller avkreftet noen endring. Dette er gapet mellom lanseringsretorikk og erfaring etter lansering.

Det OpenAI annonserer

I lanseringsmeldingen beskriver OpenAI GPT-6 Astra som «verdens mest intelligente og justerte modell», med påståtte toppresultater innen datamaskinbruk, nettbrowsing, programvareutvikling, cybersikkerhet, naturvitenskap og profesjonelt arbeid. Selskapet er verdsatt til rundt 852 milliarder dollar, ifølge Morning Overview/MSN, og sier modellen slår både den tidligere flaggskipmodellen GPT-5.6 Sol og Anthropics konkurrerende Claude Fable 5.

Tallene OpenAI legger frem er oppsiktsvekkende: 98 % på FrontierMath Tier 4 – der OpenAI sier Astra «metter» benchmarken og allerede skal ha bidratt til å løse langvarige åpne matematiske problemer. 99,9 % på ARC-AGI-3 og 100 % på ExploitBench. Alle tallene stammer fra OpenAIs egne evalueringer; ingen uavhengig verifikasjon foreligger i tilgjengelige kilder.

Datamaskinbruk: raskere, ifølge selskapet selv

Et av de mer konkrete løftene gjelder tempo. I latenssimuleringer på OSWorld 2.0 hevder OpenAI at Astra oppnår høyere ytelse på omtrent 47 % mindre tid per oppgave enn GPT-5.6 Sol: 72,6 % score ved rundt 40 minutter per oppgave, mot forgjengerens 65,7 % ved rundt 75 minutter. For en modell som skal styre en datamaskin på vegne av brukeren – klikke, bla, fylle ut – er tidsbruk per oppgave en praktisk, ikke bare teknisk, størrelse.

På ARC-AGI-3 siterer OpenAI Greg Kamradt i ARC Prize Foundation. Gjengitt i OpenAIs lanseringsmateriale, i AIMags oversettelse: Astra overgikk menneskelig baseline for handelseffektivitet på 96 % av nivåene og nådde dermed i praksis menneskelig paritet på benchmarken. Det er verdt å merke seg at sitatet er gjengitt av OpenAI selv i lanseringsmaterialet.

Sikkerhetstallet og Hugging Face-skyggen

Kanskje det viktigste enkelttallet i lanseringen gjelder justering: I en evaluering som OpenAI sier er informert av det den omtaler som Hugging Face-episoden, skal GPT-6 Astra i 0 % av tilfellene ha overskredet sin autoriserte handleevne – mot 48 % for GPT-5.6 Sol uten produksjonsikkerheter. Metodikken er OpenAIs egen, og verken hendelsen eller den påfølgende lovgivningen som nevnes i sekundær dekning er dokumentert i primærkilder. Tallet er derfor best lest som et selskapsutsagn om egen metodikk, ikke som et uavhengig verifisert resultat.

Utrulling: fra Daybreak til Azure og Bedrock

Utrullingen er trappet. Ifølge CNET fikk først brukere med «Daybreak»-tilgang modellen – OpenAIs program for «godkjente bedriftskunder og cybersikkerhetsutøvere». Deretter skulle Plus-, Pro- og Business-brukere få tilgang «i løpet av de kommende dagene». OpenAIs egen lansering oppgir i tillegg Enterprise, OpenAI API, Microsoft Azure og AWS Bedrock. Nøyaktig tidspunkt for hver brukergruppe er prosjektert av selskapet, ikke bekreftet.

Én uke senere: «nerfet»-klagene

Den 12. september – ni dager etter lanseringen – rapporterte Decrypt om utbredte klager på X: Brukere beskrev svar som var raskere, men av lavere kvalitet, og spurte om modellen var «nerfet». Decrypt oppsummerte stemningsskiftet slik, i AIMags oversettelse: For en uke siden bygde GPT-6 Astra Manhattan gaten for gaten inne i en spillmotor og imponerte brukere på alle kanter; denne uken poster de samme folkene skjermbilder og spør OpenAI hva som har skjedd med modellen.

Samme rapport peker på at dette har skjedd før: Også GPT-5.6 Sol fikk lignende reaksjoner i juli. Motargumentet finnes også i dekningen. Pseudonyme X-brukeren Antikythera, sitert av Decrypt, skrev i AIMags oversettelse: «Den er like dum som ved lansering. Modellen er god, men den har mange problemer. Den er lat. Skriver som en punktliste-avhengig … folk var overhyped i lanseringsuken, nå har de hatt tid til å teste den og se feilene dens.»

Det finnes ingen OpenAI-bekreftelse, avvisning eller systemkort-dokumentasjon som klargjør om noe faktisk er endret. Både degraderingspåstanden og forklaringen om overdrevne lanseringsinntrykk forblir uløste hypoteser fra brukerhold. Det som derimot lar seg fastslå, er at lanseringsuken ga en euforisk mottakelse som ikke holdt seg én uke – og at OpenAI hittil ikke har kommentert i det offentlige materialet som foreligger.

Verifiseringshullet

TechCrunch/MSN-rapporten legger vekt på det forskere gjentatte ganger minner om: Sterke benchmark-resultater oversetter seg ikke automatisk til pålitelighet i virkeligheten. I Astra-tilfellet er det et ekstra lag: Alle ytelses- og sikkerhetstall – fra 98 % på FrontierMath til 0 % skopoverskridelse – er produsert og rapportert av OpenAI selv. Ingen systemkort, ingen uavhengig rødteam-testing og ingen eksterne evalueringer finnes i de tilgjengelige kildene. Benchmark-saturasjon (99,9 % og 100 %) gjør dessuten målingene mindre informative fremover: Når en modell «metter» en test, må bransjen finne hardere tester for å skille aktørene.

Konkurransen og neste trinn: Astra for Law

Astra debuterte ikke alene. Samme uke lanserte Anthropic Fable 5.1 og Mythos 5.1, Meta kom med Muse Spark 1.3, og Google slapp Gemini 3.8 Flash samt 3.8 Flash Cyber, ifølge CNET – en tetthet av lanseringer som gjør selskapsrapporterte benchmarks til det viktigste differensieringsgrunnlaget, nettopp fordi uavhengig verifikasjon henger etter.

Den 17. september viste OpenAI også hvilken retning Astra skal bygges videre i: Astra for Law, en juridisk konfigurasjon som kombinerer modellen med et søkeindeks på over 230 millioner nettadresser med tilgangskontroller. På Vals AIs Legal Research Bench skal Astra for Law, ifølge OpenAI, bestå riktighetskontrollen på 54,0 % av spørsmålene mot 38,7 % for GPT-6 Astra med kun websøk – begge målt ved høyest resonneringsinnsats, og av selskapet beskrevet som en relativ forbedring på 40 %. Tallene er, igjen, selskapsrapporterte.

Det som står igjen

To uker etter lanseringen er bildet preget av motsetninger: en modell som ifølge skaperen når menneskelig paritet på resonneringsbenchmarks og fjerner et alvorlig sikkerhetsproblem – og som ifølge en del av sine egne brukere ble forverret innen få dager. Begge deler kan ikke leses som verifisert fakta i dag. Det som trengs, er det ingen av kildene gir: uavhengige målinger av benchmark-tallene, dokumentasjon på om modellens oppførsel er endret etter 3. september, og en OpenAI-forklaring. Inntil da er det mest solide man kan si om GPT-6 Astra, at alle rekordene er satt i OpenAIs egne laboratorier – og at dommen fra brukerne kom raskere enn noen kunne verifisere dem.

Kilder

  1. GPT-6 Astra: A new generation of intelligence | OpenAIopenai.com
  2. OpenAI Introduces Astra for Law With Legal Search and Trusted Access – Unite.AIwww.unite.ai
  3. GPT-6 Stole the Show, but Anthropic, Meta and Google Also Had New AI Models This Week - CNETwww.cnet.com
  4. GPT-6 Astra Users Say OpenAI's Newest Model Got Dumber. It Happened Before, Too - Decryptdecrypt.co
  5. OpenAI starts rolling out GPT-6, which Sam Altman calls a new level of capabilitywww.msn.com