Delvis Lean-verifisert, ufullstendig åpent: Hva OpenAIs matematikk-repo faktisk inneholder

Utgivelsen 6. oktober er ny i sitt slag: offentlig GitHub-repo, delvis Lean-verifiserte bevis, rundt 4 000 forsøkte problemer. Men OpenAI har valgt å offentliggjøre bare gjennomsnittlig regnekraft og ingen prompt, til tross for at…

Illustrasjon: en rekke metallblokker på et bord, hvor de fleste er polerte og klemt fast av en stålklemme i signalgult, mens uferdige blokker forsvinner ut av bildet — et bilde på delvis verifiserte matematiske bevis gjort delvis offentlig.
Illustrasjon
Gi artikkelen

Delvis Lean-verifisert, ufullstendig åpent: Hva OpenAIs matematikk-repo faktisk inneholder

Utgivelsen 6. oktober er ny i sitt slag: offentlig GitHub-repo, delvis Lean-verifiserte bevis, rundt 4 000 forsøkte problemer. Men OpenAI har valgt å offentliggjøre bare gjennomsnittlig regnekraft og ingen prompt, til tross for at rådgivningsgruppen ved Institute for Advanced Study ba om full per-resultat-åpenhet.

Hva som faktisk skjedde

Den 6. oktober 2026 publiserte OpenAI et offentlig GitHub-repositorium med 722 maskingenererte matematiske manuskripter, organisert i 372 forskningsfamilier. Arbeidet spenner over ren matematikk, teoretisk informatikk og matematisk fysikk (MSN). Sam Altman har rammet inn utgivelsen som begynnelsen på en «ny oppdagelsesæra» (The News).

Tallene kommer fra OpenAI selv: Modellen skal ha forsøkt seg på omtrent 4 000 problemer, og hvert akseptert resultat skal i gjennomsnitt ha kostet rundt tre timer med tilsvarende «ChatGPT Pro thinking»-regnekraft (MSN). Dekningen bruker ulike tellingar – 722 manuskripter, 372 familier, og i enkelte medier «377 resultater» – og sammenhengen mellom disse tallene er ikke forklart i den tilgjengelige dekningen.

Åpningen kommer få dager etter en dramatisk forhistorie: En september-utgivelse der OpenAI hevdet fremgang på Navier–Stokes-problemet skapte allerede betenkeligheter, og gruppen bak utgivelsen er ifølge Gizmodo den samme umerkelige interne modellen.

Hva Lean-verifisering faktisk garanterer

En del av bevisene er formalisert i Lean, et bevissystem der en datamaskin sjekker argumentet steg for steg. Der et bevis er fullstendig formalisert og Lean godtar det, er det i praksis sjekket – Scientific American karakteriserer slike resultater som nær sikre. Men mange av manuskriptene mangler fortsatt formale Lean-versjoner, og OpenAI sier at flere formaliseringer vil legges til etter hvert som verifikasjonsarbeidet fullføres (MSN). Selskapet erkjenner selv at ikke alle resultater er fullstendig verifisert, og at noen fortsatt kan inneholde feil (Times Now/MSN).

Poenget er altså todelt: Utgivelsen er delvis maskinsjekkbar, noe som er langt mer enn de fleste AI-utgivelser av denne typen kan vise til – men nøyaktig hvilke av de 722 manuskriptene som er Lean-verifisert, er ikke oppgitt presist i dekningen.

Hovedresultatene – uavklarte påstander

Blant det OpenAI hevder er en løsning på firedimensjonal Kakeya-formodning, forbedringer av svært viktige datamaskinalgoritmer og faktisk fremgang mot Riemannhypotesen (Scientific American). The News omtaler også en påstått delvis Birch–Swinnerton-Dyer-formel for ledende ledd – under bestemte betingelser, ikke i full generell gyldighet – samt en nullfri region for en «quasi-Riemann»-hypotese og en øvre grense på 9/4 for matrisemultiplikasjonseksponenten (The News).

Dette må leses med varsomhet. Disse er foreløpig selskapspåstander, ikke publiserte og fagfellevurderte artikler. Scientific American anslår at det vil ta måneder å sette seg inn i resultatene. Kilden The News inneholder dessuten tilsynelatende skrivefeil (for eksempel «elliptic nerves» i stedet for det som sannsynligvis skal være elliptiske kurver), noe som gjør de tekniske detaljene der upålitelige uten krysssjekk. Hovedresultatene bør altså behandles som uverifiserte til matematikere har gått gjennom dem.

Åpenhetsgapet: AGMAI-anbefalingene som ikke ble fulgt

OpenAI opplyser at det konsulterte en uavhengig rådgivningsgruppe – Advisory Group on Mathematics and Artificial Intelligence (AGMAI) ved Institute for Advanced Study – før resultatene ble utgitt (Times Now/MSN). Men gruppen har vært kritisk på to punkter.

For det første: Den 29. september publiserte AGMAI et blogginnlegg der gruppen slår fast at «noen frontier-AI-laber tester avanserte matematiske problemer på proprietære modeller som forblir utilgjengelige for det bredere forskersamfunnet», og «vi støtter ikke denne praksisen, og vi ber dem slutte å teste avanserte matematiske problemer på proprietære modeller» (Gizmodo). Resultatene i den nye utgivelsen kommer, ifølge Gizmodo, fra samme utilgjengelige interne modell som Navier–Stokes-påstanden.

For det andre: AGMAIs anbefalinger sier at et selskap som utgir slike resultater, bør offentliggjøre modellen, den nøyaktige prompten og regnetiden bak hvert enkelt resultat. OpenAI valgte i stedet å offentliggjøre bare gjennomsnittlig regnetid per problem, med noen tilleggsstatistikker – og ingen prompter. Selskapet har ifølge Scientific American uttalt at det ikke er bundet av anbefalingene (Scientific American).

OpenAI-talsperson Lindsay McCallum Rémy sier likevel til Gizmodo at «AGMAIs råd og offentlige anbefalinger har informert hvordan vi deler resultatene. Vi vil fortsette å inkorporere tilbakemeldinger fra miljøet og forbedre våre standarder for deling av store vitenskapelige fremskritt» (Gizmodo).

August-møtet og den uavklarte motsigelsen

Bakgrunnen er et møte i august mellom OpenAI og rundt 40 matematikere. Selskapet antyda da at modellene hadde løst hundrevis av langvarige mathematiske problemer. Deltakerne reagerte ifølge Northwestern-matematikeren Bryna Kra med «en blanding av spenning og frykt», og gruppen ba selskapet om å ikke bare publisere dem i en blogg eller tweet – slik det var gjort med 10 problemer tidligere den måneden. Hun sier til WIRED at innspillet ble ignorert (WIRED).

Her står ord mot ord. WIRED skriver at selskapsrepresentanter skal ha forsikret deltakerne om at løsningene ikke ville bli utgitt alt på én gang – en forsikring OpenAI-talsperson Lindsay McCallum sier selskapet er «ikke kjent med» (WIRED). Denne motsigelsen er ikke avklart i dekningen, og begge sidene står ved sine versjoner.

Et miljø i utakt med seg selv

Responsen fra matematikermiljøet er ikke ensidig kritisk, men delt. Daniel Litt, matematiker i Toronto, sier: «Hvis vi vil vite svarene på disse matematiske spørsmålene, ser jeg ingen grunn til at vi bør be selskapet om å holde dem hemmelige for oss» (AI Weekly). Terence Tao har derimot kalt tempoet i AI-genererte resultater fra frontier-laber for «insane» (AI Weekly).

OpenAI hevder også at den nye, ikke-offentlig tilgjengelige modellen produserte nesten alle resultatene som svar på én enkelt prompt til én enkelt AI-agent – selv om enkelte resultater kan ha krevd flere forsøk (Scientific American). Dette er en talspersonutsagn som ikke kan uavhengig verifiseres, og MIT-matematiker Andrew Sutherland oppfordrer til å behandle påstanden som uverifisert.

Hva som gjenstår å avklare

Flere ting er fortsatt åpne. Hvor mange av de 722 manuskriptene som faktisk er Lean-verifisert, er ikke presisert. Hovedresultatene – Kakeya, quasi-Riemann, Birch–Swinnerton-Dyer – må ligge til grunn for måneder med gjennomgang før de kan regnes som etablert. Forskjellen mellom tellingene 722/372/377 er uforklart i dekningen. Og kanskje viktigst: Det er uavklart hvilke åpenhetsnormer som kommer til å binde fremtidige slike utgivelser – AGMAIs anbefalinger eksisterer, men OpenAI har tatt den posisjonen at de ikke er bindende.

Det gjør utgivelsen til noe mer enn en enkelt nyhetshendelse: Den blir en testcase for hvordan frontier-laber bør dele matematiske resultater – og hvor stor kløften kan være mellom et selskaps egne rådgivere og dets faktiske praksis.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.