To avvik i OpenAIs Navier-Stokes-bevis: tekst og Lean-kode samsvarer ikke
OpenAI hevdet denne uka at en intern modell har løst de tredimensjonale Navier-Stokes-ligningene – et langvarig uløst problem i matematikken. Men før uka var omme, dokumenterte matematikere ved Cambridge og King's College London minst to avvik mellom beviset slik det er formulert i naturlig språk og dets formalisering i programmeringsspråket Lean. Samtidig tyder tallene i utgivelsen på at rådgivergruppen AGMAIs anbefalinger fra slutten av september ikke ble fullt fulgt – men det er, etter AGMAIs eget utsagn, opp til det matematiske samfunnet å vurdere. Saken er dermed ikke avgjort – den har i stedet blitt en prøve på noe større: Hvordan skal i det hele tatt AI-generert matematikk verifiseres?
Det som skjedde
OpenAI kunngjorde at selskapets interne modell har løst de tredimensjonale Navier-Stokes-ligningene, et langvarig problem i væskedynamikk, og at den har produsert både et analytisk bevis og en formalisering i Lean (cryptobriefing.com, som siterer Bloomberg Markets). Det er altså selskapets egen påstand. Som kildene understreker: Løsningen har ennå ikke blitt offisielt anerkjent som en løsning på Clay Mathematics Institutes Millennium-prisproblem – en utfordring som, ifølge et meningsinnlegg i Inside Higher Ed, ble utlyst for rundt 25 år siden.
Navier-Stokes-påstanden kom ikke alene. Den var en del av en massiv utgivelse på rundt 722 artikler knyttet til 372 åpne problemer, spennende fra algebra og geometri til teoretisk informatikk, produsert i stor grad av en uutgitt modell (The Conversation). Flere artikler hevder fremskritt på Millennium-prisproblemer, blant dem Navier-Stokes-relatert arbeid. Noen av artiklene er allerede trukket tilbake eller endret. Skalaen og formen på utgivelsen – omtalt som alt fra «a drop», «a dump», «carpet bombing» og en «mathocalypse» – har ifølge The Conversation sendt sjokkbølger gjennom det matematiske miljøet.
Et teknisk forbehold om tallene: TechCrunch omtaler 719 manuskripter i utgivelsen, The Conversation 722 artikler. Avviket mellom kildene er ikke oppklart, så begge tall bør leses som omtrentlige. Samme meningsinnlegg hevder at 10 000 interne agenter brukte 88 timer på beviset (Inside Higher Ed) – men dette er en meningstekst, og detaljene er ikke bekreftet av andre kilder og bør behandles deretter.
Hvordan verifisering av AI-bevis skal fungere
For å forstå hvorfor kontroversen oppsto, må man forstå mekanismen bak AI-genererte matematiske bevis. Når AI-modeller løser matematiske problemer, lager de først en forklaring i «naturlig språk» – den teksten et menneske kan lese og vurdere. Deretter forsøker de å uttrykke resultatet i Lean, et programmeringsspråk som i teorien bekrefter bevisets korrekthet ved å kompilere det som kode (TechCrunch).
Ideen er elegant: Naturlig språk er tvetydig, mens Lean-kode maskinelt kan sjekkes. Naturlig språk-versjonen tjener som det menneskelesbare fortellingslaget, mens Lean-versjonen er den harde garantien.
Men garantien gjelder bare hvis de to versjonene sier det samme. En Lean-kode kan kompilere perfekt og likevel bevise noe annet enn det naturlig språk-beviset hevder – hvis for eksempel definisjonene, antakelsene eller problemformuleringen avviker mellom de to. Derfor er overensstemmelsen mellom dem selve kjernen i verifiseringen.
Det er nøyaktig her Cambridge/King's College-artikkelen angriper. Den dokumenterer minst to avvik mellom naturlig språk-beviset og Lean-koden bak løsningen OpenAI har levert på et problem utledet fra Navier-Stokes-ligningene, som beskriver væskers komplekse oppførsel (TechCrunch).
Et viktig poeng som lett går tapt i nyhetsstrømmen: Avvikene beviser ikke nødvendigvis at noen av versjonene er feil. Et avvik kan bety at naturlig språk-versjonen er løs, at Lean-koden formaliserer et annet (kanskje svakere) utsagn, eller at begge er korrekte, men ikke gjensidig oversettbare slik de står. Avvikene betyr derimot noe helt konkret: Standardene som skal gjøre et AI-bevis sjekkabelt, er ikke innfridd i dette tilfellet. Det foreligger foreløpig ikke et enkelt, maskinsjekkbart bevis som samtidig tilsvarer det som hevdes. Navier-Stokes-påstandens korrekthet er fortsatt et åpent spørsmål.
Standardene som ikke ble innfridd
Det finnes faktisk nylig utarbeidede standarder for denne typen utgivelser. AGMAI, en rådgivergruppe på ni forskere med tilhold ved Institute for Advanced Study i Princeton, utga retningslinjer i slutten av september – altså rett før OpenAIs utgivelse. Etter OpenAIs lansering sa gruppen i en uttalelse at «det til syvende og sist er opp til det matematiske samfunnet å vurdere i hvilken grad anbefalingene våre ble fulgt» (TechCrunch; sitatet er oversatt fra engelsk). Det er dermed AGMAIs tall og fagmiljøets vurdering, ikke gruppen selv, som ligger til grunn for at retningslinjene framstår som manglende fulgt.
Tallene bak kritikken er konkrete. Bare 10 av de 719 manuskriptene inkluderte utgivelser av modellens resonnementsspor (chain of thought) (TechCrunch). Uten resonnementssporet kan matematikere ikke ettergå hvordan modellen kom frem til resultatet – bare sluttproduktet. Og ifølge TechCrunch var bare 42 prosent av de utgitte bevisene formalisert, altså oversatt til Lean eller tilsvarende – en andel som ifølge rapporteringen faller under AGMAIs anbefalinger. En majoritet av bevisene eksisterer dermed kun som naturlig språk, uten den maskinsjekkbare garantien.
Kombinasjonen er problematisk: I en rekke tilfeller får fagmiljøet verken innsyn i modellens resonnement eller en formalisert beviskode. Det som gjenstår, er hundrevis av tekstbevis som må leses og vurderes manuelt – i et tempo som ikke matcher utgivelsestempoet. Dette er kjernen i saken: Utgivelsen skapte langt mer matematikk enn fagmiljøet realistisk kan verifisere med de verktøyene og informasjonen som ble levert.
Fagmiljøets reaksjon
Kritikken har kommet fra flere hold. Terence Tao kritiserte utgivelsen på sosiale medier: «Problemer løses autonomt av AI-promptere som ikke har interesse av det bredere fagfeltet i seg selv når det opprinnelige målet deres er ‘løst’, og som ikke forstår AI-resultatet godt nok til å svare på spørsmål om resultatet, holde foredrag eller på annen måte samhandle med resten av fagfeltet» (TechCrunch; sitatet er oversatt fra engelsk).
Taos poeng er ikke primært at resultatene er falske, men at de mangler det som gjør matematikk til et levende fag: mennesker som kan forsvare, forklare, utvide og feilsøke arbeidet. Et bevis ingen kan svare for, er i en viss forstand ikke ferdigstilt – verken sosialt eller vitenskapelig.
Et annet, mer alvorlig ankepunkt handler om opphav. Ifølge meningsinnlegget i Inside Higher Ed har matematikere generelt uttrykt bekymring for potensielt uakseptabel og uerkjent bruk av nylig arbeid av menneskelige matematikere i AI-resultatene (Inside Higher Ed). Dette skal forstås som rapporterte bekymringer fra fagmiljøet, ikke som dokumenterte fakta – men hvis de skulle bevise seg sanne, ville de berøre spørsmål om akademisk kreditering i tillegg til korrekthet.
Hva som står på spill
OpenAI selv begrunner utgivelsen med å «muliggjøre videre fremskritt i matematikken» (The Conversation; sitatet er oversatt fra engelsk). Det er dette utsagnet som må tåle sammenligningen med virkeligheten: En utgivelse som verken inkluderer resonnementsspor for 709 av 719 manuskripter eller formalisering for mer enn halvparten av bevisene, legger begrensninger på akkurat den videre faglige fremdriften den sier seg motivert av. Matematikere kan ikke bygge videre på resultater de ikke kan verifisere, og de kan ikke verifisere resultater uten verktøyene og innsikten som ble holdt tilbake.
Det finnes en vei ut, og den er enkel å beskrive selv om den er krevende: full formalisering av bevisene i Lean, slik at maskinen kan sjekke dem; overensstemmelse mellom de formaliserte og naturlig språk-versjonene, slik at avvikene Cambridge/King's College-dokumentet har påvist lukkes; og utgivelse av resonnementsspor der fagmiljøet ber om det. AGMAI peker selv på hvor avgjørelsen ligger: hos det matematiske samfunnet.
Inntil den vurderingen er gjort, er statusen den følgende: OpenAI har hevdet å ha løst et Millennium-prisproblem og å ha publisert hundrevis av resultater. Clay-instituttet har ikke anerkjent løsningen. Et innspill fra matematikere ved Cambridge og King's College London dokumenterer avvik mellom bevisets to versjoner. Rådgivergruppens anbefalinger ser ut til å ikke være fulgt. Det er ikke et verifisert gjennombrudd – ikke ennå. Det er en påstand under prøving, og prøvingen har knapt begynt.
Alle kildene i denne saken er sekundær rapportering; OpenAIs egen kunngjørelse, de utgitte artiklene og Cambridge/King's College-artikkelen bør leses i original for å verifisere detaljene før noen endelig konklusjon trekkes.

