Ni-løkke-rekord knakket med to uavhengige metoder – kode skrevet fra bunnen av av Claude

Anthropic kunngjorde 25. september at Claude har fullført ni-løkke-beregningen av sekspartikkel-spredivertikler i planar N=4 super Yang–Mills – og slo rekorden til Lance Dixons SLAC-team, som har sto i tre år.

Ni innfelte messingringer, der den øverste er sprukket opp – en illustrasjon av rekordbrytende ni-løkke-beregning i teoretisk fysikk.
Illustrasjon
Gi artikkelen

Ni-løkke-rekord knakket med to uavhengige metoder – kode skrevet fra bunnen av av Claude

Anthropic kunngjorde 25. september at Claude har fullført ni-løkke-beregningen av sekspartikkel-spredivertikler i planar N=4 super Yang–Mills – og slo rekorden til Lance Dixons SLAC-team, som har sto i tre år. Alt skal ha skjedd med en oppgavebeskrivelse på én setning, en «continue»-knapp og en totalkostnad på rundt 1 000–2 000 dollar per metode.

Det som skal ha skjedd

Ifølge Anthropys kunngjorde, slik den er gjengitt av BigGo Finance, fullførte selskapets språkmodell Claude ni-løkke-beregningen av sekspartikkel-spredivertikler i planar N=4 super Yang–Mills-teori på en forskningsplattform med «nesten uten oppsyn»-drift. Dermed ble åtteløkke-rekorden slått – en rekord som et team ledet av fysiker Lance Dixon ved SLAC National Accelerator Laboratory i USA har hatt i tre år.

Det er verdt å understreke hva som er hva her: At rekorden ble slått, at arbeidsflyten var nesten uten oppsyn, og at oppgavebeskrivelsen var én setning, er selskapets påstand. Det som i tillegg står sterkere, er at Dixon selv – ifølge samme kilde – uavhengig har verifisert Claude sine beregningsresultater.

Hva beregningen faktisk er

Spredivertikler beskriver sannsynligheten for at partikler kolliderer og sprer seg på bestemte måter. I planar N=4 super Yang–Mills – en sterkt forenklet, men berømt matematiske modell i teoretisk fysikk – beregnes disse orden for orden: «løkker» representerer stadig mer presise kvantekorreksjoner utover det enkleste nivået. Hver ekstra løkke øker kompleksiteten dramatisk, og ni-løkke-nivået for seks partikler har vært ansett som svært krevende.

Dixon sitt SLAC-team sto for forrige rekord på åtte løkker. Ifølge BigGo Finances gjengivelse mente Dixon tidligere at å fullføre beregningen direkte på ni løkker var for vanskelig, og teamet hans hadde forberedt seg på oppgaven i årevis.

Utfordringen som startet det

Oppdraget kom ikke fra Anthropic selv, men fra et blogginnlegg 7. august av Matt von Hippel, tidligere teoretisk fysiker og naturvitenskapsformidler. Han utfordret AI-selskaper til å løse et uløst problem i spredningsamplituder med regnekraft som en enkelt akademiker har råd til. Han foreslo to alternativer: å beregne N=8 supergravitasjon til syv løkker, eller å beregne sekspartikkel-amplituden i planar N=4 super Yang–Mills til ni løkker.

Anthropic valgte altså det siste alternativet – og skal ifølge rapporteringen ha holdt seg innenfor von Hippels budsjettrestriksjon for enkeltforskere.

To uavhengige metoder – og prislisten

Claude skal ha utført beregningen to ganger, med to forskjellige metoder: den direkte bootstrap-tilnærmingen, og Dixon sitt teams indirekte rute via formfaktorer. At resultatene fra to uavhengige tilnærminger stemmer overens, er en klassisk form for intern kontroll i dette feltet.

Kostnadene – som stammer fra opplysninger fra Anthropic-forskerne og von Hippels egen fremstilling, slik BigGo Finance gjengir dem – er oppsiktsvekkende lave: cirka 1 000–2 000 dollar per metode i sluttbrukerkostnad. Av dette gikk bare rundt 100 dollar til selve den numeriske beregningen, tilsvarende 96 prosessorer som kjørte kontinuerlig i én uke. Resten av kostnaden ligger altså i selve modellkjøringen – utviklingen av kode og strategi, ikke den tunge aritmetikken.

Arbeidsflyten: én setning og «continue»

Ifølge opplysninger gjengitt av BigGo Finance fikk forskerne Claude kun en kort oppgavebeskrivelse på én setning. Etter det bestod veiledningen nesten utelukkende av ordet «continue». En typisk instruks skal ha lyst omtrent slik: «Jeg skal sove og er ikke tilgjengelig de neste timene. Fortsett å jobbe til jeg ber deg stoppe, og rapporter fremgang hvert fjerde til sjette time.»

Også dette er forskerdisclosure og selskapsfremstilling, ikke noe som er uavhengig verifisert. Men det peker på det som kan være poenget: ikke en ny algoritme, men en modell som kan drive en lang, flertrinns beregningsprosess med minimal menneskelig styring.

Det Dixon-verifikasjonen faktisk etablerer

Dixon verifiserte ifølge rapporteringen resultatene uavhengig, og skal ha uttrykt overraskelse over at Claude kunne kjøre hele arbeidsflyten i én gjennomkjøring. I et etterskrift til verifikasjonen skrev han – slik BigGo Finance gjengir det – at hvis én enkelt komponent i oppskriften hadde hatt en feil, ville hele resultatet kollapset som en feilet soufflé. Likevel skal Claude ha bygget all koden fra bunnen av.

Det Dixon-sjekken etablerer, er altså: resultatene stemmer, koden var skrevet fra bunnen av, og enhver enkeltfeil ville ha rullet resultatet. Det den ikke etablerer, er en fullstendig uavhengig reprodusering: Det beskrives ingen publisert artikkel og ingen reprodusering av beregningen av noen andre enn Dixon. Verifikasjonen hviler på én fysikers kontroll, kjent kun gjennom sekundær rapportering.

Den nykterige motvekten

Von Hippel selv demper forventningene. Han erkjente, ifølge BigGo Finances gjengivelse av gjestebloggen hans, at forsøket ikke ga den typen «uventet gjennombrudd i å bryte beregningsbarrieren» han hadde håpet på. Claude brukte kjente metoder – bare med noe mer regnekraft enn det mennesker tidligere har vært villige til å investere.

Det er en viktig ramme for lesingen av nyheten: Dette er ikke et nytt fysikkgjennombrudd, men et gjennombrudd i hvor mye langsiktig, presisjonskrevende arbeid en språkmodell kan utføre nesten uten oppsyn – til en pris en enkelt akademiker kan bære.

Samme måned: en bølge av AI-matematikk- påstander

Kunngjøringen lander midt i en rekke av beslektede selskapsutsagn i samme måned. Anthropic oppga at Claude har hevet nedre grense for andelen av nullene til Riemann zeta-funksjonen som oppfyller Riemann-hypotesen, fra 41,6 til 67,2 prosent, og fullførte en full Lean-formalisering av Fermats siste teorem på 11 dager med stort sett autonom drift. OpenAI opplyste at en av sine interne modeller hadde løst mer enn 100 lenge uløste matematiske problemer – men kildegrunnlaget for den siste påstanden er sparsomt i tilgjengelig rapportering, og innholdet kan ikke fastslås nærmere her.

Alle disse tallene og påstandene er selskapenes egne, gjengitt via samme kilde, og ingen av dem er dokumentert gjennom primærkilder i det tilgjengelige grunnlaget.

Hva som fortsatt står åpent

Tre ting gjenstår før resultatet kan plasseres trygt i faghistorien: En primærkilde fra Anthropic eller en publisert artikkel som dokumenterer beregningen, en uavhengig reprodusering av noen andre enn Dixon, og en vurdering av om denne typen nesten-autonom langtidskjøring kan generaliseres til andre problemer i feltet. Inntil videre er det trygge rammeverket det von Hippel selv pekte på: ingen uventet fysikk, men et bemerkelsesverdig stykke utførelse – kjente metoder, mer regnekraft, og et menneske som i stor grad bare trykket «continue».

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.