10 000 agenter, 130 milliarder tokens – og under 10 prosent av æren til sværmen
Da OpenAI forrige uke kunngjorde at et system på rundt 10 000 KI-agenter hadde brukt 130 milliarder tokens over 88 timer på et Millennium-prisproblem, ble det lest som et gjennombrudd for multi-agent-KI. Men da forsker Noam Brown møtte opp i Dwarkesh-podkasten 17. september 2026, trakk han selv ned forventningene: ifølge en oppsummering av episoden tilskriver han multi-agent-koordinering mindre enn 10 prosent av æren. Resten skyldes en generelt dyktig basemodell som klarer å jobbe over lange tidshorisonter. Det er et sjeldent ærlig innblikk i hva et av årets mest omtalte KI-resultater faktisk demonstrerer – og hva det ikke gjør.
Nyheten: sværmen på Millennium-prisproblemet
Vert Dwarkesh Patel innleder episoden med å si at OpenAI forrige uke kunngjorde at de hadde løst et av Millennium-prisproblemene med et system på 10 000 ulike KI-agenter som brukte 130 milliarder tokens over 88 timer (Dwarkesh Podcast). I den omkringliggende dekningen er problemet identifisert som Navier–Stokes-ligningene, ett av matematikkens seks Millennium-prisproblemer, som beskriver hvordan væsker beveger seg (The Neuron, 18. september 2026). En annen oppsummering karakteriserer påstanden som et firmakrav og kvalifiserer agenttallet som «angivelig» 10 000 (BigGo).
Det er verdt å stoppe opp ved hva denne formuleringen faktisk er: vertens gjengivelse av OpenAIs kunngjøring, ikke et uavhengig verifisert bevis. Ingen primær OpenAI-dokumentasjon – ingen artikkel, preprint eller offisiell pressemelding – og ingen bekreftelse fra Clay Mathematics Institute foreligger i det tilgjengelige kildematerialet. Det betyr ikke at påstanden er feil – men at «løst» foreløpig er en ramme fra podkasten og nyhetsbrev, ikke en fastslått matematisk fakta. Det er en forskjell som betyr noe når resultatet samtidig brukes til å trekke store konklusjoner om hvor KI-utviklingen står.
Brown selv er en nøkkelkilde for å tolke det: ifølge podkasten var han en av nøkkelbidragsyterne bak det som ble o1 og OpenAIs resonneringsmodeller, og jobber nå med multi-agent-systemer. Episoden, sammen med oppfølgingen fra The Neuron 18. september, gir den første grundige gjennomgangen av hvordan systemet fungerer – og av Browns egne forbehold.
Mekanismen: hvorfor flere agenter i det hele tatt?
Browns argumentasjon starter med et empirisk mønster, som han formulerte slik i transkriptet: «Måten jeg tenker på det: når du plotter ytelsen til disse resonneringsmodellene med test-tids-regnekraft på x-aksen og ytelse på stort sett ethvert resonneringsbenchmark på y-aksen, ser du et veldig tydelig mønster: jo lenger disse modellene bruker på å tenke over svaret sitt, jo bedre gjør de det» (Dwarkesh Podcast). Sitatet stammer fra Dwarkesh-transkriptet og er gjengitt i norsk oversettelse.
Problemet er at denne ekstra tenketiden tar veggklokke-tid. En modell som får ti ganger mer resonneringstid, blir bedre – men svaret kommer ti ganger senere. Brown bruker ifølge episoden analogien til en student som har fem minutter på SAT-prøven kontra fem timer: gitt god tid løser de fleste langt vanskeligere oppgaver, men i praksis må man dele opp jobben og parallellisere. Multi-agent-systemer er KI-varianten av dette: i stedet for én agent som resonnerer serielt i timevis, lar man mange agenter jobbe samtidig og utveksle resultater.
Det er altså ikke koordinering som er målet i seg selv – det er en omvei rundt en flaskehals i tid.
Arkitekturen: minimal struktur, koordinering som oppstår av seg selv
Ifølge en oppsummering av episoden (BigGo) avviker OpenAIs tilnærming fra den tradisjonelle multi-agent-arkitekturen med rigide koordinator- og arbeiderroller. I stedet bygges det inn så lite struktur som mulig: hver agent får et primitivt verktøy for å sende meldinger til enhver annen agent, og meldingen settes inn i mottakerens kontekst. Koordineringen – hvem som deler hva med hvem – oppstår angivelig av seg selv.
Dette er den konkrete tekniske nyheten i saken. Poenget er at hvis man gir agentene en enkel kommunikasjonsprimitiv og en dyktig basemodell, kan systemet selv oppdage hvordan det bør organisere arbeidet – i stedet for at mennesker forhåndsdefinerer et hierarki som kan bli feil for hver ny oppgavetype.
Merk samtidig at denne beskrivelsen kommer fra en automatisk generert oppsummering av podkasten, ikke fra verbatim-sitater i transkriptet. Det er sannsynligvis troverdig, men detaljene bør avklares mot hele transkriptet.
Tallene: sublineær skalering, ikke gratis parallellisering
Hvor mye kjøper man egentlig av å legge til agenter? The Neuron (18. september 2026), med henvisning til OpenAIs publiserte skaleringstall, gjengir følgende: fire agenter som jobber sammen fullfører en oppgave omtrent dobbelt så raskt, men til omtrent dobbelt så høy regnekostnad. Seksten agenter viser lignende, men noe mindre effektiv oppførsel.
Med andre ord: tidsgevinsten er omtrent lineær i dette området, men kostnaden skaleres også – og gevinsten flater ut når sværmen vokser. Dette er sublineær økonomi, ikke fri parallell akselerasjon. Man kjøper tidsbesparelse med tokens, og marginalen per ekstra agent minker.
Det andre forbeholdet Brown selv trekker frem, er at parallelliserbarheten er domeneavhengig. Matteproblemer med naturlig deleoppdeling lar seg kanskje parallellisere rimelig godt; andre oppgavetyper der delresultatene er tett sammenkoblet, vil trolig tjene langt mindre på samme triks. Ett datapunkt fra et Millennium-prisproblem sier lite om hvor godt tilnærmingen generaliserer.
Forbeholdene: ett datapunkt, ingen ablasjoner
Det mest oppsiktsvekkende i episoden er ifølge BigGo-oppsummeringen Browns egen kredittfordeling: Millennium-resultatet bør ikke primært tilskrives multi-agent-koordinering – han setter mindre enn 10 prosent av æren der – men til en genuint kraftig generell modell som evner å jobbe over lange tidshorisonter.
Med andre ord: det som gjorde kjøringen mulig, var først og fremst at basemodellen var god nok til å holde tråden over 88 timer og 130 milliarder tokens. Sværmen handlet om tid, ikke om en ny type intelligens.
Brown peker også på et metodisk hull: det finnes ingen ablasjon som viser hvor lang tid en enkelt agent ville brukt på Navier–Stokes, og ingen måling som isolerer gevinsten av 10 000 agenter versus 1 000 (BigGo). Uten den typen kontrollsett kan man ikke si sikkert hvor mye parallelliseringen bidro med, eller om skaleringen fra 1 000 til 10 000 agenter var verdt tokenregningen. Resultatet er – som Brown selv ifølge oppsummeringen ramser det opp – ett datapunkt uten de sammenligningene som skulle til for å generalisere.
Dette er uvanlig ydmykhet fra forskeren bak et stort resultat, og den er analysens viktigste avkastning: overskriftene leste kunngjøringen som et multi-agent-gjennombrudd; hovedpersonen selv leser den som et bevis på at lange resonneringshorisonter i en sterk basemodell er det som egentlig bærer resultatet.
Hva som fortsatt er uavklart
Det største åpne spørsmålet er verifiseringsstatusen. En påstand om at et system har «løst» et Millennium-prisproblem er i prinsipp noe matematikere kan etterprøve. Så langt foreligger ingen slik bekreftelse i det tilgjengelige materialet, og det er uavklart om det matematiske fagmiljøet i det hele tatt har gjennomgått argumentet. Inntil en uavhengig gjennomgang foreligger, er den forsiktige formuleringen at OpenAI hevder å ha løst problemet, ikke at det er løst.
Det andre er det metodiske: hvilke ablasjoner ville isolert multi-agent-bidraget? Minst tre er relevante – én enkelt agent over samme problem, en sværm på 1 000 agenter, og en på 10 000 – og sammen ville de gitt en faktisk skaleringkurve. Slike eksperimenter er kostbare i tokens, men de er den eneste måten å flytte diskusjonen fra anekdote til måling.
For det tredje peker episodens egne kapitler utover selve resultatet. Blant de tidsstemplede temaene finner vi «hva mattefremgangen forteller oss om rekursiv selvforbedring» (Dwarkesh Podcast), samt diskusjon av om modellers tankekjeder blir vanskeligere å overvåke etter hvert som de degraderer, og hvordan man kan vite om modeller er alignet før rekursiv selvforbedring. Episodematerialet antyder altså at matematiske resultater av denne typen behandles som et datagrunnlag for å tenke på hva som skjer når KI begynner å automatisere KI-forskning – og at overvåkbarheten av resonneringen er et åpent problem i det scenariet.
Hvorfor dette betyr noe
Kunngjøringen har utløst en bredere debatt om laboratoriesikkerhet og tempoet i KI-fremgangen. Denne dekningen er i stor grad sekundær, mye av den lar seg ikke verifisere i kildegrunnlaget, og bør derfor behandles med forsiktighet.
Det solide utbyttet av uken er mer nedjordisk. For det første: skaleringsøkonomien i multi-agent-systemer er kjøpt, ikke funnet – fire agenter gir omtrent dobbel fart til dobbel kostnad, og gevinsten flater ut derfra. For det andre: arkitekturen med minimal struktur og en enkel meldingsprimitiv er en konkret, etterprøvbar designdeskisjon som andre kan kopiere eller utfordre. For det tredje: det viktigste bidraget til resultatet var ifølge Brown selv trolig ikke sværmen, men en basemodell som tåler lange horisonter – en påminnelse om at de mest betydningsfulle fremskrittene i resonnerings-KI fortsatt skjer i selve modellen, ikke i orkestreringen rundt den.
Det er kanskje den mest nyttige leksjonen fra de 88 timene og de 130 milliardene tokens: før man konkluderer med at sværmer er fremtiden, trenger man tallene som viser hva sværmen faktisk la til.

