Ai2 lanserer Olmo-core 3: Åpent MoE-rammeverk oppgir 2,7 ganger høyere gjennomstrømning

Ai2 har lansert Olmo-core 3, et åpen kildekode-rammeverk for trening av store mixture-of-experts-modeller. Selskapets egne målinger viser omtrent 2,7 ganger høyere treningsgjennomstrømning og konfigurasjoner utover en billion parametere…

Illustrasjon: Dusinvis av tynne kobbertråder ledes gjennom et gitter av små messingporter, der bare noen få tråder fortetter seg på vei ut – et bilde på mixture-of-experts-ruting og høy treningsgjennomstrømning.
Illustrasjon
Gi artikkelen

Ai2 lanserer Olmo-core 3: Åpent MoE-rammeverk oppgir 2,7 ganger høyere gjennomstrømning

Ai2 har lansert Olmo-core 3, et åpen kildekode-rammeverk for trening av store mixture-of-experts-modeller. Selskapets egne målinger viser omtrent 2,7 ganger høyere treningsgjennomstrømning og konfigurasjoner utover en billion parametere – men med et viktig forbehold: tallene måler systemets kapasitet, ikke kvaliteten på en trent modell.

Det Seattle-baserte forskningsselskapet Allen Institute for AI (Ai2) kunngjorde rammeverket torsdag 1.–2. oktober 2026, og prosjektet er allerede tilgjengelig på GitHub for utviklere og åpen kildekode-miljøet, ifølge SiliconANGLE. Olmo-core 3 er treningsinfrastrukturen bak Ai2s neste generasjon OLMo-modeller, og lanseringen betyr at uavhengige laboratorier nå kan evaluere tilnærmingen på egen hånd.

Hva som faktisk er endret: fra FSDP til DDP

Kjernen i oppdateringen er et valg av paralleliseringsstrategi. Tidligere versjoner brukte fully sharded data parallelism (FSDP), der modellvektene splittes opp_maskinert på tvers av GPU-er og måtes sammen igjen når de trengs. Det gir god minneutnyttelse, men kostnaden er gjentatte vektinnsamlingsoperasjoner under trening.

Olmo-core 3 bytter til en stakk basert på distributed data parallelism (DDP) der ekspertene holdes resident på GPU-ene, og relevante data rutes til dem i stedet, skriver Unite.AI. Siden vektene ikke samles inn på nytt hver gang de skal brukes, fjernes en av de store kommunikasjonskostnadene ved MoE-trening. I en MoE-modell velger en ruter per token bare noen få ekspertnettverk blant mange, og det er nettopp denne rutingen som gjør at man kan øke total parameterkapasitet uten å øke beregningsmengden per token.

Tallene – alle fra Ai2 selv

Ai2s egne benchmark-tall utgjør hoveddelen av dokumentasjonen for lanseringen, og de bør leses som selskapets påstander:

  • 52 000 tokens per sekund per GPU mot rundt 19 400. I en foreløpig test på åtte NVIDIA B300-GPU-er rapporterer Ai2 at en MoE-modell på 47 milliarder parametere oppnådde 52 000 tokens/s per GPU med den nye stakken, mot 19 400 med den tidligere implementeringen – det Ai2 beskriver som omtrent 2,7 ganger gjennomstrømning (Unite.AI). Her er det verdt å merke seg en kildeulikhet: SiliconANGLE fremstiller sammenligningen som mot Nvidias etablerte Megatron-core, mens Unite.AI setter den opp mot Ai2s tidligere implementering. Hvilket grunnlag som ligger bak 2,7x-tallet er altså ikke avklart i de tilgjengelige kildene.
  • Skalering av ekspertpuljen. I én benchmark vokste antallet eksperter fra 8 til 128, fortsatt med fire eksperter valgt per token. Det holdt aktive parametere omtrent fast på 3,2 milliarder mens total kapasitet økte fra 4,6 til 47 milliarder – med et treningsgjennomstrømningstap på under 5 prosent, ifølge Ai2 via Unite.AI.
  • Billion-skala. Ai2 oppgir å ha benchmarket en konfigurasjon med 1,2 billioner totale parametere og 58,36 milliarder aktive per token over 512 GPU-er, med høyest observert gjennomstrømning på 858 TFLOP/s per GPU (Unite.AI).
  • 2,38 billioner med DeepEP v2. Tester med DeepEP v2, et alternativt kommunikasjonslag for ruting mellom eksperter, nådde en konfigurasjon på omtrent 2,38 billioner totale parametere, rapporterer TechTimes.
  • Lavere presisjon som heisstang. I en kontrollert benchmark på fire B300-GPU-er med jevn ekspertlast ga aktivering av MXFP8 i de mest fordelaktige delene av systemet omtrent 21 prosent høyere gjennomstrømning enn BF16, mens topp aktiv minnebruke falt fra rundt 103 GiB til 95 GiB (TechTimes).

En mindre detalj er også uavklart: SiliconANGLE skriver «Nvidia B3000» som GPU-modell, mens de to andre kildene skriver «NVIDIA B300». Det nøyaktige modellnavnet kan ikke fastslås fra det tilgjengelige kildematerialet.

Forbeholdet som følger med tallene

Ai2 er selv tydelig på hva benchmark-tallene betyr og ikke betyr. Begge hovedbenchmarkene brukte tilfeldig ruting – en kunstig erstatning for reell tokendistribusjon som lar systemets gjennomstrømning måles uten at en faktisk modell trenes. De demonstrerer hva maskinvarestakken tåler; de er ikke bevis på at Ai2 har trent en modell med en billion parametere, eller at en slik modell ville prestert godt, skriver TechTimes om den tekniske rapporten.

Det betyr at «trillion-parameter scale» i denne sammenhengen er en systemreferanse, ikke en kvalitetspalett. Teknisk rapporten skal ifølge TechTimes karakteriseres slik at hovedtallene er systems-referanser under tilfeldig ruting, ikke påstander om tid-til-kvalitet. For lesere som sammenligner slike tall på tvers av rammeverk, er skillet vesentlig: gjennomstrømning under syntetisk ruting sier ingenting om hvordan modellen konvergerer eller hva den lærer.

Hvorfor det er viktig

Det store bildet er at treningsinfrastruktur på dette nivået normalt utvikles internt hos frontierselskaper og sjelden deles. At en åpen stakk oppgir systemkonfigurasjoner på 1,2–2,38 billioner parametere, med dokumentert opptil 858 TFLOP/s per GPU over 512 GPU-er, gir laboratorier og utviklere uten frontierselskapenes ressurser et konkret referansepunkt – og kode de kan kjøre og bygge videre på på GitHub.

Utbyttet av DDP-oppsettet er også av mer generell interesse: Å holde ekspertvektene fast på GPU-en og heller flytte data er et designvalg som kan Inspirere andre åpne treningsprosjekter, særlig der FSDP-ens gjentatte vektsamlinger dominerer kostnaden. Kombinasjonen med MXFP8, som ifølge Ai2 ga 21 prosent gjennomstrømning og lavere topp minnebruke, peker mot at lavere numerisk presisjon blir en stadig viktigere del av treningsøkonomien.

Åpne spørsmål

Flere ting gjenstår før tallene kan tas som etablert sannhet:

  • Uavhengig replikering. Alle tall stammer fra Ai2 selv, videreformidlet gjennom sekundærkilder. Ingen av kildene har kjørt egne målinger.
  • Sammenligningsgrunnlaget. Om 2,7x-tallet måles mot Nvidias Megatron-core eller Ai2s egen forrige implementering er uavklart, og hvorvidt sammenligningen skjedde på identisk maskinvare- og arbeidskonfigurasjon er ikke verifiserbart.
  • Reell ruting. Systemreferansene under tilfeldig ruting sier ingenting om ytelse eller kvalitet under ekte treningslaster. Dagens syntetisk rutende benchmark belaster kommunikasjonslagene jevnt; reelle rutingmønstre kan skape ubalanse som endrer bildet.
  • Neste steg for OLMo. Rammeverket skal drive Ai2s neste generasjon OLMo-modeller. De modellene – og hva de faktisk oppnår – vil være den egentlige testen av om arkitekturomluppet også oversettes til kvalitet.

Foreløpig står lanseringen som et mulig, men ubekreftet, løft i åpen MoE-trening: en DDP-basert redesign med store selvrapporterte tall, umiddelbart tilgjengelig for alle som vil sette dem på prøve.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.