Microsoft lanserer lokal kodeagent: MAI-Code-1.1-Flash skal ha scoret 70,8 % på SWE-bench i egen testing

Selskapet lanserte 7. oktober en kvantisert MAI-Code-1.1-Flash som skal kjøre lokalt, sammen med ny Surface-maskinvare, HydraFusion-ruting i GitHub Copilot og allmenntilgjengelige Execution Containers.

Illustrasjon: en kompakt, komprimert blokk av lagdelt gjennomsiktig materiale på et skrivebord ved siden av en lukket laptop, som symboliserer en kvantisert kodemodell som kjører lokalt på egen maskinvare.
Illustrasjon
Gi artikkelen

Microsoft lanserer lokal kodeagent: MAI-Code-1.1-Flash skal ha scoret 70,8 % på SWE-bench i egen testing

Selskapet lanserte 7. oktober en kvantisert MAI-Code-1.1-Flash som skal kjøre lokalt, sammen med ny Surface-maskinvare, HydraFusion-ruting i GitHub Copilot og allmenntilgjengelige Execution Containers. Alle ytelsestallene er imidlertid leverandørrapporterte og uavhengig uverifiserte – og sammenligningsgrunnlaget er en åpen modell, ikke grensemodeller.

Det som ble annonsert 7. oktober

  1. oktober 2026 gjennomførte Microsoft et samordnet løft for å flytte arbeidet til AI-kodeagenter bort fra skyen og over på lokal maskinvare. Flere elementer falt sammen samme dag: Surface Laptop Ultra åpnet for forhåndsbestillinger til 2 599 dollar med salgsstart 16. oktober, Execution Containers ble allmenntilgjengelige, og GitHub annonserte at HydraFusion – en rutingmekanisme som fordeler arbeid mellom lokale og skybaserte modeller – kommer i eksperimentell forhåndsvisning senere i oktober. Arrangementet ble holdt sammen med NVIDIA, og ifølge Forkast er dette første gang Microsoft i stor skala forsøker å integrere MAI-programvarestakken, som ble etablert på Build 2026 i juni, direkte i forbruker- og bedriftsmaskinvare (Forkast a07fe2db).

I sentrum står MAI-Code-1.1-Flash, en kvantisert versjon av Microsofts kodegenerator som nå skal kjøre lokalt på Windows-PC-er. Ifølge Blockchain.News, som refererer Satya Nadellas kunngjøring, skal modellen redusere skykostnader mens kvaliteten opprettholdes gjennom overhåndtering til GitHub Copilot (Blockchain.News 642002d0).

Modellens tall – med forbehold

I Microsofts egen testing løste den lokale versjonen av MAI-Code-1.1-Flash 70,8 prosent av oppgavene på SWE-bench Verified, et benchmark bygget fra GitHub-issues, mot 72,6 prosent for varianten med høyere presisjon i skyen. Den kvantiserte modellen opptar rundt 53 GB, og minnebruken topper på 75,5 GB ved full 256K-token-kontekst. På Surface Laptop Ultra genererer modellen omtrent 60 tokens per sekund med korte prompt, mot like under 40 ved 256K-token-prompt – tallene kommer fra Microsofts testing på en syntetisk kodegenereringsarbeidsbelastning (R&D World 85cf9f7a).

Tre forbehold gjelder. For det første er ingen av tallene uavhengig verifisert; Forkast påpeker at MAI-modellenes benchmark-resultater «ikke har blitt uavhengig revidert» (a07fe2db). For det andre sammenlignet Microsoft modellen med en annen åpen modell – en kvantisert versjon av OpenAIs gpt-oss-120b – ikke med grensemodeller i skyen, så det er ikke dokumentert at kløften mellom lokal og skybasert kvalitet smalner i forhold til de fremste systemene (85cf9f7a). For det tredje er parameterantallet uavklart: Blockchain.News angir 137 milliarder parametere med henvisning til Nadellas kunngjøring (642002d0), men tallet er ikke bekreftet av andre kilder i evidensgrunnlaget.

Maskinvaren som skal bære modellen

Surface Laptop Ultra bruker Nvidias RTX Spark-maskinvare og tilbyr opptil 128 GB delt minne. Ifølge en CNET-forhåndsvisning, gjengitt av Forkast, leverer RTX Spark 1 petaflop FP4-ytelse og 128 GB samlet minne – nok til å kjøre modeller i 120B-klassen lokalt gjennom kvantisering (a07fe2db). Forhåndsbestillinger åpnet onsdag 7. oktober til en startpris på 2 599 dollar, med tilgjengelighet 16. oktober (85cf9f7a).

Visionen strekker seg lenger enn én laptop. Microsoft ser for seg alltid-på mini-PC-er som kjører agenter, og delte NVIDIA DGX Stations – skrivebordnære AI-arbeidsstasjoner som betjener 32 eller flere personer samtidig – mens skyen forblir tilgjengelig for arbeid som trenger den (85cf9f7a).

HydraFusion og Hybrid Intelligence

Rutingslaget er GitHubs HydraFusion, designet for å fordele arbeid mellom lokale og skybaserte modeller innenfor én kodeøkt. Eksperimentell forhåndsvisning kommer senere i oktober i GitHub Copilot-appen, GitHub Copilot CLI og Visual Studio Code (85cf9f7a).

Nadellas kunngjøring kobles til et «Hybrid Intelligence»-perspektiv der Copilot utfører rutinehandlinger på enheten mens komplekse arbeidsbelastninger eskaleres til skyen når det trengs – innrammet som en besparelse på både kostnader og personvern (642002d0).

Sikkerhet og styring

Execution Containers ble allmenntilgjengelige onsdag 7. oktober og gir policystyrt innesperring av lokale agentprosesser. Ifølge Forkast, med henvisning til CNET, er dette et hypervisorbasert utførelseslag i Windows 11 24H2 som gir OS-nivå-isolasjon for lokale AI-agenter (a07fe2db). Men bildet er ufullstendig for bedriftsbruk: Entra-attribusjon og Agent 365- og Intune-kontroller for lokale agenter er fortsatt ikke levert, og microVM-isolasjon er eksperimentell (85cf9f7a).

Hvorfor nå: tokenbudsjetter

Den lokale satsingen kommer ikke fra ingenting. I sommer la Microsoft sine divisjoner under AI-tokenbudsjetter og fortalte ifølge R&D World ingeniørene at «tokenmaxxing is not what we are optimizing for» – gjengitt her i originalform: budskapet om at maksimal tokenbruk ikke er det selskapet optimaliserer for (85cf9f7a). Vær oppmerksom på at dette er R&D Worlds karakterisering av Microsofts interne veiledning, ikke en verifisert offisiell strategierklæring. Men motivasjonen er tydelig: agentarbeid i skyen genererer inferenskostnader per kall, og å flytte rutinearbeid til maskinvaren kunden allerede eier endrer hvem som betaler.

Forkast peker også på en annen konsekvens: integrasjonen av MAI-stakken direkte i maskinvare reiser spørsmål om leverandørinnlåsing (a07fe2db).

Åpne spørsmål

Flere ting gjenstår før det er dokumentert at dette fungerer som lovet:

  • Ingen uavhengig verifikasjon. Alle ytelsestall stammer fra Microsofts egen testing, formidlet gjennom sekundærkilder. Ingen tredjepart har revidert SWE-bench-resultatene.
  • Ukvantifisert kostnadsbesparelse. Kildene beskriver besparelser ved å fjerne per-inferens-avgifter, men ingen angir et konkret prisforhold mellom lokal og skybasert kjøring.
  • Uavklart parameterantall. Tallet 137 milliarder er kun kjent via Blockchain.News' gjengivelse av Nadellas kunngjøring.
  • Manglende enterprise-kontroller. Entra, Agent 365 og Intune-støtte for lokale agenter er fortsatt på vei, og microVM-isolasjon er eksperimentell – en viktig begrensning for sikkerhetskritiske organisasjoner.
  • Begrenset sammenligningsgrunnlag. Baseline i benchmarkingen er en kvantisert gpt-oss-120b, ikke grensemodeller, så påstander om at lokal inferens nærmer seg skykvalitet hviler på et smalt grunnlag.

Kunngjøringen 7. oktober er dermed konkret og datert: en modell, en maskinvarekategori, et rutingslag og et sikkerhetslag, med definerende datoer i oktober. Hvorvidt den lokale agentdriften holder mål i praksis – og til hvilken kostnad – avhenger av verifikasjon som ennå ikke foreligger.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.