Mistral lover åpent vektslipp av ML4 27. oktober – benchmarks foreløpig uverifiserte

Mistral AI løftet tirsdag frem ML4, med kallenavnet «Le Chonk», i offentlig forhåndsvisning – og lovet å slippe modellvektene 27. oktober. Lanseringen kom én dag etter at det amerikanske selskapet Reflection AI annonserte sin åpne…

En stor tung metallkule står på betonggulv i en tom industrihall, ved siden av en åpen låst burdør – en illustrasjon av en tung AI-modell hvis vekter snart slippes åpent.
Illustrasjon
Gi artikkelen

Mistral lover åpent vektslipp av ML4 27. oktober – benchmarks foreløpig uverifiserte

Mistral AI løftet tirsdag frem ML4, med kallenavnet «Le Chonk», i offentlig forhåndsvisning – og lovet å slippe modellvektene 27. oktober. Lanseringen kom én dag etter at det amerikanske selskapet Reflection AI annonserte sin åpne Beam-modell, og bare uker etter at Mistral samlet inn 3 milliarder euro til en verdning på over 21 milliarder. Men selv om selskapet hevder at ML4 blir den mest kapable åpne-vekt-modellen utenfor Kina, er alle ytelsespåstandene så langt Mistrals egne – de endelige benchmarkskårene mangler fortsatt.

Hva som skjedde

Den franske AI-sjampen Mistral AI lanserte tirsdag en offentlig forhåndsvisning av en ny frontmodell som selskapet selv sier vil være den mest kapable åpne-vekt-modellen utviklet utenfor Kina når vektene slippes (Euronews via MSN, kildespor bacf04ea).

Modellen har kallenavnet «Le Chonk» – «den store, klumpete». Sjefsforsker og medgründer Guillaume Lample kalte den «en ny generasjon modeller» under en pressekonferanse som Euronews deltok på (bacf04ea).

ML4 er tilgjengelig nå gjennom Mistrals API på Mistral Studio. Vektene planlegges sluppet 27. oktober (bacf04ea, samt ZDNET, kildespor 2f5a0f26).

Timingen er ikke tilfeldig. Dagen før, 5. oktober ifølge TechCrunchs datering, debuterte Reflection AI med Beam, en åpen vekt-modell rettet eksplisitt mot kinesiske modeller – og mot vestlige aktører, inkludert Mistral (TechCrunch, kildespor e2c1d236). Det åpne vekt-racet har dermed fått to nye vestlige utfordringer på to dager.

Hva Mistral hevder – og hva som faktisk er bekreftet

Nesten alle ytelsesutsagn om ML4 stammer fra Mistral selv og må leses som markedsføring inntil uavhengig verifisering foreligger. Dette er selskapets påstander, slik de er rapportert:

  • Trening fra bunnen av: Ifølge Mistral ble ML4 trent fra null over to måneder på 4 000 NVIDIA Grace Blackwell-GPU-er i selskapets egne europeiske datasentre (bacf04ea).
  • Språk: Modellen skal dekke over 160 språk, inkludert alle offisielle EU-språk, og fungere på både latinske og ikke-latinske skript (bacf04ea). Dette er en direkte henvendelse til europeiske offentlige virksomheter, som ofte opererer på språk de store amerikanske modellene historisk har dekket ulikt.
  • Ytelse: Mistral sier at ML4 leder blant åpne-vekt-modeller på produksjons- og finansoppgaver samt multimodal bruk, at modellen i koding lukker gapet til andre frontmodeller, og at den har de beste resultatene av noen modell – også lukkede – på grounding-egenskaper, samt toppresultater på halvleder-benchmarks (bacf04ea). Ingen av disse påstandene er uavhengig verifisert.
  • Cybersikkerhet: En Mistral-talsperson skrev i en e-post til ZDNET at ML4 «i absolutte termer på cyberferdigheter» overgår de beste modellene fra Kimi, DeepSeek og Meta (2f5a0f26).
  • Posisjonering mot Kina: Pierre Stock, visepresident for vitenskap ved Mistral, sa at alle AI-selskaper beveger seg «på full fart», at det tre år gamle selskapet «definitivt er i ferd med å lukke gapet» til konkurrentene, og at den nye modellen i noen henseender er «sterkere enn Kinas modeller fra sommeren» (bacf04ea).

Det viktigste forbeholdet: Mistral har selv sagt at den venter på de endelige benchmarkskårene (2f5a0f26). ZDNET henviser til en tidlig tredjepartsanalyse som angivelig viser ML4 på nivå med dyrere proprietære modeller, men analysen er unnavngitt og kan ikke vektlegges som uavhengig bekreftelse. Fram til 27. oktober, og til tredjepartsbenchmarks foreligger, står «best utenfor Kina» som et løfte – ikke et faktum.

Cybersikkerhetsvinkelen: eierskap som argument

Den mest konkretiserte posisjoneringen av ML4 gjelder cybersikkerhet. I en skriftlig uttalelse til ZDNET skrev Mistral:

«ML4 er begynnelsen på en ledende generasjon av åpne, tilpassbare cybersikkerhetsmodeller som bedrifter fullt ut kan eie og kontrollere, uten leverandørinnlåsing», og videre: «Bedrifter og stater bør ikke være nødt til å stole på en lukket modellleverandør som vilkårlig kan slå av deres cyberforsvarskapasiteter» (2f5a0f26).

Lample knyttet dette til trusselbildet: «Cyberforsvarskapasitetene vil gjøre det mulig for bedrifter og myndigheter å forsvare seg mot trusselaktører som jailbreaker lukkede modeller for å utføre cyberangrep», sa han til ZDNET (2f5a0f26).

Praktisk betyr dette noe annet enn vanlig API-tilgang. De første testpartnerne får tilgang til en versjon av ML4 med færre sikkerhetssperrer og «utvidede cyberferdigheter» – en tilnærming ZDNET sammenligner med Anthropics Project Glasswing og OpenAIs utrulling av Astra (2f5a0f26; sammenligningen er ZDNETs, ikke Mistrals eget utsagn). For en bedrift eller et departement som trenger cyberforsvar med data og vekter under egen kontroll, er dette en vesensforskjell fra å konsumere et lukket API.

Argumentet har også en revers. Åpne modeller er, slik CBS News har dekket debatten, mer utsatt for jailbreaking og vanskeligere å føre tilsyn med enn lukkede modeller (kildespor e9bfaef7). Men motargumentet ble formulert i et fellesbrev fra juli i år, signert av over 70 selskaper, blant dem Google, Microsoft og NVIDIA: åpne modeller «utvider forsvarskapasiteten, øker transparensen og gjør det mulig å oppdage og utbedre sårbarheter» (e9bfaef7). ML4s cybersikkerhetsposisjonering plasserer Mistral direkte i den andre leiren av dette spørsmålet – åpne vekter som forsvar, ikke bare angrepsflate.

Konteksten: kapital, Beam og racet om åpne vekter

ML4-utgivelsen kommer tett på to andre hendelser som rammer inn den.

For det første finansieringen. I september kunngjorde Mistral at selskapet hadde samlet inn 3 milliarder euro til en verdning på over 21 milliarder euro – ifølge selskapet selv den største egenkapitalrunden noen gang fullført av et europeisk teknologiselskap (bacf04ea). Det gir kapitalgrunnlaget for både trening i egne datasentre og den videre satsingen.

For det andre konkurrentene. Reflections Beam er en mixture-of-experts-modell på 501 milliarder parametre med 23 milliarder aktive parametre, forhåndstrent på 23,8 billioner tokens, med et kontekstvindu på én million tokens (e2c1d236). Reflection sier at Beam skårer på nivå med Z.ais GLM-5.2 på avanserte resonneringsbenchmarks og overgår dagens ledende vestlige åpne modeller, samtidig som den bruker «3–4 ganger mindre inferensregnekraft» – påstander TechCrunch eksplisitt flagger som uavhengig uverifiserte (e2c1d236). Selskapet, grunnlagt i 2024 av to tidligere Google DeepMind-forskere, har ifølge PitchBook samlet inn rundt 4,7 milliarder dollar fra investorer som Nvidia, Sequoia Capital og Lightspeed Venture Partners (e2c1d236).

Sammenligningen avslører et strategisk skille: Reflection konkurrerer primært på regneeffektivitet og stiller seg opp mot både kinesiske og vestlige åpne modeller, mens Mistral kombinerer ytelsespåstander med en eksplisitt europeisk suverenitetsfortelling – egne datasentre, over 160 språk, og et cybersikkerhetsargument rettet mot stater og kritisk infrastruktur. Beam og ML4 angriper dermed samme problemfelt, men fra hver sin vinkel.

Hva 27. oktober må vise

Vektslippet 27. oktober er der løftene skal innfris, og det er minst fire spørsmål som avgjør om de gjør det:

Benchmarkskårene. Mistral har selv sagt at endelige benchmarks mangler (2f5a0f26). Før tredjepartsverifisering av påstandene om grounding, halvledere, produksjon, finans og cyberferdigheter, forblir de nettopp påstander.

Modellens faktiske størrelse. Kildene gir ikke et entydig svar på parameterantallet for ML4, og det kan ikke avklares ut fra det tilgjengelige bevismaterialet. For en åpen vekt-utgivelse er dette ikke en detalj: størrelsen bestemmer hvem som faktisk kan kjøre modellen lokalt, og dermed hvem «fullt eierskap» reelt sett er for.

Jailbreak-risikoen i praksis. En mindre guardrailet versjon til testpartnere følger et kjent mønster fra Anthropic og OpenAI, men for en modell som markedsføres på cyberferdigheter til bedrifter og stater, er spørsmålet om sikkerhetsarkitekturen tåler at vektene blir offentlig tilgjengelige – nettopp det som skjer 27. oktober.

Betyr «europeisk suverenitet» noe operativt? Trening i europeiske datasentre og dekning av alle EU-språk er håndgripelige fakta, i den grad de bekreftes. Men suverenitetshistorien hviler også på at vektene faktisk slippes, at lisensen tillater reell tilpasning, og at modellen er god nok til at europeiske virksomheter velger den fremfor lukkede amerikanske alternativer.

Hva Stock erklærte under pressekonferansen – at selskapet «definitivt er i ferd med å lukke gapet» (bacf04ea) – er presist formulert. Gapet lukkes fortsatt. Beviset kommer 27. oktober.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.