Google DeepMind åpner 740M-parameter embeddingmodell under Apache 2.0

Google DeepMind lanserte 6. oktober 2026 EmbeddingGemma 2, en åpen embeddingmodell på 740 millioner parametere som utvider forgjengeren fra tekst-only til et felles embeddingrom for kode, bilder, video og lyd.

Fem ulike materialer – papir, metall, farge, glass og tre – plassert på et koordinatrutenett, som en illustrasjon av en felles embeddingmodell for tekst, kode, bilde, video og lyd.
Illustrasjon
Gi artikkelen

Google DeepMind åpner 740M-parameter embeddingmodell under Apache 2.0

Google DeepMind lanserte 6. oktober 2026 EmbeddingGemma 2, en åpen embeddingmodell på 740 millioner parametere som utvider forgjengeren fra tekst-only til et felles embeddingrom for kode, bilder, video og lyd. Modellens vekter ble gjort tilgjengelige umiddelbart på Hugging Face og Kaggle under Apache 2.0-lisensen, som tillater kommersiell bruk. Samtidig lanserte Google macOS-appen AI Edge Foresight, en demo som viser hvordan modellen kan kjøre fullt lokalt på en laptop.

Hva som er nytt

Den opprinnelige EmbeddingGemma var en tekstmodell. Versjon 2, bygget på Gemma 4-arkitekturen, skal ifølge Google samle alle modalitetene i ett og samme embeddingrom. Det betyr i praksis at tekstsøk ikke lenger nødvendigvis må behandles som en egen, tekstbasert pipeline: En embedding av et lydklipp, et videobilde eller et stykke kode kan i prinsippet søkes mot det samme vektorrommet som tekst.

Kunngjøringen kom i et blogginnlegg av forskningsingeniørene Sahil Dua og Henrique Schechter Vera, som skriver (sitatet er oversatt fra engelsk): «I dag lanserer vi EmbeddingGemma 2, som går utover tekst for å samle kode, bilder, video og lyd i et delt embeddingrom» (Google DeepMind).

Modulær arkitektur og kontekst

Modellen har totalt 740 millioner parametere, men er modulær oppbygd. For tekst-only-arbeidsmengder kreves bare en komponent på 270 millioner parametere, og den fullstendige multimodale støtten legger til en valgfri visjonskoder på 170 millioner og en lydkoder på 300 millioner parametere. Det er slik Google kan oppgi at hele den multimodale modellen likevel passer til kjøring på enheten.

Kontekstvinduet er på 8K tokens, fire ganger så stort som EmbeddingGemma 1. Det rommer ifølge Google opptil 5,5 minutter lyd, 29 bilder, 58 videobilder, eller sammensatte kombinasjoner av disse, behandlet direkte på lokal maskinvare.

Et annet praktisk grep er Matryoshka Representation Learning (MRL). Utgangsvektorene har 768 dimensjoner, men utviklere kan dynamisk trunkere dem til 512, 256 eller 128 dimensjoner. Google hevder at dette gir opptil 6 ganger lagringsbesparelse for lokale vektordatabaser og minnebruk – relevant fordi lagringsplass og minne er de hardeste begrensningene for søk- og hentingssystemer på mobil.

Tallene – Googles egne oppgaver

Alle ytelsestall nedenfor stammer fra Google selv og er ikke uavhengig verifisert per kildenes publiseringsdato:

  • RAM-krav med kvantisering: På en Google Pixel 11 Pro oppgir Google at modellen krever så lite som rundt 191 MB aktiv RAM for tekst-only-vekter og rundt 567 MB for den fullstendige multimodale modellen.
  • Kodekvalitet: Google hevder en forbedring på 9,92 poeng på MTEB Code-benchmarken, fra 68,76 til 78,68, samtidig som den flerspråklige tekstytelsen ifølge selskapet matcher forgjengeren.
  • Klasseledelse: Google fremstiller modellen som best i klasse blant multimodale embeddingmodeller under én milliard parametere, målt i kvalitet per parameter.

Disse anspråkene bør leses som selskapets egne målinger, ikke som etablerte resultater. Benchmarken MTEB er et velkjent rammeverk, men tallene er ikke bekreftet av tredjeparter i det tilgjengelige kildematerialet.

Demo-appen AI Edge Foresight

For å vise frem modellen lanserte Google samtidig AI Edge Foresight, en gratis macOS-app for Apple Silicon. Ifølge Android Authoritys rapportasje – inkludert en håndpå-prøving av journalist Akshay Gangwar – omdanner appen korte stikkordsnotater til ferdig formaterte notater under møter, og kan besvare spørsmål om møteinnholdet mens det pågår. Alt skal skje fullt lokalt på maskinen, uten at data sendes til skyen (Android Authority).

Det er verdt å merke seg at detaljene om appen stammer fra Android Authoritys dekning, ikke fra primær Googledokumentasjon i det tilgjengelige kildematerialet. Google beskriver selv ifølge Android Authority modellen som designet for «personvern-først»-applikasjoner og som en «ultra-low-latency on-device decision engine» – altså en beslutningsmotor på enheten med svært lav ventetid.

Hvorfor det kan bety noe

Kjernen i lanseringen er ikke benchmark-tallene, men distribusjonsmodellen: Apache 2.0-lisensen tillater kommersiell bruk, og vektene ligger offentlig tilgjengelige. For utviklere av RAG-løsninger (retrieval-augmented generation) og vektorbasert søk betyr det at hele hentingsinfrastrukturen – både embedding og vektorlager – i prinsippet kan kjøres offline på en telefon eller laptop. Det er kombinasjonen av tre ting som muliggjør det: den modulære arkitekturen som holder RAM-kravet nede, MRL-trunkeringen som krymper vektordatabasen, og den åpne lisensen som fjerner lisensieringshindringer for kommersielle produkter.

Interessen er ikke teoretisk. Ifølge Cryptobriefing passerte forgjengeren EmbeddingGemma 20 millioner nedlastinger, noe som antyder et eksisterende utviklermiljø rundt denne modellfamilien (Cryptobriefing).

Åpne spørsmål

De viktigste usikkerhetene er verdt å holde klart for seg:

  • Uverifisert ytelse. MTEB Code-tallene, påstanden om best i klasse og RAM-målingene er Googles egne. Før uavhengig benchmarking foreligger, er de løfter om kvalitet snarere enn dokumenterte resultater.
  • Kvalitet i praksis. Et felles multimodalt embeddingrom er attraktivt i teorien, men det gjenstår å se hvor godt blandede søk – for eksempel tekstspørringer mot lyd eller video – fungerer i virkelige applikasjoner. Kildematerialet inneholder ingen slike tester.
  • Demo versus plattform. AI Edge Foresight er en showcase-app bygget på sekundær rapportasje. Hvor mye av den opplevelsen som lar seg gjenbruke i egne produkter, vet vi ikke ennå.
  • Små framstillingsforskjeller. Cryptobriefing beskriver 270M-komponenten som dedikert til «tekst og kode», mens Google selv ramer den som tekst-only-konfigurasjonen. Det er en liten forskjell som ikke motsier den modulære arkitekturen, men som illustrerer at detaljene fortsatt bør sjekkes mot Googles egen dokumentasjon ved implementering.

Med 20 millioner nedlastinger av forgjengeren, en kommersielt tillatt lisens og konkrete tall for mobilkjøring har Google lagt forholdene godt til rette for rask adopsjon. Om modellen holder mål i praksis, må uavhengige målinger vise.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.