Liquid AI lanserer d1-3B: beslutningsmodell som svarer kalibrert i én forward pass

Den 7. oktober 2026 ga Liquid AI ut to åpne beslutningsmodeller, d1-3B og d1-omni-600M, som gir kalibrerte svar i én enkelt forward pass — ingen genererte tokens, ingen sampling.

Illustrasjon: én strak metalltråd som går rett gjennom stablede glasslag, ved siden av en haug med sammenfilrede tråder — én enkelt vei i stedet for mange.
Illustrasjon
Gi artikkelen

Liquid AI lanserer d1-3B: beslutningsmodell som svarer kalibrert i én forward pass

Den 7. oktober 2026 ga Liquid AI ut to åpne beslutningsmodeller, d1-3B og d1-omni-600M, som gir kalibrerte svar i én enkelt forward pass — ingen genererte tokens, ingen sampling. Svarene kommer på 8–50 millisekunder på edge-maskinvare, ifølge selskapets egne målinger. Men alle tallene er selvevaluerte, og lydmodellen er i praksis ukarakterisert.

Et omvendt generativt rør

De fleste språkmodeller besvarer spørsmål ved å generere ett token om gangen, med sampling og sannsynligvis litt variasjon fra gang til gang. Liquid AIs d1-familie snur denne pipelinen på hodet: Ifølge selskapet produserer ikke beslutningsmodellene tokens i det hele tatt — de returnerer et svar i én enkelt forward pass over nettverket (Liquid AI).

Svarene kommer i tre faste typer, slik MarkTechPost oppsummerer det med henvisning til selskapet (MarkTechPost):

  • noul: et ja/nei-spørsmål, returnert som P(yes) — en kalibrert sannsynlighet.
  • choice: et merket valg, levert med hele sannsynlighetsfordelingen over alternativene.
  • score: en sannsynlighetsveid plassering på en ordnet rubrikk med 2 til 10 nivåer.

Flere spørsmål kan deles over én encoder-tilstand i ett enkelt kall, noe som gjør det mulig å stille mange beslutningsspørsmål til samme input i én operasjon. Det er verdt å understreke hva dette ikke er: Ingen av de to sjekkpunktene er chatmodeller. De kan ikke svare på åpne spørsmål eller generere tekst — de klassifiserer, rangerer og scorer.

De to sjekkpunktene

d1-3B er hovedmodellen. Den har 3,12 milliarder parametre, en 400M SigLIP2 NaFlex visuell encoder og en kontekst på 32 768 tokens, og er trent fra LFM2.5-VL-3B, en decoder-only visjon-språkmodell som tar imot tekst og bilder som input (Liquid AI; MarkTechPost).

d1-omni-600M er den lille, eksperimentelle modellen. Med 587 millioner parametre, en 17-lags FastConformer lydencoder, 16 384 tokens kontekst og lydklipp på inntil 30 sekunder, er den trent fra LFM2.5-Encoder-350M, en toveiskodet encoder som får tillegg av visjon- og lydencodere. Den håndterer både tekst+bilde og tekst+lyd.

Tallene — med forbehold om hvem som har målt dem

Alle ytelsestallene nedenfor stammer fra Liquid AI selv, som på eget initiativ kjørte den offisielle scoreren for Decision Index fremfor å levere resultatene til en uavhengig ledertavle (MarkTechPost). Det betyr ikke at tallene er feil, men at de foreløpig mangler uavhengig verifisering.

På Decision Index v0.2.1 (offentlig del) scorer d1-3B 48,57 — ifølge selskapet foran alle modeller under 10 milliarder parametre og på nivå med Decider 35B-A3B, en beslutningsmodell tolv ganger større (Liquid AI). Modellen leder kategoriene Tools (74,5) og Arts (36,3), men svikter på Knowledge, der den bare får 23,8 (MarkTechPost).

På syv offentlige tekst-benchmarks har d1-3B et snitt på 82,9, høyest i tabellen og foran Decider 4B (81,1). d1-omni-600M når 78,4, foran Decider 2B (77,1) med en fjerdedel av parametrene, og har de høyeste enkeltscoreringene på Civil Comments (95,8) og PAWS-X (79,5).

Latensytallene for d1-3B, selskapsmålt, viser kanskje best hvorfor dette er en edge-historie: 8 ms på en NVIDIA GeForce RTX 4090, 16 ms på en Jetson AGX Thor, 26 ms på en Jetson AGX Orin og 50 ms på en Jetson Orin Nano — som selskapet beskriver som raskt nok for sanntidsbeslutninger på den minste edge-maskinvaren.

For d1-omni-600M er bildet svakere: Decision Index-scoren på 15,95 plasserer den langt bak storebroren, og selskapet beskriver den som et tidlig eksperimentelt sjekkpunkt. MarkTechPost bemerker at den er «an early research release with no published latency figures» — altså at det overhodet ikke finnes publiserte latensytall for denne modellen (MarkTechPost).

Lisens og tilgang

Begge sjekkpunktene ligger på Hugging Face fra lanseringsdagen, med dag-én-støtte i llama.cpp. De utgis under LFM Open License v1.0, som tillater gratis kommersiell bruk for virksomheter med under 10 millioner dollar i årlig omsetning (MarkTechPost). For mindre selskaper som bygger agent-pipelines eller innholdsmoderasjon, betyr det at teknologien kan tas i bruk uten lisenskostnad.

Hva skal modellene brukes til?

Liquid AI anbefaler d1 til ruting, moderasjon, intensjonsklassifisering, reranking, LLM-as-a-judge-scoring, sikkerhetsvakter for agenter (guardrails) og visuell inspeksjon (MarkTechPost). Det er et mønster som går igjen: Dette er alle oppgaver der et generativt språkmodell i dag brukes som klassifikator — ofte ved å generere en tekstlig besvarelse som så tolkes. En beslutningsmodell erstatter den omveien med en direkte, typet utgang med sannsynligheter, noe som passer når svaret skal inn i videre programlogikk og latensen må være lav.

Åpne spørsmål

Flere forbehold følger med på historien. For det første: Alle benchmark- og latensytall er selskapets egne målinger, og d1-scorene er ikke levert til noen ledertavle. Uavhengig etterkontroll gjenstår. For det andre er d1-omni-600M i praksis ukarakterisert — svak index-score, ingen latensytall, og Liquid AI erkjenner selv at dedikerte lyd-benchmarks for beslutninger «currently [er] an open problem», og at de ser frem til at fellesskapet utvikler slike etter hvert som kategorien modnes (Liquid AI). Lydencodernen er ifølge MarkTechPost trent utelukkende på engelskspråklige forespørsler fra bruker til assistent, noe som begrenser hva man kan konkludere om bredere lydforståelse. For det tredje rapporteres ikke den private visjondelen av Decision Index v0.3 i denne utgivelsen, så kvaliteten på bildebeslutninger er så langt bare belyst gjennom ryggradens vanlige visjonsbenchmarks. Og til slutt: d1-3Bs svakhet på Knowledge (23,8) minner om at dette er spesialiserte verktøy, ikke generelle modeller — på spørsmål som krever faktakunnskap snarere enn klassifisering, er de trolig feil verktøy.

Hva det betyr i praksis, avhenger av om tallene holder under uavhengig testing. Hvis de gjør det, peker d1 på et interessant skille i AI-infrastrukturen: generative modeller for det som skal formuleres, beslutningsmodeller for det som skal avgjøres.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.