← Tilbake
AI-nyheter

Ny åpen modell fra Stanford og Nvidia velger agenthandlinger ved matching, ikke token-generering

Bare dager etter at TypeSafe lanserte Jev og etablerte kategorien «System One»-modeller, kommer den første direkte utfordreren: Forskere fra Stanford og Nvidia har sluppet Contrastive Language Models (CLM), en åpen 8-milliarders modell som…

AIMag.no
AIMag.no
25. september 2026 · 9 min
Illustrasjon: EtFor en rad identiske svarte kuber løftes én gul kub opp, formet til å passe nøyaktig i en tilsvarende forsenking — et bilde på å velge riktig handling ved matching i stedet for generering.

Ny åpen modell fra Stanford og Nvidia velger agenthandlinger ved matching, ikke token-generering

Bare dager etter at TypeSafe lanserte Jev og etablerte kategorien «System One»-modeller, kommer den første direkte utfordreren: Forskere fra Stanford og Nvidia har sluppet Contrastive Language Models (CLM), en åpen 8-milliarders modell som velger agenthandlinger ved å matche representasjoner i stedet for å generere tokens. I teamets egne zero-shot-tester var CLM-8B opptil ni ganger raskere enn Jev — men med litt lavere nøyaktighet på verktøykall og WikiRacing.

Nyheten

Ifølge VentureBeat, som rapporterte lanseringen 25. september 2026 (skrevet av Ben Dickson) d57e1f62-04d2-4fe6-92fc-b62ac3122b23, bygger Stanford- og Nvidia-forskerne en modell beregnet på en bestemt type beslutninger: de avgrensede valgene en AI-agent stadig må ta. I stedet for å generere en sekvens av tokens — slik språkmodeller vanligvis svarer — lager CLM-8B representasjoner av både nåværende tilstand og de tilgjengelige handlingene, og velger deretter handlingen som matcher tilstanden best.

Modellen heter CLM-8B og er, per VentureBeats omtale, åpent tilgjengelig. Timing er ikke tilfeldig: TypeSafe introduserte begrepet «System One»-modeller med Jev tidligere i september 2026, og CLM-8B ankom altså ifølge VentureBeat midt i en voksende interesse for nettopp denne kategorien av beslutningsmodeller. Det gjør CLM-8B til den første direkte tredjepartsutfordreren i et helt nytt modelllag.

Slik fungerer det

Den utgitte CLM-8B bruker en frossen Qwen3-8B-ryggrad — altså en eksisterende språkmodell som ikke trenes videre — med separate proeksjonshoder for tilstander og handlinger. Denne separasjonen er ikke bare en teknisk detalj; den muliggjør en viktig distribusjonsoptimalisering: Hvis en applikasjon gjentatte ganger velger mellom de samme handlingene, kan CLM kode dem én gang og cache embeddingene. Nye beslutninger krever da bare at tilstanden kodes, før den matches mot det allerede lagrede handlingsbiblioteket.

Treningsregimet forgår i tre faser, ifølge detaljer CLM-teamet har gitt VentureBeat:

  • Omtrent 60 millioner spørsmål-svar-par for å lære modellen bred semantisk matching.
  • Rundt 30 millioner syntetiske «harde negativer» — for eksempel flervalgsspørsmål der svarene er semantisk like, men bare ett er riktig — for å tvinge modellen til å skille subtilt forskjellige alternativer.
  • Posttrening på grovt én million agenttrajektorier, for å tilpasse modellen til agentbeslutninger.

Hele opplæringen bygger på et InfoNCE-kontrastivt mål, som trener modellen på å trekke sammen matchende tilstand-handling-par og skyve fra hverandre ikke-matchende.

Tallene — med et viktig forbehold

I CLM-teamets egne zero-shot-tester, spredt over computer use (datamaskinbruk), gaming og verktøykall, var CLM-8B opptil 9 ganger raskere enn TypeSafes Jev. På to spilltasks matchet den Jevs suksessrate. På de to andre oppgavene ga den noe fra seg: 95,2 prosent mot Jevs 99,2 prosent på verktøykall-benchmarken BFCL v4, og 26 av 30 fullførte WikiRacing-oppgaver mot Jevs 30.

Alle disse tallene kommer fra CLM-teamets egne tester, formidlet via VentureBeat. De er ikke uavhengig verifisert, og testbetingelsene — maskinvare, hvordan Jev ble kjørt, oppsettet rundt caching-scenariene — er ikke dokumentert i VentureBeats omtale. VentureBeat peker selv på at de største fartsvinningene oppstod når modellen kunne gjenbruke handlinger på tvers av mange tilstander, eller velge fra store kandidatsett. Det betyr at 9x-tallet bør leses som en toppverdi under særskilt gunstige forhold, ikke som en gjennomsnittlig forbedring på tvers av alle arbeidsmengder.

Hva den er ment til

CLM-8B støtter ifølge teamet flere avgrensede beslutningsmønstre: å velge mellom alternativer, returnere en ja/nei-sannsynlighet, score mot en ordnet skala, og rangere vilkårlige kandidater. VentureBeat nevner konkrete bruksområder som verktøyruting (hvilket verktøy en agent skal kalle), triage av saker, utvelgelse i søkesystemer, og valg mellom flere foreslåtte output.

Mønsteret er gjennomgående: ingen av disse oppgavene krever fri tekstanalyse eller generering. De krever et valg blant kjente alternativer — og det er nettopp der state-action-matching og caching av handlings-embeddings kan betale seg. Store kandidatsett og gjentatte valg blant samme handlinger er driftsmessig gunstig, nettopp fordi handlingskodene kan beregnes én gang.

Kontekst og åpne spørsmål

CLM-8B lander i et nytt og fortsatt udefinert markedssegment. «System One»-betegnelsen er TypeSafes eget konsept, introdusert med Jev tidligere i september 2026, og CLM-teamet posisjonerer seg altså mot samme brukstilfelle bare dager etter. Med bare to aktører og seltrapporterte benchmarks mangler kategorien både uavhengige målemetoder og en felles definisjon av hva en beslutningsmodell skal dokumentere.

Flere spørsmål står åpne. Benchmark-suitten er ikke fullstendig spesifisert i VentureBeats omtale, noe som gjør sammenligningen vanskelig å reprodusere uavhengig. Det er videre ikke bekreftet hvilke lisensvilkår som faktisk gjelder for den «åpne» utgivelsen. Og nøyaktighetsgapet på BFCL v4 og WikiRacing reiser et praktisk spørsmål brukere selv må avveie: hvor mye er farten verdt når 4 prosentpoeng på verktøykall eller fire av tretti nettleseroppgaver står på spill.

Det som er tydelig er arkitekturens poeng: En del av agentens arbeid er ikke generering i det hele tatt, men matching — og den delen kan kanskje gjøres billigere. Om CLM-8B holder målene i praksis, avhenger av tester noen andre enn teamet bak må utføre.


New open model from Stanford and Nvidia picks agent actions by matching, not token generation

Just days after TypeSafe launched Jev and established the "System One" model category, the first direct challenger has arrived: Researchers from Stanford and Nvidia have released Contrastive Language Models (CLM), an open 8-billion-parameter model that selects agent actions by matching representations instead of generating tokens. In the team's own zero-shot tests, CLM-8B was up to nine times faster than Jev — though with somewhat lower accuracy on tool calling and WikiRacing.

The news

According to VentureBeat, which reported the launch on September 25, 2026 (written by Ben Dickson) d57e1f62-04d2-4fe6-92fc-b62ac3122b23, the Stanford and Nvidia researchers have built a model aimed at a specific type of decision: the bounded choices an AI agent must make again and again. Instead of generating a sequence of tokens — the way language models usually respond — CLM-8B creates representations of both the current state and the available actions, then selects the action that best matches the state.

The model is called CLM-8B and is, per VentureBeat's coverage, openly available. The timing is no accident: TypeSafe introduced the concept of "System One" models with Jev earlier in September 2026, and CLM-8B thus arrived, according to VentureBeat, amid growing interest in exactly this category of decision models. That makes CLM-8B the first direct third-party challenger in an entirely new model layer.

How it works

The released CLM-8B uses a frozen Qwen3-8B backbone — an existing language model that is not trained further — with separate projection heads for states and actions. This separation is not just a technical detail; it enables an important deployment optimization: if an application repeatedly chooses among the same actions, CLM can encode them once and cache the embeddings. New decisions then only require encoding the state, which is matched against the already-stored action library.

The training regimen took place in three phases, according to details the CLM team gave VentureBeat:

  • Roughly 60 million question-answer pairs to teach the model broad semantic matching.
  • Around 30 million synthetic "hard negatives" — for example, multiple-choice questions where the answers are semantically similar but only one is correct — to force the model to distinguish subtly different options.
  • Post-training on roughly one million agent trajectories, to adapt the model to agent decisions.

The entire training builds on an InfoNCE contrastive objective, which trains the model to pull matching state-action pairs together and push non-matching ones apart.

The numbers — with an important caveat

In the CLM team's own zero-shot tests, spanning computer use, gaming and tool calling, CLM-8B was up to 9 times faster than TypeSafe's Jev. On two gaming tasks it matched Jev's success rate. On the other two tasks it gave up some ground: 95.2 percent versus Jev's 99.2 percent on the tool-calling benchmark BFCL v4, and 26 of 30 completed WikiRacing tasks versus Jev's 30.

All of these figures come from the CLM team's own tests, relayed via VentureBeat. They have not been independently verified, and the test conditions — hardware, how Jev was run, the setup around the caching scenarios — are not documented in VentureBeat's coverage. VentureBeat itself notes that the largest speed gains occurred when the model could reuse actions across many states, or select from large candidate sets. That means the 9x figure should be read as a peak value under particularly favorable conditions, not as an average improvement across all workloads.

What it is meant for

CLM-8B supports, according to the team, several bounded decision patterns: choosing between alternatives, returning a yes/no probability, scoring against an ordered scale, and ranking arbitrary candidates. VentureBeat mentions concrete use cases such as tool routing (which tool an agent should call), case triage, shortlisting in search systems, and choosing among several proposed outputs.

The pattern is consistent: none of these tasks requires free-form text analysis or generation. They require a choice among known options — and that is precisely where state-action matching and caching of action embeddings can pay off. Large candidate sets and repeated choices among the same actions are operationally favorable, precisely because action encodings can be computed once.

Context and open questions

CLM-8B lands in a new and still undefined market segment. The "System One" label is TypeSafe's own concept, introduced with Jev earlier in September 2026, and the CLM team is thus positioning itself against the same use case just days later. With only two players and self-reported benchmarks, the category lacks both independent evaluation methods and a shared definition of what a decision model should document.

Several questions remain open. The benchmark suite is not fully specified in VentureBeat's coverage, making the comparison hard to reproduce independently. It is also not confirmed which license terms actually apply to the "open" release. And the accuracy gap on BFCL v4 and WikiRacing raises a practical question users must weigh for themselves: how much is the speed worth when 4 percentage points on tool calling, or four of thirty browsing tasks, are on the line.

What is clear is the architecture's point: part of an agent's work is not generation at all, but matching — and that part can perhaps be done more cheaply. Whether CLM-8B holds up to its targets in practice depends on tests performed by someone other than the team behind it.

Kilder

  1. Stanford and Nvidia's open CLM-8B caches reusable agent actions and runs up to 9x faster than Jev in tests | VentureBeat — venturebeat.com