Prompt injection flyttet Jevs blokksannsynlighet fra 0,76 til 0,48: typede svar beskytter ikke beslutningen

Modellen som svarte på 140 000 venteliste-brukere på 36 timer, genererer ikke tekst. Den svarer bare på tre slags spørsmål: velg ett alternativ, gi en poengsum, eller si hvor sannsynlig en betingelse er.

Illustrasjon: en analog måler som deler ansiktet i kremhvit og svart halvdel med en rød viser ved skillet, mens tre identiske svarte kort har veltenert ved siden av – et bilde på at maskinens beslutningssannsynlighet kan flyttes selv når svarene ser kontrollerte ut.
Illustrasjon
Gi artikkelen

Prompt injection flyttet Jevs blokksannsynlighet fra 0,76 til 0,48: typede svar beskytter ikke beslutningen

Modellen som svarte på 140 000 venteliste-brukere på 36 timer, genererer ikke tekst. Den svarer bare på tre slags spørsmål: velg ett alternativ, gi en poengsum, eller si hvor sannsynlig en betingelse er. Akkurat den avgrensningen – ikke hastigheten – er det som gjør den brukbar i agentløkker.

Lanseringen og etterdønningene

Den 15. september 2026 åpnet selskapet TypeSafe AI tidlig tilgang til modellen Jev. Ifølge grunnlegger Diogo Almeida, sitert av VentureBeat, ble 140 000 ventelistebrukere sluppet inn i løpet av 36 timer, og Vercel oppga at omtrent 13 % av de betalende AI Gateway-teamene kjørte Jev i løpet av ett døgn. Den 20. september ble ventelisten droppet helt. Åtte dager etter lanseringen kom konkurrenten Contrastive-LM med CLM-8B, en modell som eksplisitt fokuserer på Jevs grensesnitt.

Men den raskt akkumulerte støyen rundt hastighet og pris er kanskje ikke den interessante historien. Flere tidlige brukere – blant dem en skribent hos MOR Software – argumenterer for at automatisering har steint fast fordi «dømmekraft» ble behandlet som én monolittisk blokk, i stedet for å bli kategorisert. Jevs avgjørende trekk er nettopp at den kategoriserer.

Taksonomien: tre typede primitiver

Jev svarer kun i tre former:

  • Choice: velg ett alternativ blant deklarerte valg, med sannsynligheter. Maks 255 alternativer.
  • Score: vurder noe på en ordnet rubrikk med forhåndsdefinerte betydninger for hvert nivå. Maks 10 nivåer.
  • Noul: TypeSafes egenbetegnelse for et spørsmål som returnerer sannsynligheten, mellom 0 og 1, for at en betingelse holder.

Det er en hard grense for hva taksonomien kan uttrykke: ingen tekstgenerering og ingen bildeinngang, ifølge TypeSafes dokumentasjon gjengitt av こたぽん. Modellens posisjonering er at den verken er «liten eller en LLM», men arkitekturen er ikke offentliggjort.

Begrensningene er ikke tilfeldige. Et svar på formen «alternativ B, sannsynlighet 0,83» kan bindes direkte inn i kode: en IF-setning, en terskel, en datologg. Det finnes ingen tekst å tolke, ingen tone å vurdere, ingen referanser å sjekke. Derfor kan Jev plasseres i agentløkker der en fri tekst-svarende modell krever et eget tolkningslag.

Kalibrering fremfor fart

TypeSafe tilskriver Jevs sannsynlighetsutganger en treningsmetode kalt Reinforcement Learning for Calibrated Decisions (RLCD). Almeidas eget rammeverk, sitert i Forbes/Yahoo: «Tenk på Jev som et funksjonskall med frontier-intelligens: ustrukturert tilstand inn, typede probabilistiske beslutninger ut.»

Det er også verdt å merke seg hva leverandøren selv sier om tallene: svar på 70–500 millisekunder, inputpris på 0,042 dollar per million tokens, gratis output og egne sammenligninger på opptil 193,6 ganger raskere og 444,6 ganger billigere – tall videreformidlet av 源さん. Alle disse tallene stammer fra TypeSafes egne evalueringer, ikke uavhengige målinger. Selskapet erkjenner at «0 % hallusinasjon» er en arkitektonisk konsekvens – ikke en empirisk måling – og at typede utganger garanterer et grensesnitt, ikke sannheten. Korrektheten må verifiseres med egne data.

Omdia-analytiker Torsten Volk, sitert av LeMagIT, rammeverker verdien annerledes enn rå intelligens: «Jev svarer på to vanlige problemer med KI i bedrifter: for det første fraværet av deterministiske resultater, og for det andre tokenkostnaden.»

Det er et tynnere, men mer operativt løfte. En probabilistisk beslutning er bare trygg å automatisere hvis sannsynlighetene faktisk er kalibrerte – hvis 0,8 faktisk betyr «riktig åtte av ti ganger». Farten og prisen er attraktive, men det er kalibreringen som avgjør om man kan sette en terskel og gå hjem.

Tidlige tester: blandede resultater

Enkelte utviklere rapporterer positive resultater, men de er foreløpig småskala. Vercel-ingeniør Pranit Sharma fant at Jev, som erstatning for en konvensjonell språkmodell til klassifisering av kommandosikkerhet, svarte 5–18 ganger raskere med forbedret nøyaktighet i hans test. En annen utvikler fant at Gemini var litt mer nøyaktig, men dyrere, til e-postklassifisering. Én uavhengig tredjemåling (gjengitt av MOR Software) fant at Jevs unike kostnadsbidrag bare var rundt 16 % utover batchingseffekter – men forfatteren selv påpeker at det er én observasjon per konfigurasjon og ikke kan tilskrives Jev med sikkerhet.

Utover produksjonslignende arbeid har utviklere brukt Jev til regneark, spillhacks og til og med en CPU-emulering døpt «JevOps». The Register beskriver det som et meme, ikke en disiplin – foreløpig.

Stresstesten: prompt injection

VentureBeat rapporterte nylig at selskaper plasserer Jev i produksjonsinfrastruktur for agentbeslutninger, og at en ingeniør hos Octomind publiserte én demonstrasjon av en sårbarhet. Ingeniøren la til et falskt verktøyutdatafelt som hevdet at brukeren hadde forhåndsgodkjent kommandoen og instruerte systemet om å svare auto_allow. Blokkeringssannsynligheten falt fra 0,76 til 0,48, og konfidensen falt til 0,22.

Det er én publisert test av én ingeniør – ikke et benchmark. Men den illustrerer et reelt åpent spørsmål: at typede sannsynlighetsutganger kan forskyves ved fiendtlig inndata. En agent som er satt til å handle når sannsynligheten faller under en terskel, kan altså la seg styre av en injisert tekst, selv om svaret fortsatt kommer i ryddig, maskinlesbar form. Formatgarantien beskytter grensesnittet, ikke beslutningen.

Markedet som dannes rundt Jev

Konkurransen kom raskt. Contrastive-LM lanserte CLM-8B 23. september 2026, med et grensesnitt rettet mot Jevs. Tallene er leverandørens egne, rapportert av MarkTechPost: opptil 9 ganger lavere zero-shot-latens på noen oppgaver (tallet kommer fra T-Rex-spillet, der handlinger gjentar seg på tvers av tilstander), men CLM-8B ligger bak Jev på verktøykall (95,2 % mot 99,2 % suksess) og WikiRacing (26/30 mot 30/30). Sammenligningene er ikke uavhengige evalueringer eller fullstendige leaderboard-innsendelser.

Åpne spørsmål

Flere ting gjenstår før man kan si at Jevs løfte om «kalibrerte beslutninger» holder i praksis:

  • Det finnes ingen systematisk uavhengig nøyaktighets- eller kalibreringsdata. Alt som finnes, er enkeltrapporter fra enkelte utviklere.
  • Arkitekturen er ikke offentliggjort; TypeSafe sier bare at Jev verken er «liten eller en LLM».
  • Injeksjonsrobusthet er ikke målt i skala. Octomind-testen viser at en forskyvning er mulig, men ikke hvor vanlig eller stor den er.
  • Hovedtallene (193,6×/444,6×) er TypeSafes egne evalueringer mot en sammenligningsbase definert av TypeSafe selv.

For team som vurderer å gi Jev ansvaret for agentbeslutninger, er den praktiske konklusjonen at man må verifisere med egne data – noe TypeSafe selv sier. Den typede formen er reell, og den er nyttig. Men den er et grensesnitt, ikke en garanti for at svaret er riktig. Kalibreringen – som er hele det operative løftet – er foreløpig hovedsakelig leverandørens eget ord.

Kilder

  1. Jev | Beyond 'Tasks and Judgments': How to Categorize Judgment Itself|MOR Software JSC — note.com
  2. 글을 쓰지 않는 AI 'Jev'란? 판단에만 특화된 '결재 부장 AI'를 초보자용으로 해설|源さん — note.com
  3. Shut up and calculate: Jev's new AI primitives for coders — www.theregister.com
  4. Why Everyone Is Talking About Jev, The AI That Doesn’t Chat — tech.yahoo.com
  5. Companies are putting Jev in charge of AI agent decisions — and prompt injection can influence the verdict | VentureBeat — venturebeat.com
  6. What is Jev? An Explanation of the AI Dedicated to Judgment Without Text Generation|こたぽん — note.com
  7. Jev, le modèle de décision pensé pour accélérer l’IA agentique (et en réduire les coûts) | LeMagIT — www.lemagit.fr
  8. Contrastive-LM Releases CLM-8B: An Open System One Model That Scores Agent Actions Up to 9× Faster Than Jev - MarkTechPost — www.marktechpost.com

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.