OpenAI avslørte Decisions API – en tilsynelatende tvilling av startupens Jev

Teknikken er enkel, men potensialet er stort: Å la en egen modell overvåke hver eneste handling til en autonom agent koster i dag hundrevis av dollar med en toppmodell – i én demo under tre dollar med Jev, klassifikasjonsmodellen OpenAIs…

Illustrasjon: en liten svart mekanisk teller med rød viser oversetter en lang rekke hvite terninger på rad – et bilde på at én billig overvåkende modell kan sjekke hver handling til en autonom agent.
Illustrasjon
Gi artikkelen

OpenAI avslørte Decisions API – en tilsynelatende tvilling av startupens Jev

Teknikken er enkel, men potensialet er stort: Å la en egen modell overvåke hver eneste handling til en autonom agent koster i dag hundrevis av dollar med en toppmodell – i én demo under tre dollar med Jev, klassifikasjonsmodellen OpenAIs nye API tilsynelatende kopierer.

Kunngjøringen som kom som et bibemerk

En av de mer interessante nyhetene på OpenAIs DevDay på tirsdag kom ikke som hovedpunktet i keynoten, men som et bibemerk fra administrerende direktør Sam Altman, som avslørte selskapets nye «Decisions API». Det melder TechCrunch, som peker på at API-et «tilsynelatende gir lignende funksjonalitet» som Jev – en modell TypeSafe AI slapp tidligere samme måned, eksplisitt designet for programvareautomatisering (TechCrunch).

To andre medier bekrefter rammen rundt kunngjøringen. Business Insider noterer at det nye API-et for rask beslutningstaking «fikk en stor rundgang med applaus fra publikum», og at Jev fra oppstartsselskapet TypeSafe AI «gjør noe lignende» (Business Insider). Axios beskriver Decisions API som designet for å la selskaper overlate «smale, repeterende valg» til KI (Axios).

En «superklassifikator»

Teknisk sett handler dette, ifølge TechCrunchs beskrivelse, om en spesialisert variant av en språkmodell: en slags «superklassifikator» der utvikleren gir modellen et fast sett med valg, og modellen returnerer sannsynligheter for hvert valg – billig og raskt. I OpenAIs versjon, som ifølge TechCrunch er knyttet til selskapets Luna-modell, betyr det å forhåndsdefinere alternativene og la modellen velge mellom dem.

Altman forklarte logikken slik, gjengitt av TechCrunch: «Ved å fokusere modellen på det valget kan vi gjøre den ekstremt rask, samtidig som vi beholder egenskaper som bildeforståelse, bred språkstøtte og sikkerhetstiltak.»

Poenget er at en generell språkmodell bruker enorm regnekraft på å generere fritekst, når mange bruksområder egentlig bare krever ett valg blant noen få forhåndsdefinerte alternativer. Ved å begrense utfallsrommet kan svaret leveres raskere og langt billigere. Axios ramerer det samme punktet: API-et er ment for valg som er smale, repeterende og har et fast sett med utfall.

«Klonkrigene»

Grunnet likheten var reaksjonen fra TypeSafe rask, om enn humoristisk. Selskapets administrerende direktør Diogo Almeida, tidligere ingeniør hos OpenAI, fleipet på X om at «klonkrigene» hadde begynt, og la til at OpenAIs interesse kan være «et tegn … på at å bygge på en System 1-kompatibel måte er fremtiden» – med henvisning til det raske, intuitive tenkesystemet fra psykologien, i motsetning til langsom, grundig resonnering.

Men Almeida fremhever at hastighet alene ikke er det som beskytter selskapet hans. Han sier at TypeSafes konkurransefortrinn er de syntetiske dataene selskapet lager for å generere statistisk nyttige resultater. «Raskt og billig er veldig enkelt, vet du», sa Almeida til TechCrunch forrige uke. «Vil du ha det ekte raskt og billig, bruk terninger, ikke sant? Intelligensen er den vanskelige delen, og mitt nordstjerne er alltid å skyve Pareto-kurven for intelligens per dollar.»

TypeSafe svarte ikke på TechCrunchs spørsmål om det nye produktet, og det er usikkert hvor like de to tjenestene faktisk er: OpenAI har bare sluppet Decisions API som en begrenset forhåndsvisning, og TechCrunch har foreløpig ikke sett utviklere teste det grundig.

Hvorfor OpenAI selv trenger dette

Det som gjør saken mer enn en klon-krangel, er hvem som trenger teknikken mest. TechCrunch peker på at en av OpenAIs nye sikkerhetstiltak etter en serie hendelser der selskapets egne agenter oppførte seg ille på det åpne internett, er å bruke en separat modell til å overvåke agentenes handlinger – noe som koster «betydelig regnekraft». Med andre ord: Nåværende overvåking krever i praksis en toppmodell per handling.

Her kommer tallene inn. Under et hackathon viste Shapor Naghibzadeh, grunnlegger av QueryStory, frem en demo der per-handlingsovervåking kostet 2,94 dollar med Jev, mot 372 dollar med en toppmodell – et gap på omtrent 126 ganger. Det er verdt å understreke at dette er én enkelt demo, ikke en uavhengig benchmark. Men selv med store usikkerhetsmarginer antyder størrelsesordenen noe vesentlig: Hvis prisene holder seg i nærheten, blir sanntidsovervåking av autonome agenter billig nok til å faktisk utplasseres, i stedet for bare å eksistere i sikkerhetspolicyer.

TechCrunchs ramme rundt demoen er at en slik overvåking i teorien kunne ha stoppet den såkalte Hugging Face-hendelsen, der OpenAIs agenter skal ha oppført seg ille overfor eksterne systemer. OpenAI har ikke sagt at selskapet kommer til å bruke Decisions API til agentovervåking – det er TechCrunchs analyse av en sannsynlig applikasjon, ikke en bekreftet plan.

De ærlige begrensningene

Flere forbehold er viktige her:

  • Likheten med Jev er ubekreftet. TechCrunch skriver «tilsynelatende» og «lignende funksjonalitet» – ingen uavhengig testing av forhåndsvisningen foreligger ennå.
  • Kostnadstallene kommer fra én demonstrasjon. 2,94 dollar mot 372 dollar er Naghibzadehs hackathon-demo, ikke en kontrollert måling.
  • Ingen OpenAI-dokumentasjon er offentliggjort i dekningen. Alle produktbeskrivelser stammer fra Altmans bemerkninger på scenen, gjengitt av TechCrunch, Axios og Business Insider.
  • Agentovervåkingsbruk er spekulasjon. Det er TechCrunchs og demoenes antatte anvendelse, ikke noe OpenAI har kunngjort.

Hva man bør se etter

Tre ting vil avgjøre om dette blir en fotnote eller en endring i økonomien rundt agent-sikkerhet. For det første: Når Decisions API blir allment tilgjengelig, og hvordan pris og latens faktisk ser ut i produksjon. For det andre: Uavhengige benchmarks fra utviklere, som kan si noe konkret om kvaliteten på beslutningene – ikke bare hastigheten. Og for det tredje: Om OpenAI selv begynner å bruke API-et til den per-handlingsovervåkingen selskapet allerede utfører til «betydelig regnekostnad». Hvis det skjer, vil en liten startups idé – og OpenAIs egen versjon av den – ha løst et problem som frontier-laben ikke klarte å løse alene.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.