← Tilbake
AI-nyheter

Perplexity sier verktøykallfeil falt 21,2 % etter trening på virkelige brukerøkter

Perplexity har ettertrent en Computer-modell på virkelige brukerøkter, inkludert mislykkede, ved å kombinere rejection sampling fine-tuning med hint-styrt selvdistillering.

AIMag.no
AIMag.no
24. september 2026 · 5 min
Bærbar datamaskin med et abstrakt rutenett av tilkoblede verktøy.

Perplexity sier verktøykallfeil falt 21,2 % etter trening på virkelige brukerøkter

Perplexity har ettertrent en Computer-modell på virkelige brukerøkter, inkludert mislykkede, ved å kombinere rejection sampling fine-tuning med hint-styrt selvdistillering. Selskapet oppgir at det nye sjekkpunktet reduserte verktøykallfeil med 21,2 % i drift — et seltrapportert tall — og at det nå er utrullet som modellvalg i produktet.

Perplexity publiserte de tekniske detaljene i en forskningsblogg 21. september 2026, med sekundær dekning hos cryptobriefing.com dagen etter. Kjernen i metoden er enkel å beskrive og krevende å gjennomføre: I stedet for å kaste bort alle øktene der agenten gjorde en feil, bruker selskapet dem aktivt som treningsmateriale. Ifølge selskapet er det nytrente sjekkpunktet allerede utrullet som et valg i Computer-produktet.

Hvorfor feilene er verdt noe

Ettertrening av agentmodeller har tradisjonelt hvilt på to ben: imitasjon av vellykkede eksempler og forsterkningslæring i syntetiske miljøer. Begge har en blindsonе — de lærer modellen hva som går bra, men sier lite om hva som går galt underveis og hvorfor. Perplexitys poeng er at virkelige økter inneholder begge deler: «Brukerkorrigeringer og verktøyfeil gir veiledning om hva som gikk galt underveis, i tillegg til om oppgaven til slutt lyktes», skriver selskapet i blogginnlegget.

Ettertreningsstadiet plasseres derfor etter forsterkningslæring i syntetiske miljøer, for å «hjelpe med å lukke gapet mellom disse miljøene og virkelig bruk», ifølge Perplexity. Det er et klassisk sim-to-real-problem: En agent som ser flott ut i en kontrollert treningsverden møter i produksjon brukere som omformulerer seg, verktøy som returnerer uventede svar og flertrinnsgaver der én feil tidlig spolerer alt.

Hvordan metoden fungerer

Metoden kombinerer to teknikker, med ulike roller for vellykkede og mislykkede økter.

Rejection sampling fine-tuning (RFT) håndterer imitasjonsdelen. Nyttige steg fra vellykkede økter forblir imitasjonsmål — modellen skal lære å gjenta det som fungerte.

Hint-styrt On-Policy Self-Distillation (OPSD) håndterer korrigjonsdelen. Et hint defineres av Perplexity som «en kort korrektiv instruksjon forankret i informasjonen modellen allerede hadde da den gjorde feilen» — altså ingen ekstern kunnskap, bare en eksplisitt pekepinn på en unngåelig feil. I OPSD fungerer samme modell som både lærer og elev: Læreren får hintet, eleven får det ikke, og eleven trenes på å matche lærerens neste-token-prediksjoner. Poenget er at modellen skal internalisere korrigeringen — forstå hva som burde vært annerledes — uten å få fasiten servert i produksjon.

En detalj verdt å merke seg er et kryssentropi-ledd som ifølge selskapet motvirker en åpenbar snarvei: at modellen bare lærer å være enig med seg selv uten å lese konteksten. Uten en slik forankring kan selvdistillering degenerere til selv-bekreftelse.

Behandlingen av øktene skiller også mellom utfall: Vellykkede økter kan gi både imitasjons- og korrigjonsmål, mens mislykkede økter kun gir korrigjonsmål. Alle øvrige turer — systemmeldinger, brukerinndata og verktøyutdata — beholdes som kontekst, slik at korrigeringen læres i situasjonen den oppsto i.

Tallene — og hva de ikke sier

Hovedtallet er at «det senere trente sjekkpunktet reduserte verktøykallfeil med 21,2 % i live bruk i forhold til et tidligere trent sjekkpunkt», ifølge Perplexity. Det er en driftsmåling, ikke et benchmark-resultat, og den relevante sammenligningen er mot selskapets eget tidligere sjekkpunkt — ikke mot en modell trent uten virkelighetsdata, og ikke mot konkurrentenes modeller.

Det finnes per offentliggjøringstidspunktet ingen uavhengig verifikasjon, ingen offentlig benchmark-tabell, og ingen oppgitte opplysninger om utvalgsstørrelse, feiltaksonomi eller statistisk signifikans. Blogginnlegget er dessuten ufullstendig når det gjelder hvordan hintene genereres og valideres, og hvordan evalueringen ble gjennomført. Tallet bør derfor leses som en firmapåstand om en intern sammenligning — interessant, men ikke revidert.

Konteksten: verktøykall som konkurransefortrinn

Dekningen hos cryptobriefing.com 22. september rammefester saken som en del av et større konkurransemønster: Google har utvidet AI Overviews aggressivt, OpenAI har integrert nettsøk i ChatGPT, og en rekke oppstartsbedrifter bygger søk-augmenterte AI-produkter. Redaksjonen argumenterer for at kvaliteten på verktøybruk — hvor pålitelig en modell kan søke, hente og syntetisere informasjon — er blitt en kjerndifferensiator i dette miljøet (analyse attribuert til cryptobriefing.com). For et selskap som Perplexity, hvis produkt er agenten selv, er 21 % færre feil ikke en teknisk kuriositet, men et direkte produktutsagn mot konkurrentene.

Cryptobriefing beskriver også implementeringen som et to-stegsoppsett — veiledet finjustering på kuraterte eksempler, deretter on-policy forsterkningslæring — og knytter den til DART-SD-rammeverket og FRAMES-benchmark-arbeidet. Merk at disse navnene ikke forekommer i Perplexitys eget blogginnlegg; koblingen stammer fra sekundærkilden og er uverifisert fra innsendt bevis.

Personvern — firmapåstander uten revisjon

Datagrunnlaget er brukerøkter, noe som reiser åpenbare personvernspørsmål. Perplexity skriver at innsamlingspipelinen «respekterer brukernes privatliv og treningsvalg ved å ekskludere økter med personidentifiserbar informasjon (PII) og økter fra brukere som har meldt seg av». Dette er et firmautsagn uten uavhengig revisjon — det finnes ingen ekstern bekreftelse på hvor godt filtreringen fungerer i praksis, eller hvordan PII-deteksjonen håndheves.

Åpne spørsmål

Metoden reiser flere ubesvarte spørsmål. Hvor stor er forbedringen målt mot en baselinje uten virkelighetsdata? Hvordan genereres og valideres hintene, og hvor ofte inneholder de feilaktige korrigeringer som modellen da internaliserer? Hvordan tåler OPSD skala — kan samme modell som lærer og elev forsterke egne systematiske blinde flekker over tid, til tross for kryssentropi-leddet? Og hvordan holder PII-filtreringen stand under ekstern gransking?

Det som likevel er bemerkelsesverdig, er prinsippet: En produksjonsagent genererer kontinuerlig treningsmateriale i form av sine egne feil og brukernes korrigeringer. Hvis mekanismen fungerer slik Perplexity beskriver, blir hver mislykket økt et aktiv — og gapet mellom syntetisk trening og virkelig bruk krymper litt for hver dag i drift. Foreløpig er det selskapet selv som rapporterer at det skjer.

Kilder

  1. Learning from Real-World Experience — www.perplexity.ai
  2. Perplexity.AI reduces tool-call failures by 21% with new model training approach — cryptobriefing.com