Cache-treff kutter regningen fra 11,20 til 1,62 dollar på samme Opus 5.5-oppgave
Anthropic publiserte ved lanseringen av Opus 5.5 en regneøvelse over hva en hel kodeoppgave koster – og konklusjonen er at listerisen er den minste halvdelen av historien.

Cache-treff kutter regningen fra 11,20 til 1,62 dollar på samme Opus 5.5-oppgave
Anthropic publiserte ved lanseringen av Opus 5.5 en regneøvelse over hva en hel kodeoppgave koster – og konklusjonen er at listerisen er den minste halvdelen av historien. Det som bestemmer regningen, er antall turer, andelen tokens som leses fra hurtigbuffer, og formen på arbeidsmengden.
Nyheten: regnestykket bak prisen
Claude Opus 5.5 ble lansert 22. september 2026 med en inngangspris på 4 dollar per million tokener og 20 dollar for utgang. Cache-lesinger – tokener hentet fra hurtigbuffer i stedet for prosessert på nytt – fikk det største kuttet på 60 prosent, ned til 20 cent per million, rapporterer SiliconANGLE fra lanseringen. Anthropic sa samtidig at dette ifølge selskapet svarer til 40 prosent mindre på en typisk arbeidsmengde enn Opus 5 – et estimat som ikke er uavhengig verifisert.
Samme dag publiserte Anthropic blogginnlegget «What a task costs on Opus 5.5», skrevet av Addy Osmani. Der heter det: «Alle priser er lavere. Inngangs- og utgangstokener er 20 % billigere enn på Opus 5. Cache-lesinger er 60 % billigere.»
Poenget i innlegget er at den ekstra besparelsen på cache-lesinger bare gjelder API-priser, mens abonnentene på Pro-, Max- og Team-planene ifølge selskapet får rundt 25 prosent lengre bruksgrenser.
Regnestykket: hvorfor turene dominerer
Kjernen i Osmanis gjennomgang er en egenskap ved alle chatbaserte modeller: hver tur i en økt sender hele samtalen på nytt til modellen. Etter hvert som samtalen vokser, sender altså hver enkelt tur stadig flere tokener – selv om konteksten aldri blir stor.
Innlegget regner gjennom et tenkt eksempel, som Anthropic eksplisitt omtaler som beste-anslag og ikke målinger: En oppgave starter med 20 000 tokener kontekst og vokser til 120 000 etter hvert som modellen leser filer og verktøyresultater. Med 40 turer sender hver tur i gjennomsnitt rundt 70 000 tokener. Det gir rundt 2,8 millioner inngangstokener for oppgaven som helhet. Med 90 prosent cache-treff koster inngangen rundt 1,62 dollar. Samme oppgave på 25 turer behandler rundt 1,75 millioner tokener og koster rundt 1,02 dollar i inngang.
Cache-treffprosenten er den enkeltfaktoren som betyr mest. De samme 2,8 millionene inngangstokener koster 11,20 dollar hvis ingenting kommer fra cache, 1,62 dollar ved 90 prosent treff, og rundt 0,99 dollar ved 96 prosent. «Ingen annen innstilling flytter inngangsprisen så mye», skriver Osmani.
Formen på arbeidsmengden bestemmer besparelsen
Besparelsen mot Opus 5 er altså ikke fast. Ifølge innlegget kan en økt som hovedsakelig består av cache-lesinger spare opptil 60 prosent på inngang. Et kort spørsmål uten cache og med et langt svar kan derimot bare spare opptil 20 prosent, fordi utgangstokener – som ikke nyter godt av cachen – dominerer regningen.
Osmani peker også på et interessant mønster i hvem som tjener mest: På en godt avgrenset oppgave bruker begge modellene omtrent like mange turer, og da er priskuttet alt man får. «Gapet bør være størst på åpne oppgaver, der en modell kan bruke mange turer på feil idé», heter det i analysen, gjengitt av Unite.AI.
Innlegget innrømmer samtidig en motside: Alle måter å bruke færre tokener på kan også koste en fullført oppgave. Lavere innsatsnivå, mindre modell eller mindre kontekst sparer tokener – men et nytt forsøk koster mer enn de besparelsene.
Bruksdataene bak prislogikken
- september fulgte Anthropic opp med et innlegg av Michael Segner om hvordan Claude Code-økter faktisk ser ut. Tallene er kjent via Unite.AI sitt referat, så de bør leses som selskapets egne aggregerte bruksdata.
I seksmånedersvinduet mars–september 2026 holdt antall spørsmål per økt seg stabilt, mens arbeidet inne i hvert spørsmål vokste: modellen jobber nå 3,3 ganger lenger per spørsmål, gjør over 40 prosent flere modellkall per spørsmål, og avbrudd falt med 68 prosent. Konteksten per forespørsel økte rundt 2,6 ganger, og forholdet mellom inn- og utgangstokener beveget seg fra 189:1 til 324:1.
Det viktigste for regningen: Selv om konteksten per forespørsel økte 2,6 ganger, falt andelen av inngangen som bommer på cachen med mer enn 50 prosent i perioden. Anthropic tilskriver det en rekke Claude Code-endringer som reduserer utilsiktede cache-brudd – alt fra små forstyrrelser som en oppfrisking av innlogging, til større som å legge til instruksjoner midt i en samtale eller laste verktøy ved behov.
Med andre ord: Modellen sender stadig mer data, men en stadig større andel av dataene leses fra hurtigbuffer til 20 cent per million i stedet for 4 dollar. Det er dette som gjør cache-treffprosenten til den avgjørende kostnadsvariabelen – og som forklarer hvorfor Anthropic valgte å kutte akkurat den prislinjen hardest.
Håndtaket du selv kan bruke
For Claude Code-brukere finnes det konkrete kontroller. Dokumentasjonen oppgir at innstillingen promptCacheTtl eller miljøvariabelen CLAUDE_CODE_PROMPT_CACHE_TTL velger lengre levetid for hurtigbufferen (én time i stedet for standardverdien), og at begge krever Claude Code v2.1.242 eller nyere. Midt-i-økten-endringer av innsatsnivå uten cache-nullstilling fungerer med API-nøkkel eller abonnement, men ikke på Amazon Bedrock, Google Clouds Agent Platform eller en Claude-apps-gateway – og ikke med eksperimentell betafane-flagg eller i HIPAA-konfigurasjoner.
En annen endring: Forkede subagenter starter nå fra foreldresesjonens cache, i stedet for å betale for å behandle samme kontekst på nytt. Siden en subagent ellers måtte re-prosessere foreldresystemprompt, verktøysett og samtaleshistorikk, sparer dette nøyaktig den typen duplisert inngang som regnestykket over viser blir dyrt.
Anthropic viser også til en kunderesultat: Zeta Labs skal ha registrert færre turer og verktøykall per oppgave enn på Opus 5, til nær halvparten av kostnaden, og fullførte dobbelt så mange av sine vanskeligste oppgaver. Dette er et enkeltkunderesultat formidlet av Anthropic selv, uten uavhengig bekreftelse.
Hva som står igjen
Bildet er aldri så rent som listerisene antyder. «40 prosent billigere på en typisk arbeidsmengde» er Anthropics eget estimat, ikke en uavhengig måling. Oppgavekostnadene i blogginnlegget er illustrativ aritmetikk bygget på listepriser – ikke benchmarkdata. Bruksstatistikkene fra 24. september hviler på sekundærkilder via Unite.AI.
Et uavklart punkt: SiliconANGLE nevner ved lanseringen en raskere serveringsmodus til 8/40 dollar per million tokener, som verken blogginnlegget eller Unite.AI tar opp – den bør regnes som ubekreftet.
Det faste inntrykket som likevel står igjen: For de som bruker Opus 5.5 på kodearbeid, er ikke prisen per token den avgjørende variabelen. Antall turer en oppgave krever, og hvor godt økten beholder hurtigbufferen, flytter regningen mer enn noe annet – og det er kontroller for begge deler.