Anthropic hevder Sonnet 5.5 slår eget flaggskip på kode-benchmark – til halvparten av Opus-prisen

Anthropic slo mandag 28. september 2026 fast at Claude Sonnet 5.5, den andre modellen i Claude 5.5-familien, er klar for brukere – bare seks dager etter flaggskipet Opus 5.5.

Illustrasjon: to aluminiumsblokker, en liten og en stor, der den lille blokken får en presisjonsvekt til å slå ut lenger enn den store – et bilde på en rimeligere modell som slår flaggskipet på en benchmark.
Illustrasjon
Gi artikkelen

Anthropic hevder Sonnet 5.5 slår eget flaggskip på kode-benchmark – til halvparten av Opus-prisen

Anthropic slo mandag 28. september 2026 fast at Claude Sonnet 5.5, den andre modellen i Claude 5.5-familien, er klar for brukere – bare seks dager etter flaggskipet Opus 5.5. Selskapet beskriver modellen som sin mest kapable mellomklassemodell noensinne: over 30 % raskere enn forgjengeren, med et vesentlig lavere token-forbruk per oppgave – og ifølge Anthropics egne tall slår den til og med Opus 5.5 på enkelte agentiske kode-benchmarker, til halvparten av prisen. Modellen er tilgjengelig fra dag én i Anthropics API, på Amazon Web Services, Google Cloud og Microsoft Azure, ifølge CNBCs dekning gjengitt av Ecosistema Startup.

Hva som er nytt – og hva som bare er påstand

Det viktigste å ha i bakhånd: Alle ytelsestall og effektivitetspåstander i denne saken stammer fra Anthropic selv, formidlet gjennom sekundære medier. Ingen primærkilde fra selskapet – modellkort, systemkort eller prisside – foreligger i det offentlige kildematerialet ennå, og ingen av benchmark-tallene er uavhengig verifisert.

Med det forbeholdet er bildet dette: Anthropic hevder at Sonnet 5.5 er rundt 30 % raskere enn forgjengeren Sonnet 5 og bruker markant færre tokens for å gjøre samme arbeid – noe som ifølge selskapet gjør den omtrent 30 % billigere per oppgave, selv om listeprisen er uendret. Både SiliconANGLE og TechCrunch gjengir påstandene fra lanseringsdagen.

På Anthropics benchmark-tall scoret Sonnet 5.5 70,6 % på Terminal-Bench 4.0, en agentisk kode-evaluering, mot forgjengerens 10,3 %. Via Ecosistema Startup, som siterer Decrypt, fremgår det også at Opus 5.5 skal ha oppnådd 66,4 % på samme benchmark – det vil si at mellomklassemodellen skal slå selskapets eget flaggskip. Dette tallet er imidlertid bare dokumentert gjennom én kildekjede og mangler korroborasjon. På GDPval-AA, en test av reelt yrkesarbeid, ligger Sonnet 5.5 ifølge SiliconANGLE to poeng under Opus 5.5. De to bildene kan begge stemme – de gjelder forskjellige benchmarker – men de tegner et mer nyansert forhold mellom flaggskip og mellomklasse enn «Sonnet slår Opus» alene.

Pris og økonomi: samme listepris, hevdet lavere kostnad

Sonnet 5.5 prises som forgjengeren: 2 dollar per million inngangstokens, 10 dollar per million utgangstokens og 0,20 dollar per million cache-reads, bekreftet av SiliconANGLE. Til sammenligning koster Opus 5.5, lansert 22. september, 4 dollar per million inngangstokens og 20 dollar per million utgangstokens – altså dobbelt.

Det er dette som gjør token-effektivitetspåstanden økonomisk viktig: Hvis en modell løser en oppgave med rundt 30 % færre tokens, synker den faktiske kostnaden per jobb tilsvarende, uten at noen listepris endres. Men dette er Anthropics egen beregning, ikke en uavhengig måling, og det foreligger foreløpig ingen eksterne tall som bekrefter token-forbruket i praksis.

Sikkerhetsfallbaker: første Sonnet med «stor modell»-tiltak

En av de mest konsekvensrike endringene for utviklere er knapt nevnt i markedsføringen: Sonnet 5.5 er den første Sonnet-modellen som lanseres med cybersikkerhetstiltak og fallbaker på linje med de mer kapable modellene. TechCrunch gjengir at Anthropic hevder modellen har «sammenlignbare» cyber-evner med Opus 5, og at den derfor er den første Sonnet som omfattes av de samme sikkerhetstiltakene som gjelder for Fable og Opus – SiliconANGLE beskriver tiltakene som utviklet for «Mythos-klassens modeller og Fable».

I praksis betyr det at fallbakerne kan utløses når spørsmål berører cybersikkerhet, biologi eller annet sensitivt innhold. Anthropic sier at de fleste programvareutviklings- og bioarbeidsoppgaver ikke påvirkes. Én kilde, Ecosistema Startup, hevder at sensitive cyber-spørsmål automatisk omdirigeres til Opus 4.8 – men denne påstanden er bare dokumentert hos det ene mediet og bør behandles som ubekreftet inntil mer foreligger.

For team som bygger agentiske systemer innen sikkerhetstesting, bioteknologi eller tilgrensende felt, er budskapet at Sonnet-klassen fra og med denne modellen ikke lenger er en «lette»-variant uten slike begrensninger. Det er en endring man må forholde seg til fra dag én.

Vannmerking med henblikk på EU AI Act

Sonnet 5.5 leveres også med usynlig tekstvannmerking. Da Anthropic lanserte vannmerkingsteknologien, opplyste selskapet at den ikke skal påvirke tekstkvalitet eller lesbarhet, men skal øke sannsynligheten for at KI-generert tekst kan oppdages. Årsaken er ifølge selskapet etterlevelse av globale regelverk, deriblant EUs AI-forordning.

Hvordan vannmerkingen fungerer i praksis, hvor robust den er, og om kvalitetsløftet på skriving faktisk er upåvirket, hviler alene på Anthropics egne utsagn. Foreløpig finnes ingen uavhengig analyse av teknologien i kildematerialet. For europeiske virksomheter er likevel poenget konkret: En av de mest brukte mellomklassemodellene leverer nå tekst med innebygd sporbarhet som standard.

Tilgjengelighet og konteksten rundt lanseringen

Modellen er tilgjengelig fra lanseringsdagen i Anthropics eget API og hos de tre store skyplattformene – AWS, Google Cloud og Microsoft Azure – ifølge CNBCs dekning gjengitt av Ecosistema Startup. Det reduserer terskelen for virksomheter som allerede kjører Claude-arbeidsmengder og bare bytter modellidentifikator.

Konteksten er verdt å notere. Reuters skriver at dette er den andre modellen i Claude 5.5-familien, lansert mens Anthropic bygger mot en planlagt børsnotering, og at enterprise-kunder utgjør omtrent 80 % av selskapets virksomhet – et tall tilskrevet Anthropic selv. En rimeligere, raskere mellomklassemodell er nettopp den typen produkt som treffer dette kundesegmentet. Reuters beskriver også Sonnet 5.5 som et raskere, billigere supplement til Opus 5.5, og opplyser at Haiku 5.5 kommer «i kommende uker» – uten fast dato.

Lanseringen skjer dessuten midt i en pris- og ytelsesruse mot OpenAI, noe som setter målingene i perspektiv: I et marked der kunder velger mellom modeller hver uke, teller hvert prosentpoeng på benchmark og hver dollar per oppgave.

Det tidlige kundebildet – med forbehold

Zendesk, som har testet modellen i forkant, gir en positiv, men interessert vurdering. «Vi matet Claude Sonnet 5.5 med hundrevis av ekte kundestøtte-tilfeller, både svar og eskaleringsforespørsler. Den gjorde færre feilvurderinger og løste saker raskere enn Claude-modellene vi bruker i produksjon i dag. Sakene ble behandlet 20 % raskere,» sier Abhinay Kathuria, direktør for KI i Zendesk, ifølge SiliconANGLE.

Dette er en tidligbrukertest fra en kunde med eget interesse av å fremstå som effektiv KI-bruker, og tallene er ikke uavhengig verifisert. Men de peker på bruksområdet Anthropic selv vektlegger: hverdagslige oppgaver med høyt volum, der fart og token-økonomi veier tyngre enn maksimal resonneringsevne.

Hva som gjenstår å svare på

Tre spørsmål står åpne etter lanseringen. For det første mangler alle ytelsestall uavhengig verifisering – både de 70,6 % på Terminal-Bench 4.0, de 30 %-påstandene om fart og kostnad, og forholdet mellom Sonnet 5.5 og Opus 5.5, der Opus-tallet på Terminal-Bench bare er dokumentert gjennom én kildekjede. For det andre er vannmerkingens reelle detekterbarhet og eventuelle kvalitetseffekter ukjente utenfor Anthropics egne løfter. For det tredje venter markedet på Haiku 5.5, som per lanseringen bare var datert til «kommende uker».

For utviklere som velger modell denne uken, er den praktiske konklusjonen likevel klar: Sonnet 5.5 tilbyr Opus-nær ytelse på utvalgte kode-benchmarker – i hvert fall ifølge leverandøren – til halv pris, men med strengere sikkerhetsfallbaker og standard vannmerking enn noen tidligere Sonnet.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.