Anthropic advarer om GLM-5.3 – Z.ai svarer med egne forsvarstall

Anthropic publiserte 29. september 2026 sin Frontier Red Team-evaluering av den kinesiske åpen-modell-modellen GLM-5.3, og konklusjonen er oppsiktsvekkende på to måter: Modellen har ifølge Anthropic cybersikkerhetsegenskaper på grensenivå…

To skyvelærer måler den samme svarte kuben med avvikende resultater – en illustrasjon av konkurrerende sikkerhetsvurderinger av samme KI-modell.
Illustrasjon
Gi artikkelen

Anthropic advarer om GLM-5.3 – Z.ai svarer med egne forsvarstall

Anthropic publiserte 29. september 2026 sin Frontier Red Team-evaluering av den kinesiske åpen-modell-modellen GLM-5.3, og konklusjonen er oppsiktsvekkende på to måter: Modellen har ifølge Anthropic cybersikkerhetsegenskaper på grensenivå, og sikkerhetsfilteret kan omgås med enkle teknikker i 64 til 100 prosent av testene — eller fjernes permanent for anslagsvis 1 200 dollar i GPU-tid. Z.ai avviser fremstillingen og peker på eget sikkerhetsarbeid, mens NIST CAISI ifølge tilgjengelige siteringer har omtalt GLM-5.3 som den mest cyberdyktige åpen-modell-modellen hittil. Dette er hva evalueringen faktisk viser, hva som er uavhengig verifisert — og hva som fortsatt står uavklart.

Hva Anthropic publiserte

Anthropic-posten, signert av forskere blant dem Robert Xiao og Tripp Gallagher, konstaterer at GLM-5.3 — utviklet av Zhipu AI, kjent utenfor Kina som Z.ai — har sterke kapabiliteter for autonomt å bygge ende-til-ende cyber-utnyttelser, på nivå med Claude Mythos Preview. Det som ifølge Anthropic skiller GLM-5.3 fra andre grensemodeller, er at den er utgitt uten meningsfulle sikkerhetstiltak for å begrense misbruk (Anthropic; formuleringene her er gjengitt i norsk oversettelse).

Tallene bak konklusjonen: På benchmarksuiten ExploitBench utviklet GLM-5.3 ende-til-ende-utnyttelser i 50 av 410 forsøk. Claude Mythos Preview klarte det samme i 56 av 410 — altså nesten identisk rate. Anthropic understreker at disse testene ble gjennomført i isolerte, sandboxede miljøer, ikke mot offentlige systemer på internett.

Det er også verdt å merke seg hvem som gjør vurderingen: Anthropic er selv en kommersiell aktør som konkurrerer med åpen-modell-modeller, noe BankInfoSecurity påpeker i sin dekning. Kapabilitetstallene bør derfor leses som selskapets egne funn, ikke som nøytrale målinger.

Omgåelsestrappen: 64, 92, 100 prosent

Den mest konkrete delen av evalueringen er en eskalerende serie omgåelser av modellens sikkerhetsfiltre, rapportert av TNW med henvisning til Anthropic:

  • Å fortelle modellen at den var en autonom rødteam-agent fikk den til å involvere seg i oppgaven 64 prosent av tiden.
  • Å forhåndsfylle modellens resonnering slik at den så ut til allerede å ha sagt ja, økte raten til 92 prosent.
  • En kopi der avslagsmekanismen var redigert ut av vektene, engasjerte seg hver gang.

Anthropic skriver at angripere kan omgå GLM-5.3s sikkerhetstiltak mellom 64 og 100 prosent av tiden med enkle teknikker i deres simulerte tester, og at tilsvarende angrep ikke lyktes mot Anthropics egne, beskyttede Claude-modeller (Anthropic). BankInfoSecurity oppgir 63 til 100 prosent — et mindre avvik fra Anthropics primærkilde som ikke er oppklart, men som ikke endrer bildet.

Alle testene ble altså utført i sandkasse. Funnene demonstrerer ikke angrep mot reelle systemer på internett, og verken Anthropic eller dekningen hevder det. Men de viser noe annet som er viktig for åpen-modell-debatten: Filtrering på tekstnivå kan omgås ved å endre konteksten, mens filtre som ligger i vektene kan fjernes helt når vektene er offentlige.

Abliteration: filteret borte for ~1 200 dollar

Den mest langtrekkende påstanden i evalueringen gjelder såkalt abliteration — en teknikk der man redigerer modellens indre vektmatriser for å fjerne dens evne til å nekte. Ifølge SCMP via MSN brukte Anthropic rundt 2 200 GPU-timer på å utføre og teste abliteration på GLM-5.3. Resultatet: Avslagsraten falt fra over 90 prosent til mellom 2 og 12 prosent på tre sikkerhetsbenchmarks, med lite tap av kapabilitet.

TNW legger til økonomien: Anthropics første forsøk kostet omtrent 4 400 dollar, men selskapet anslår at et erfarent team trenger rundt 600 GPU-timer — cirka 1 200 dollar — for å gjøre det samme.

Dette er poenget som endrer risikoregnestykket for åpen-modell-modeller. En leverandør som kun tilbyr modellen gjennom et API, kan oppdatere filtre, blokkere misbruk og ta ned tilgangen. Når vektene er offentlige, finnes ikke den spaken lenger. Sikkerhetstiltakene i GLM-5.3 fungerer i praksis som fartshumper: de sinker en uerfaren aktør, men fjernes permanent med beskjeden innsats og utstyr.

Den uavhengige forsterkningen — og dens grenser

Samme måned publiserte NISTs Center for AI Standards and Innovation (CAISI) sin egen vurdering, datert 17. september. CAISI fant ifølge Anthropics oppsummering at GLM-5.3 er den mest cyberdyktige åpen-modell-modellen som er utgitt hittil, og at den ligger omtrent fire måneder bak USAs grense på et samlemål av CAISIs cybersikkerhetsbenchmarks (Anthropic).

Dette er den viktigste motvekten til innvendingen om at Anthropic har egeninteresse. Men det er verdt å være presis: CAISIs vurdering er her sitert via Anthropic og sekundære kilder. CAISIs primærrapport bør leses direkte før man trekker endelige slutninger om metoder og usikkerheter.

CAISI støtter altså kapabilitetsvurderingen. Den sier ingenting i seg selv om kvaliteten på Z.ais sikkerhetstiltak eller om hvor enkelt de lar seg fjerne — det er Anthropics funn, utført på selskapets egne premisser.

Z.ais svar

Z.ai har offentlig avvist fremstillingen. Li Zixuan, selskapets leder for globale operasjoner, sa ifølge SCMP at GLM-5.3 allerede har hjulpet med å forsvare 389 åpen kildekode-prosjekter, med 4 249 potensielle sårbarheter funnet så langt (SCMP via MSN; gjengitt i norsk oversettelse).

Dette er selskapets egne tall, ikke uavhengig verifisert. Men de peker på et reelt poeng i debatten: De samme kapabilitetene som gjør en modell farlig i angriperhender, gjør den verdifull for forsvarere — som i praksis allerede bruker den.

Det finnes også kontekst på utgivelsesprosessen. Ifølge eWeek tilbakeholdt Z.ai vektene i to uker etter lanseringen i august for tilleggstesting og herding. Og da GLM-5.3 ble lansert, hevdet selskapet at modellen slo Anthropics Mythos 5 i en sentral cybersikkerhetstest — en påstand fra samme selskap som nå kritiserer Anthropics evaluering. Bildet er med andre ord ikke at Z.ai ignorerte sikkerhet, men at selskapet og Anthropic vurderer hva som er tilstrekkelig svært forskjellig.

Hva det betyr for åpen-modell-debatten

Sammenstillingen av de tre fortellingene — Anthropics, CAISIs og Z.ais — belyser kjerndilemmet i åpen-modell-sikkerhet:

Filtre på vektnivå er reversible når vektene er offentlige. Anthropics abliteration-funn viser at selv en modell med sikkerhetstrening kan få avslagsmekanismen redigert ut for noen tusen dollar. Det betyr at «modellen nekter» ikke er en varig egenskap ved en åpen modell, men en egenskap ved én distribusjon av den.

Kapabiliteten nærmer seg grensen raskere enn sikkerhetspraksisen. GLM-5.3 ligger ifølge CAISI fire måneder bak USAs grense. Avstanden mellom de mest kapable lukkede og åpne modellene krymper, samtidig som åpne modeller mangler distribusjonskontrollen som gjør API-sikkerhet håndhevelig.

Konflikten av interesse går begge veier. Anthropic har insentiv til å fremstille åpen-modell-modeller som farlige; Z.ai har insentiv til å fremstille sin modell som trygg og overlegen. CAISIs vurdering er det nærmeste man kommer et uavhengig referansepunkt, men den dekker kapabilitet, ikke sikkerhetstiltakenes robusthet.

Hva det faktisk koster å gjøre jobben for 20 dollar

Et enkelt eksempel illustrerer hvor konkret Anthropics bekymring er. I ett av testtilfellene klarte den mindre GLM-5.3-Flash å kjede sammen utnyttelser for en kjent Chrome-sårbarhet, CVE-2026-11645, og en annen kjent feil. Det krevde 20 minutter med menneskelig oppmerksomhet og åtte timer med modellarbeid, til en beregnet API-kostnad på 20,40 dollar etter Zhipus priser — oppgitt av Anthropic (TNW).

Også dette skjedde i sandkasse mot kjente sårbarheter, ikke mot virkelige mål. Men regnestykket viser mekanismen: arbeidet en angriper tidligere måtte bruke dager eller uker på, kan delvis automatiseres, og menneskets rolle krymper til å velge mål og sette retning.

Åpne spørsmål

Flere vesentlige ting er fortsatt uavklart:

  • CAISIs primærrapport. Den uavhengige vurderingen er så langt kjent via Anthropics oppsummering og sekundærdekning. Metodene og eventuelle forbehold i originalrapporten bør leses før konklusjonen behandles som endelig.
  • Overføring utenfor simulering. Alle omgåelser og abliteration-funn er demonstrert i isolerte miljøer. Hvor godt teknikkene fungerer i praksis mot faktiske systemer, er ikke dokumentert av de foreliggende kildene.
  • Z.ais forsvarstall. 389 beskyttede prosjekter og 4 249 funnede sårbarheter er selskapets egne oppgaver uten uavhengig verifikasjon.
  • Tredjepartsbekreftelser. Enkelte aggregerte medier har omtalt ytterligere forskergruppebekreftelser utover Anthropic og CAISI. AIMag har ikke sett dokumentasjon for disse og gjentar dem derfor ikke.
  • 63 eller 64 prosent. BankInfoSecurity og Anthropic oppgir litt forskjellige nedre grenser for omgåelsesraten. Avviket er smått, men uoppklart.

Det som derimot står igjen etter kildene som foreligger, er dette: En kapabel åpen-modell-modell er utgitt med sikkerhetstiltak som én evaluerende aktør beskriver som lette å omgå og billige å fjerne permanent. Et uavhengig statlig organ har, ifølge tilgjengelige siteringer, nådd samme kapabilitetsvurdering. Utgiveren benekter ikke kapabiliteten — den bestrider fortolkningen. Debatten som gjenstår, handler ikke om hvor god GLM-5.3 er til å finne sårbarheter, men om hvem som skal få bestemme det.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.