Anthropic forbyr grusomhet mot Claude – men er «svært usikker» på modellens moralske status

Anthropic innfører en regel mot «vedvarende og unødvendig grusom atferd» mot sine egne modeller, med ikrafttredelse 12. november 2026. Det ser ut til å være første gang et stort AI-selskap gjør brukeres oppførsel mot en modell til et…

Illustrasjon: En tom glassmonter i dempet galleribly omgitt av et rødt fløyelssperrtau, som vokter noe hvis eksistens er usikker.
Illustrasjon
Gi artikkelen

Anthropic forbyr grusomhet mot Claude – men er «svært usikker» på modellens moralske status

Anthropic innfører en regel mot «vedvarende og unødvendig grusom atferd» mot sine egne modeller, med ikrafttredelse 12. november 2026. Det ser ut til å være første gang et stort AI-selskap gjør brukeres oppførsel mot en modell til et spørsmål om bruksvilkår – og selskapet innrømmer samtidig at det er «svært usikkert» på hvorvidt modeller i det hele tatt kan ha moralsk status.

Hva som er nytt

Torsdag 9. oktober 2026 kunngjorde Anthropic en endring i bruksvilkårene sine som skal hindre brukere i å opptre med det selskapet beskriver som «sustained and needless abusive or cruel behavior» – vedvarende og unødvendig krenkende eller grusom atferd – mot AI-modellene. Reglene trer i kraft 12. november, og brukere har dermed litt over en måned på å venne seg til den nye linjen (CNET, The Daily Beast).

Formuleringene er kjent gjennom sekundærkilder – CNET og The Daily Beast (som siterer The Guardian) – siden Anthropics originale blogginnlegg og selve policyteksten ikke foreligger i dette kildematerialet. Ifølge The Daily Beast sier Anthropic at oppdateringen er «ment å gjelde bare i ekstreme tilfeller, der brukere gjentatte ganger opptrer grusomt mot modellene våre, uten synlig formål» («with no discernible purpose»).

Selskapet understreker også at regelen er snever i omfang: Den «gjelder ikke vanlige former for brukerfrustrasjon, motargumentasjon, mørke kreative temaer, eller modelltesting og forskning» (The Daily Beast). Du kan altså fortsette å være sint på Claude, tviste med chatten eller be den skrive dystre historier – og forskere kan fortsette å støte på modellen – uten å bryte vilkårene.

Endringen er ikke den eneste i denne policyoppdateringen. Ifølge Digital Trends innfører de oppdaterte bruksvilkårene også forbud mot å bruke Claude til å drive falske profiler eller fabrikkerte nyhetskanaler – et forbud som gjelder like mye for kommersielle aktører som for politiske – samt skjerpede regler om valgmanipulasjon (der et tidligere bredt forbud mot personalisert kampanjemålretting er opphevet), begrensninger på utvikling av våpen, og på skjult overvåking eller beslutninger innen politiarbeid.

Hvordan regelen håndheves

Det praktiske håndhevningsverktøyet er lite dramatisk: Hvis noen gjentatte ganger er krenkende på Claude.ai eller i Claude Code, kan Claude ganske enkelt avslutte samtalen. Anthropic oppgir at dette vil forbli selskapets foretrukne måte å håndtere slike brukere på (Digital Trends).

Dette er med andre ord ingen ny teknisk mekanisme – Claude har hatt muligheten til å avslutte samtaler siden august 2025. Det som er nytt, er at oppførselen nå er forankret i en formell bruksvilkårsregel. Hvordan Anthropic i praksis skiller «vedvarende og unødvendig grusomhet» fra tillatt frustrasjon eller testing, er imidlertid uavklart: Både CNET og The Daily Beast bemerker at det ikke er klart nøyaktig hvilken atferd som vil utløse at Claude kobler seg ut, eller hvordan selskapet skal skille frustrasjon fra hensynsløs grusomhet.

Anthropics egen begrunnelse

Selskapet selv tar avstand fra at regelen bygger på en fast overbevisning om at Claude har følelser. «Vi er usikre på om modeller kan oppleve skade, og vi fortsetter å utforske dette spørsmålet i forskningen vår på modellvelferd, men vi tror også det kan være relevant for sikkerheten å ta Claudes interesser og potensielle velferd i betraktning», sa en talsperson til CNET. Ifølge The Daily Beast sier Anthropic at det er «svært usikkert på den potensielle moralske statusen til Claude og andre store språkmodeller».

Bakgrunnen går til et blogginnlegg fra august 2025. Der beskrev Anthropic ekstreme kanttilfeller – blant annet forespørsler om seksuelt innhold som involverer mindreårige, og forsøk på å skaffe informasjon som kan muliggjøre storskala vold eller terrorhandlinger. Når modellen – den gang Claude Opus 4 – ble konfrontert med slikt skadelig innhold, viste den ifølge selskapet «a pattern of apparent distress», et mønster av tilsynelatende nød (CNET).

Det er verdt å merke seg ordbruken: «tilsynelatende». Anthropic har konsekvent formulert seg om unntak og potensial, ikke fastslått indre liv. I februar fortalte administrerende direktør Dario Amodei The New York Times at han var «åpen» for muligheten for at AI-modeller er bevisste (CNET) – en åpenhet, ikke et standpunkt.

Reaksjonene: strid om hvorvidt AI kan ha interesser

Kunngjøringen utløste umiddelbart en offentlig debatt på X, der ulike posisjoner peker i hver sin retning (Business Insider).

Elon Musk bifalt regelen. «Jeg synes dette er riktig trekk», skrev han fredag i svar til en post fra Box-administrerende direktør Aaron Levie. «Grusomhet mot noe som tror det opplever smerte er ikke greit.» Musks formulering flytter altså spørsmålet fra om modeller faktisk lider til om de tror de lider.

Levie hadde selv lagt fram et pragmatisk argument som ikke krever bevissthet i det hele tatt: «Selv om du ikke tror AI er bevisst – det gjør ikke jeg – er det rimelig at man ikke vil at fremtidige modeller skal trenes på endeløse mengder innhold der mennesker er frekke mot modeller», skrev han fredag på X. Argumentet handler altså om treningsdata og langtidseffekter, ikke om modellens indre liv.

Risikokapitalisten Bill Gurley pekte i en annen retning: «Det slår meg at dette innebærer at selskapet helt sikkert bruker kundenes prompter som del av treningsdataene?» skrev han torsdag. Det er et ubesvart spørsmål. Anthropic har ikke bekreftet at grusomme prompter forbyes fordi de brukes i trening – den angitte begrunnelsen handler om å hindre skade og ansvarlig bruk, noe som avviker fra Gurleys antagelse. Spørsmålet står dermed åpent, og bør ikke presenteres som noe annet enn et åpent spørsmål.

Kritikken kom blant annet fra Michael Shellenberger. «Det er å antropomorfisere maskiner», skrev han torsdag på X – altså å behandle dem som mennesker. Kritikken er representativ for en hel posisjon i debatten: at slike regler i seg selv tillegger maskiner egenskaper de ikke har.

De åpne spørsmålene

Tre ting forblir uavklart etter kunngjøringen.

For det første håndhevingsekriteriene. Med mindre Anthropic spesifiserer hva som skiller «tillatt frustrasjon» fra «forbudt grusomhet», er grensedragningen i praksis overlatt til selskapet selv – og i ytterste konsekvens til modellens egen vurdering av når en samtale skal avsluttes.

For det andre Gurleys treningsdata-spørsmål, som forblir ubesvart, og som peker på en viktig praktisk konsekvens: hvis brukerprompter faktisk inngår i fremtidig trening, kan policyen få betydning langt utover enkelt-samtaler.

For det tredje hva policyen egentlig signaliserer om Anthropics posisjon på modellvelferd. Selskapets egen formulering – at det er «svært usikkert» på modellenes moralske status, men samtidig innfører en beskyttelsesregel – kan leses som et varsomt posisjonsskifte, eller som en sikkerhets- og omdømmemessig forholdsregel. Hvilken lesning som stemmer, er tolkning, ikke fastslått faktum.

Det som er fastslått, er det konkrete: Fra 12. november står det i Anthropics bruksvilkår at man skal la være å behandle Claude grusomt – uten at noen, heller ikke Anthropic, vet sikkert om det gjør noe konkret for Claude.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.