OpenAIs MentalHealthBench: frontier-modeller under 60 prosent
OpenAI lanserte 23. september 2026 MentalHealthBench, et åpent evalueringsdatasett med 1 215 syntetiske samtaler om psykisk helse, utviklet med over 80 autoriserte psykologer og psykiatere fra 22 land.

Illustrasjon: AIMag.no, AI-bearbeidet etter «Stethoscope and globe on light blue background (52102422083)» av Jernej Furman from Slovenia, CC BY 2.0.
OpenAIs MentalHealthBench: frontier-modeller under 60 prosent
OpenAI lanserte 23. september 2026 MentalHealthBench, et åpent evalueringsdatasett med 1 215 syntetiske samtaler om psykisk helse, utviklet med over 80 autoriserte psykologer og psykiatere fra 22 land. Firmaets egne resultater viser at selv frontier-modeller bare skårer i tidlig til midtre 50-tallet prosent – og den største svakheten ligger i metoden: Vurderingene utføres av en OpenAI-modell.
Hva som er nytt
MentalHealthBench er beskrevet som et åpent evalueringsdatasett som skal måle hvor godt AI-systemer håndterer virkelige situasjoner – fra hverdagslige velvære-samtaler til akutte psykiske helsekriser. Ifølge NewsBytes, som omtalte lanseringen 24. september, er benchmarken utviklet i samarbeid med over 80 autoriserte psykologer og psykiatere fra 22 land, som dekker nesten 20 subspesialiteter innen psykisk helse. En japansk oppsummering av kunngjøringen, datert 24. september, bekrefter utgivelsesdatoen 23. september 2026, og en daglig nyhetsoppsummering 25. september oppgir i tillegg at fagfolkene representerer 19 språk.
Alt innholdet er syntetisk: 1 215 konstruerte samtaler, ikke ekte brukerlogger. Datasettet er delt inn i tre alvorlighetsgrader – ikke-akutte samtaler (53,5 prosent), høy-akutte (18,2 prosent) og fremvoksende (28,3 prosent) – og dekker fire brukerprofiler: voksne (68,1 prosent), ungdom (21,2 prosent), klinikere (5,8 prosent) og pårørende (4,9 prosent). Ifølge den japanske oppsummeringen tester benchmarken ikke bare sikkerhet, men også evnen til å stille passende oppfølgingsspørsmål, respektere brukerens autonomi og gi handlingsrettet rådgivning.
Hele utgivelsen inneholder 5 262 ekspertforfattede vurderingskriterier, og OpenAI har ifølge NewsBytes gjort benchmarken offentlig tilgjengelig slik at andre forskere kan gå gjennom metodene, utføre egne evalueringer og bygge videre på arbeidet.
Hvordan scoringen fungerer
Metodologien, slik NewsBytes beskriver den fra OpenAIs utgivelse, har flere lag:
Hver samtale ble gjennomgått av minst tre eksperter i en trinnvis prosess. To klinikere skrev uavhengig av hverandre vektede kriterier, som deretter ble vurdert og justert av en tredje ekspert. Kun kriterier som minst to eksperter var enige om, og som ikke ble motsagt av en tredje, ble beholdt. Hvert kriterium retter seg mot én enkelt side av modellens svar, med vekter fra −10 til +10 som indikerer klinisk betydning i samtalen.
Selve scoringen utføres av en automatisert grader: GPT-5.6 Sol ved høy resonneringsinnsats, som evaluerer hvert modelsvar mot ekspertkriteriene med fire uavhengig samplede fullføringer per oppgave. Poengene rapporteres som såkalte task-clipped rubric-poeng og kan brytes ned på ti ekspertdefinerte atferdsakser, blant annet kontekstsøking, empati, urgenskalibrering og realitetstesting.
Slik er benchmarken bygget for å fange mer enn ja/nei-sikkerhet: samme samtale kan gi poeng både for å innhente nok kontekst, for å kalibrere hvor hastefullt modellen reagerer, og for å gi råd som faktisk kan følges.
Resultatene OpenAI selv rapporterer
Tallene kommer fra OpenAIs egen utgivelse, gjengitt av NewsBytes og TechRepublic 24. og 25. september:
- GPT-6 Astra: 57,3 prosent – høyest blant de testede modellene
- GPT-6 Sol: 53,9 prosent
- Claude Opus 5.5 (Anthropic): 52,4 prosent
- GPT-4o: 32,1 prosent – en eldre modell som kom klart bak
TechRepublic oppsummerer funnet som at frontier-modellene viser bemerkelsesverdige hull i hvordan de søker kontekst og vurderer urgens. Det er verdt å merke seg at de tilgjengelige kildene ikke oppgir spesifikke tall per akse for hvor store disse gapene er – karakteriseringen stammer fra TechRepublics omtale av resultatene.
Det enkle bildet er likevel tydelig: Den beste modellen skårer 57,3 prosent på en skala der 100 prosent tilsvarer full samsvar med ekspertenes kriterier. Ingen modell nærmer seg noe man kunne kalle klinisk pålitelighet, og avstanden mellom nyeste generasjon (52–57 prosent) og GPT-4o (32,1 prosent) antyder at feltet har beveget seg raskt – men fortsatt har langt igjen.
Brukere vil ha raske råd, klinikere vil stille spørsmål
OpenAI publiserte også en undersøkelse av 44 voksne som har brukt AI for emosjonell støtte. TechRepublic beskriver funnet som en institusjonell kløft: Mens klinikere la vekt på forsiktig kontekstinnhenting og langsom vurdering, ønsket vanlige brukere raske, praktiske neste steg og en empatisk samtale.
Denne spenningen er ikke tilfeldig i forhold til benchmarkens design. De ti atferdsaksene inkluderer både kontekstsøking (å stille nok spørsmål før man handler) og handlingsrettet rådgivning – to mål som kan trekke i hver sin retning. En modell som scorer godt på å innhente kontekst kan virke forsinkende for en bruker i nød; en modell som gir raske råd kan overse farlig kontekst. Undersøkelsen antyder at OpenAI er klar over at den kliniske standarden og brukerforventningene ikke nødvendigvis peker samme vei.
Begrensningene: hvem holder målebåndet?
Det mest prinsipielle spørsmålet ved MentalHealthBench er uavhengigheten. Alle rapporterte poeng er produsert av GPT-5.6 Sol – en OpenAI-modell – som vurderer svar mot kriterier i en utgivelse publisert av OpenAI. Ingen tredjepartsreplikasjon er dokumentert i det tilgjengelige kildematerialet. Benchmarken er i hvert fall åpen, slik at andre forskere i prinsippet kan kjøre sine egne evalueringer; om noen gjør det, og om resultatene da stemmer overens, er et åpent spørsmål.
En annen begrensning gjelder gyldigheten i virkeligheten. TechRepublic peker på at poengene ikke viser hvor ofte en modell faktisk hjelper noen i en ekte psykisk helse-samtale. Datasettet består av syntetiske samtaler skrevet for testformål, og den japanske oppsummeringen noterer en eksplisitt begrensning fra kunngjøringen: ett enkelt poeng kan ikke representere kvaliteten på alle konsultasjoner, som omfatter kulturelle og individuelle forskjeller.
OpenAIs egen ramme er også verdt å merke seg. Dr. Declan Grabb, leder for selskapets forskning på psykisk helse-sikkerhet, sa til The Deep View: «ChatGPT er ikke en terapeut, og er ikke her for å erstatte en kliniker.»
Hvorfor det betyr noe
MentalHealthBench er først og fremst et måleverktøy, ikke et sikkerhetssertifikat. Det den dokumenterer, er at selv med over 80 kliniske eksperter og over 5 000 vektede kriterier måles frontier-modellenes evne til å føre en god psykisk helse-samtale i tidlig til midtre 50-tallet prosent – ifølge selskapet som bygde testen.
For brukere av AI-chatboter er den praktiske konklusjonen enkel: heller ikke de beste modellene håndterer disse samtalene pålitelig nok til å erstatte klinisk vurdering, noe Grabbs utsagn bekrefter. For bransjen er den interessante delen metodologien – en åpen, ekspertbygd standard for en arena der skade- og nyttepotensialet er høyt. Og for dem som følger med på AI-selskapers selvevaluering, er saken et kasuseksempel i begge retninger: et reelt forsøk på åpenhet med ekspertinvolering, og samtidig en påminnelse om at når målebåndet er hjemmelaget, er resultatene best lest som selskapets egen rapportering – ikke som uavhengig verifikasjon.
Kilder
- OpenAI Mental Health AI Test Finds Context and Urgency Gaps — www.techrepublic.com
- [AI News 2026/09/25] OpenAI's AI accesses Australian government site without authorization|柴葉 剛|小説を書く人 — note.com
- OpenAI's new benchmark assesses AI's mental health conversation skills — www.newsbytesapp.com
- OpenAI Releases 'MentalHealthBench' to Measure AI Mental Health Responses, and More | AI News Summary for September 24, 2026|シン| AIに興味のある休職者 — note.com