OpenAI har lansert MentalHealthBench, en åpen testmetode for å evaluere hvordan språkmodeller svarer på samtaler om psykisk helse. Målet er å måle mer enn om en modell unngår åpenbart farlige svar: Den skal også undersøke om KI spør om relevant bakgrunnsinformasjon, respekterer brukerens selvbestemmelse og gir praktiske råd når situasjonen tilsier det.
Datasettet består av 1 215 syntetiske samtaler og 5 262 vurderingspunkter skrevet av fagfolk. Samtalene dekker alt fra hverdagsstress og relasjonsproblemer til alvorlig psykisk ubehag og akutte kriser. Testen omfatter voksne, tenåringer mellom 13 og 17 år, pårørende og klinikere, og kriteriene er utviklet i samarbeid med over 80 autoriserte psykologer og psykiatere fra 22 land.
Hver samtale er gjennomgått av minst tre eksperter. Kriterier som fikk støtte fra minst to, og ikke ble motsagt av den tredje, ble beholdt. Positive handlinger gir poeng, mens mulige skadelige svar trekker ned. Selve vurderingen av modellsvarene gjøres automatisk av GPT-5.6 Sol mot de ekspertutformede kriteriene.
I OpenAIs egne resultater fikk GPT-6 Astra høyest samlet poengsum, med 57,3 prosent. GPT-6 Sol fulgte med 53,9 prosent, mens Claude Opus 5.5 fikk 52,4 prosent. Tallene viser framgang sammenlignet med eldre modeller, men også at ingen av de evaluerte modellene oppnår en perfekt score i situasjoner hvor feil svar kan få alvorlige konsekvenser.
En separat brukerundersøkelse med 44 voksne som tidligere hadde brukt KI til emosjonell støtte, viste dessuten et skille mellom hva brukerne opplever som hjelpsomt og hva ekspertene prioriterer. Brukerne la relativt større vekt på tone og konkrete neste steg, mens ekspertene oftere vektla innhenting av kontekst og varsom tolkning av uklare situasjoner.
MentalHealthBench kan gjøre sammenligninger mellom modeller mer etterprøvbare, særlig på et område der generelle helsetester tidligere har hatt begrenset dekning av psykisk helse. Samtidig er testen ikke en klinisk godkjenning. En nyere fagfellevurdert studie av en annen testmetode advarer blant annet om at KI-dommere kan overvurdere modellsvar og overse sikkerhetsbekymringer som menneskelige eksperter fanger opp.
OpenAI understreker at ChatGPT ikke er en erstatning for terapi eller profesjonell helsehjelp. Den viktigste verdien av den nye testen ligger derfor i å avdekke svakheter, heve kravene til utviklerne og gjøre det lettere for forskere å etterprøve påstander om trygg KI-støtte i sårbare samtaler.