98 pasienter møtte Google AMIE før legetimen – ingen sikkerhetshendelser, men én hallusinasjon

En AI-chatbot ble for første gang testet med ekte pasienter i en vanlig primærleges arbeidsflyt, ifølge forskerne selv – og det gikk uten sikkerhetsstopp. Men tilliten til chatboten hang på én ting: at legen overtok etterpå.

Illustrasjon: En hvit kule ligger på en klinikkbenk i lampens lys, med en tom lege stol i skyggen like bak – AI-førsteintak etterfulgt av menneskelig overtagelse.
Illustrasjon
Gi artikkelen

98 pasienter møtte Google AMIE før legetimen – ingen sikkerhetshendelser, men én hallusinasjon

En AI-chatbot ble for første gang testet med ekte pasienter i en vanlig primærleges arbeidsflyt, ifølge forskerne selv – og det gikk uten sikkerhetsstopp. Men tilliten til chatboten hang på én ting: at legen overtok etterpå. Studien, publisert i The Lancet, målte gjennomførbarhet – ikke helsegevinster.

Hva som er nytt

Forskere ved Beth Israel Deaconess Medical Center (BIDMC) i Boston har gjennomført det de selv beskriver som den første prospektive virkelighetsstudien av et pasientrettet samtale-AI-system i primærhelsetjenesten. Funnene er publisert i tidsskriftet The Lancet (BIDMC/Newswise). The New York Times, som dekket studien 8. oktober 2026, omtaler den som «first-of-its-kind» (NYT).

«Første»-kravet bør håndteres med presisjon: Det er forskernes egen antakelse, ikke en uavhengig verifisert rangordning. Det som uansett er bemerkelsesverdig, er formatet – pasienter brukte systemet hjemmefra, i forkant av en ekte hastetime hos fastlegen, i stedet for at systemet bare ble testet mot simuleringer.

Systemet i spørsmålet er Articulate Medical Intelligence Explorer (AMIE), en medisinsk chatbot utviklet i samarbeid mellom BIDMC-forskerne og Google. AMIE er fortsatt et eksperimentelt forskningssystem fra Google Research og Google DeepMind og er ikke tatt i bruk i klinisk drift (Cryptobriefing).

Opplegget: fra stua til hastetime

Studien ble gjennomført mellom april og november 2025. 114 pasienter ble innrullet, og 98 av dem fullførte både AI-samtalen og den påfølgende timen hos primærlegen (BIDMC/Newswise). Sekundære kilder omtaler tallet ulikt – «nearly 100» hos NYT, «100 real adults» hos Cryptobriefing – men pressevedleggets 114/98 er det mest presise.

Sikkerhetsoppfølgingen var streng. Hver samtale ble overvåket i sanntid av en spesialist i indremedisin med board-sertifisering, som kunne gripe inn hvis pasienten virket i faresonen, opplevde betydelig følelsesmessig distress, ba om å avslutte økten, eller hvis legen identifiserte en potensiell sikkerhetsbekymring – for eksempel behov for å klargjøre symptomer, gi akutthjelpsinstruksjoner eller håndtere bekymring for en alvorlig mulig diagnose.

Sikkerhetsresultatene

På tvers av alle 98 fullførte forløp krevde ingen samtaler sikkerhetsstopp. Overvåkende leger identifiserte én hallusinasjon og ga ytterligere klinisk avklaring i fem tilfeller (BIDMC/Newswise).

Det er gode tall for et system som snakket direkte med pasienter om symptomer – men de må leses i lys av opplegget: en lege satt med på hver eneste samtale og kunne stoppe alt når som helst. Resultatet viser at overvåket drift kan gjennomføres trygt, ikke at systemet er trygt uten tilsyn.

Hva legene fikk ut av det

Primærlegene fikk mulighet til å lese et AI-generert referat eller sammendrag før timen i 44 av tilfellene. I 75 prosent av tilfellene sa legene at dette hjalp dem med å forberede seg, og i 57 prosent av tilfellene rapporterte de at det muligens hadde påvirket deres kliniske tilnærming (BIDMC/Newswise). NYT oppgir tilsvarende tall og siteter resident Peter Brodeur, som sammenlignet chatboten med en meget dyktig medisinstudent eller resident (NYT).

Det finnes også et negativt tilfelle. I én eneste situasjon rapporterte en behandler at interaksjonen var «noe skadelig», med henvisning til bekymring for at en pasient kan ha blitt angst etter at AMIE nevnte lymfom blant mulige diagnoser (BIDMC/Newswise). Det er et enkelttilfelle – men det peker på en reell mekanisme: En samtale-AI som eksplisitt ramser opp alvorlige diagnoser, formidler informasjon til pasienten uten klinisk ramme rundt den.

Pasientenes tvilspunkter

Pasientene ga chatboten gode vurderinger på evnen til å lytte, forklare informasjon og skape ro. Men to områder skilte seg negativt ut: tillit til konfidensialiteten av informasjon som ble delt med systemet, og tillit til chatbotens ærlighet og troverdighet (BIDMC/Newswise).

Adam Rodman, indremedisiner og medisinhistoriker ved Beth Israel som bidro til å gjennomføre studien, satte ord på hvor tilliten faktisk lå: «Ingen av pasientene våre stolte på den før de forsto at den overleverte til legen deres», sa han til NYT (NYT). Det er kanskje studiens viktigste funn: Chatboten ble akseptert ikke som selvstendig aktør, men som forlengelse av en tillitsrelasjon som allerede fantes – relasjonen til fastlegen.

Hvor nøyaktig var AMIE?

Det finnes også tall på diagnostisk nøyaktighet, men de stammer ikke fra pressevedlegget og kan ikke verifiseres mot selve Lancet-artikkelen basert på det tilgjengelige kildematerialet. Cryptobriefing rapporterer at nøyaktigheten ble målt etter en åtte ukers gjennomgang av pasientjournaler, som ga legene tid til å bekrefte hva pasientene faktisk led av: Riktig diagnose var i AMIEs topp-7-differensial i 90 prosent av tilfellene, i topp-3 i 75 prosent, og som topp-1-kandidat i 56 prosent (Cryptobriefing). Tallene bør altså leses med det forbeholdet at de foreløpig bare er dokumentert gjennom sekundær dekning.

Viktige forbehold

Forskerne understreker selv det viktigste: Studien målte gjennomførbarhet, ikke helseutfall. Ingen del av studien kan si noe om pasientene ble friskere eller riktigere behandlet fordi AMIE var involvert.

Andre begrensninger: AMIE er fortsatt eksperimentelt, studien er gjennomført på ett enkelt sted med kontinuerlig legetilsyn, og pasientmaterialet på 98 fullførte forløp er lite. Og tallene i denne dekningen stammer fra pressevedlegg og sekundær rapportering – selve Lancet-artikkelen inngikk ikke i kildematerialet.

Det som gjenstår

Tre spørsmål står åpne. For det første: Kan resultatene replikeres på flere steder, med andre pasientpopulasjoner og uten det intensive sanntidstilsynet? For det andre: Om studien overhodet kan si noe om helseutfall over tid, er fortsatt utestående. For det tredje: Hvordan skal konfidensialitetsbekymringene og tillitsproblemene Rodman beskriver løses? Hvis pasientene bare aksepterer AI fordi en menneskelig lege står bak overleveringen, er det en svært begrensende betingelse for skalering.

Studien beviser ikke at AI-chatboter hører hjemme i primærhelsetjenesten. Den beviser noe smalere, men konkret: At testen kan gjennomføres i det hele tatt, trygt, med ekte pasienter, i en ekte arbeidsflyt. Det var premissen som måtte på plass før noen av de større spørsmålene kunne besvares.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.