Avatar

Imponerende KI-resultater må stresstestes i virkeligheten

Store språkmodeller scorer nå nær perfekt på medisinske eksamener. Det brukes ofte som argument for at de snart er klare for klinisk bruk. OpenAI tilbyr ChatGPT Health i USA. Dette program skal veilede pasienter om medisinske problemstillinger. Samtidig er det anekdotisk bevis for at det kanskje heller er villedende.

Studien til Bean et al. i Nature Medicine undersøker hvor godt lekfolk klarer å besvare medisinske spørsmål når de bruker KI.

Da modellene ble testet alene på kliniske scenarier, identifiserte de relevante tilstander i over 90 % av tilfellene. Men da virkelige mennesker tok modellene i bruk, falt prestasjonen dramatisk. Brukerne gjorde det ikke bedre enn kontrollgruppen – og i identifikasjon av relevante tilstander var de faktisk dårligere. Konklusjonen er at modellene er ikke klare for direkte pasientbruk.

Menneske + KI ≠ bedre resultat

Et av de mest interessante funnene er at LLM alene presterte bedre enn LLM brukt av mennesker. Vi ka altså ikke automatisk forvente synergieffekt av bruk av KI.

Problemet ligger i interaksjonen:

Da blir slutningen feil.

I min artikkel i Tidsskriftet argumenterer jeg for at vi i fremtiden må bli flinkere til å jobbe med KI. Jeg gir et eksempel på hvordan KI kan brukes effektivt i virkeligheten – men det forutsetter forståelse, opplæring og riktig design.

Andre utfordringer

Små variasjoner i hvordan symptomer ble formulert kunne resultere i endrede råd – fra “legg deg i et mørkt rom” til “søk akutt hjelp”.

I tillegg peker forfatterne på at utviklere kan ha insentiv til å gjøre modellene risikoaverse. Selv små forskyvninger i triageråd kan få systemeffekter dersom millioner bruker slike verktøy.

Det kan gå ut over pasienters helse og det kan resultere i at helsetjenesten ikke blir bærekraftig. Det kan altså virke mot sin hensikt å ukritisk be pasienter bruke nåværende KI modeller.

← Tilbake til forsiden |