Avatar

ChatGPT-4 presterer dårligere enn leger i komplekse medisinske eksamener

En nylig studie publisert i BMJ Open av Arvidsson et al. har evaluert ytelsen til GPT-4, en avansert språkmodell, i medisinske eksamensscenarier som krever fritekstsvar. Resultatene viser at GPT-4 presterer dårligere enn leger, spesielt i oppgaver som innebærer å foreslå relevante diagnoser, laboratorietester, fysiske undersøkelser, henvisninger og håndtering av juridiske spørsmål. Dette står i kontrast til tidligere studier hvor språkmodeller har vist lovende resultater i flervalgseksamener.

Forfatterne uttrykker bekymring for at GPT-4s mangler i disse kritiske områdene kan være problematiske for allmennleger som benytter modellen for veiledning, samt for pasienter som stoler på slike teknologier i medisinske beslutningsprosesser. Selv om en oppdatert versjon, ChatGPT-4o, viser noen forbedringer, er den fortsatt betydelig dårligere enn menneskelige leger.

Disse funnene understreker viktigheten av menneskelig tilstedeværelse i medisinsk beslutningstaking og behovet for videre forskning på medisinske chatboter. Fremtidige studier bør fokusere på å evaluere nye modeller basert på representative spørsmål fra klinikere og pasienter i reelle kliniske settinger.

Det er avgjørende å erkjenne at selv om språkmodeller har potensial til å støtte medisinsk praksis, er de per i dag ikke i stand til å erstatte den kliniske dømmekraften og erfaringen som menneskelige leger besitter. Integrering av slike teknologier bør derfor skje med forsiktighet, med vekt på å supplere snarere enn å erstatte menneskelig ekspertise.

For mer detaljert informasjon, se den fullstendige studien: bmjopen.bmj.com

← Tilbake til forsiden |