Avatar

Automation bias: når trening ikke er nok

Et nytt enkelt-blindet randomisert studie bidrar med interessant ny viten. Leger som hadde gjennomgått 20 timers KI-opplæring – inkludert prompt engineering og kritisk vurdering av KI-generert output – viste seg likevel å være sårbare for automation bias når de brukte store språkmodeller som beslutningsstøtte [1].

44 leger ble randomisert i et enkelt-blindet design til å diagnostisere seks kliniske vignetter. Kontrollgruppen mottok umodifiserte anbefalinger fra ChatGPT-4o, mens intervensjonsgruppen fikk anbefalinger der feil bevisst var lagt inn i tre av seks caser. Deltakerne var blindet for studiens spesifikke formål.

Leger som ble eksponert for feilaktige anbefalinger, oppnådde en gjennomsnittlig diagnostisk nøyaktighet på 73 prosent, sammenlignet med 85 prosent i kontrollgruppen – en justert forskjell på 14 prosentpoeng.

Hyppige KI-brukere – de som brukte KI ukentlig eller mer – viste størst prestasjonsnedgang. Dette antyder at vanebruk av KI kan fostre kognitiv avhengighet som svekker kritisk vurdering av maskinens anbefalinger.

Automation bias kan forsterkes av kognitiv avlasting – der klinikere ubevisst reduserer sin egen kognitive innsats når de får en ferdig løsning fra maskinen.

Hva betyr dette i praksis? Det betyr at vi ikke kan slå oss til ro med at KI-opplæring er et tilstrekkelig sikkerhetstiltak. Trening øker ikke nødvendigvis motstandsdyktigheten mot bias – den kan til og med gi en falsk trygghet. Det minner oss om at problemet ikke bare er hos brukeren, men i møtet mellom menneskelig kognisjon og et overbevisende system.

Utviklere av LLM-løsninger i helsevesenet argumenterer gjerne for at “human-in-the-loop” er tilstrekkelig sikkerhet. Men når mennesker konsekvent følger maskinens vei med minst kognitiv motstand, holder ikke dette argumentet.

Dette stiller høye krav til oss som leger, men enda høyere krav til dem som utvikler og godkjenner beslutningsstøtteverktøy. CE-merking, klinisk validering og transparens om feilrater er nødvendige forutsetninger for trygg implementering.

Referanse

Automation Bias in Large Language Model Assisted Diagnostic Reasoning Among AI-Trained Physicians. NEJM AI. https://ai.nejm.org/doi/full/10.1056/AIoa2501001

← Tilbake til forsiden |