Et stort steg nærmere trygg og enkel anonymisering av journaldata
Anonymisering av pasientjournaler er et av de store hindrene for å kunne bruke helsedata til forskning i stor skala. Lovverk som GDPR og Helseregisterloven setter strenge krav – med god grunn – men konsekvensen er ofte at datadeling blir vanskelig, ressurskrevende og lite tilgjengelig for mindre forskningsmiljøer. Den nylig publiserte studien “Deidentifying Medical Documents with Local, Privacy-Preserving Large Language Models” i NEJM AI markerer derfor et viktig gjennombrudd.

Forskere ved TU Dresden har utviklet et verktøy kalt LLM-Anonymizer, som bruker åpne, lokalt kjørbare språkmodeller (LLMs) til å fjerne personidentifiserbar informasjon fra fritekst i medisinske dokumenter. Verktøyet er gratis, krever ingen programmeringskunnskap og kan kjøres på lokal maskinvare – altså en lavterskel-løsning med stor praktisk nytteverdi. Kildekoden er tilgjengelig på GitHub, og selve artikkelen kan leses her (betalingsmur).
Modellen som presterte best i studien – Llama-3 70B – klarte å anonymisere 99,24 % av personidentifiserende teksttegn. Den bommet på kun 0,76 %, og fjernet samtidig 2,43 % tekst som ikke var nødvendig å fjerne. Dette er imponerende tall, og langt bedre enn mange eksisterende kommersielle verktøy. Samtidig må det nevnes at modellen fortsatt feiler på enkelte punkter, særlig når det gjelder små feil i navn (f.eks. stavefeil i originale tekster), og det forekommer altså falske positiver – der informasjon som ikke er sensitiv, blir fjernet unødvendig.
Et viktig, men underdiskutert poeng i artikkelen, er faren for at tekst kan bli utilsiktet endret når man bruker språkmodeller. I jakten på å identifisere og fjerne sensitiv informasjon, risikerer man at betydningen av enkelte setninger endres. Det kan være et problem når tekstene skal brukes til forskningsformål der presisjon er avgjørende. Dette aspektet nevnes ikke eksplisitt i studien, men bør definitivt være et tema for videre forskning og forbedring av pipeline.
Likevel representerer dette et klart gjennombrudd. Et lokalt, åpent og effektivt anonymiseringsverktøy som fungerer godt uten behov for stor teknisk kompetanse, kan være et viktig steg mot mer tilgjengelig og rettferdig medisinsk forskning. Samtidig minner det oss om at selv de beste automatiserte løsningene fortsatt trenger manuell kontroll og kritisk vurdering – i hvert fall for nå.