AI-validering i pharma
Når 95 procent korrekt ikke er nok
Forestil dig dette: En AI-model gennemgår virksomhedens afvigelser og foreslår, hvilke sager der bør behandles først. Under valideringen klassificerer den 95 procent af sagerne korrekt. Men blandt de resterende fem procent overser den enkelte potentielt kritiske afvigelser.
Er modellen så god nok?
Det kan den samlede andel korrekte klassifikationer ikke besvare. Svaret afhænger af, hvordan outputtet bliver anvendt, hvilke fejl modellen begår, og om virksomheden kan opdage, hvis modellens performance forringes.
AI gør ikke de kendte principper for validering overflødige. Men valideringsopgaven bliver bredere: Ud over at dokumentere, at systemet er implementeret og fungerer som tiltænkt, skal virksomheden kunne dokumentere modellens performance og begrænsninger inden for en klart afgrænset anvendelse.
Den samme model kan indebære forskellig risiko
Valideringen begynder med at definere, hvilken opgave AI-systemet skal løse, og hvordan outputtet skal bruges.
Hvis modellen alene sorterer afvigelser til efterfølgende review, kan risikoen muligvis håndteres gennem menneskelig kontrol. Hvis den automatisk nedprioriterer eller afslutter sager, får den samme fejl en helt anden betydning.
Det afgørende er derfor ikke kun, hvilken teknologi virksomheden anvender. Det er, hvad der kan ske, hvis systemet tager fejl.
Det gælder også en AI-model, der skal forudsige fejl i produktionsudstyr. Hvis modellen giver vedligeholdelsesteamet et ekstra signal, er konsekvensen af et forkert output én. Hvis outputtet automatisk ændrer vedligeholdelsesintervaller eller påvirker procesbeslutninger, er risikoen en anden.
Den tiltænkte anvendelse – intended use – bliver dermed grundlaget for valideringens omfang, acceptkriterierne og de nødvendige kontroller.
95 procent korrekt kan være utilstrækkeligt
AI-modeller kan ikke altid valideres ved blot at sammenligne ét input med ét forventet output. For klassifikationsmodeller skal valideringen i stedet undersøge modellens performance på tværs af relevante datatyper, fejlscenarier og variationer.
I eksemplet med afvigelser er en samlet nøjagtighed (accuracy) på 95 procent ikke i sig selv tilstrækkelig. Nøjagtighed angiver den samlede andel korrekte klassifikationer, men skjuler, hvordan fejlene fordeler sig. Virksomheden kan derfor have brug for forskellige acceptkriterier for forskellige typer fejl.
En overset kritisk afvigelse er en falsk negativ. En mindre alvorlig sag, der fejlagtigt bliver eskaleret, er en falsk positiv. Begge dele er fejl, men konsekvenserne er ikke de samme.
Valideringen skal derfor kunne vise:
- hvilke fejl modellen begår
- hvor ofte de forskellige fejl forekommer
- under hvilke forhold de opstår
- hvilke fejl der kan påvirke patientsikkerhed, produktkvalitet eller dataintegritet
- hvordan fejlene opdages og håndteres
Afhængigt af anvendelsen kan relevante mål eksempelvis være sensitivitet, specificitet, nøjagtighed (accuracy), præcision (precision) eller F1-score. For en model, der skal opdage kritiske afvigelser, kan sensitiviteten over for netop disse sager være vigtigere end den samlede nøjagtighed.
Målet er ikke nødvendigvis at dokumentere, at modellen altid har ret. Det er at dokumentere, at dens performance og begrænsninger er acceptable til den konkrete anvendelse.
Hvis modellen erstatter en eksisterende proces, skal den ikke kun vurderes mod et abstrakt mål. Annex 22-udkastet lægger op til, at acceptkriterierne mindst skal svare til performance i den proces, modellen erstatter. Det forudsætter, at virksomheden først har dokumenteret, hvor godt den nuværende proces faktisk fungerer.
Testdata skal rumme de sjældne hændelser
En AI-models performance afhænger blandt andet af de data, den er udviklet, trænet og testet på. Derfor kan valideringen ikke begrænses til selve modellen.
Hvis kritiske afvigelser er sjældne i virksomhedens historiske data, kan modellen opnå en høj samlet nøjagtighed uden at være god til netop de hændelser, den vigtigst skal opdage.
Det er heller ikke tilstrækkeligt, at datasættet er stort. Det skal afspejle de produkter, processer, variationer og fejltyper, som modellen vil møde i praksis. Relevante undergrupper og sjældne, men betydningsfulde hændelser skal være repræsenteret i et omfang, der gør det muligt at vurdere modellens performance med tilstrækkelig sikkerhed.
Virksomheden skal derfor kunne redegøre for, hvor dataene kommer fra, hvordan de er blevet behandlet, og hvordan testdata er holdt uafhængige af de data og aktiviteter, der blev brugt til at udvikle, træne og optimere modellen. Ellers risikerer man at teste modellen på data, som allerede har påvirket dens udvikling, og dermed få et for positivt billede af dens evne til at håndtere nye data.
Sporbarheden bør omfatte både data, modelversion og konfiguration. I praksis er det nemlig ikke kun modellen, der skal vurderes, men den samlede anvendelse: model, dataflow, brugergrænseflade, kontroller og arbejdsgange.
Modellen kan være den samme, mens virkeligheden ændrer sig
En statisk model ændrer ikke automatisk sine parametre efter idriftsættelsen. Den kan derfor valideres i en defineret version med kendte testdata og acceptkriterier.
En dynamisk model lærer og tilpasser sig løbende og automatisk på baggrund af nye data under brug. Dermed kan dens adfærd ændre sig efter den oprindelige validering.
Men selv en statisk model kan miste performance.
Forestil dig, at modellen til klassificering af afvigelser er valideret på data fra én produkttype. Senere bliver den anvendt på en ny proces med andre fejlmønstre, fagudtryk og registreringsrutiner. Modellen er ikke ændret, men de data, den møder, passer ikke længere lige så godt til valideringsgrundlaget.
Derfor bør overvågningen skelne mellem to situationer:
- Modellen ændrer sig gennem en ny version, konfiguration eller automatisk tilpasning.
- Anvendelsen eller inputdata ændrer sig, så de bevæger sig væk fra modellens intended use og valideringsgrundlag.
Begge dele kan give behov for review, change control eller hel eller delvis revalidering.
Det kræver, at virksomheden på forhånd har defineret, hvilke performancemål og egenskaber ved inputdata der skal overvåges, og hvornår modellen skal undersøges, begrænses eller tages ud af drift.
Menneskelig kontrol kan være en vigtig sikkerhedsforanstaltning, men kun hvis kontrollen er reel. Revieweren skal kende modellens begrænsninger, have adgang til det nødvendige beslutningsgrundlag og vide, hvilke output der kræver særlig opmærksomhed. Det skal samtidig være klart, hvilket ansvar der ligger hos henholdsvis systemet og den medarbejder, der gennemgår resultatet.
Annex 22 er fortsat et udkast
EU-Kommissionen offentliggjorde i juli 2025 et udkast til et nyt GMP Annex 22 om brug af AI i fremstilling af lægemidler og aktive stoffer. Høringen sluttede den 7. oktober 2025.
Udkastet lægger blandt andet vægt på:
- klart defineret intended use
- anvendelsesafhængige performancemål og acceptkriterier
- repræsentative testdata, der omfatter relevante undergrupper samt almindelige og sjældne variationer
- uafhængighed, adgangskontrol og sporbarhed for testdata
- dokumentation og kontrol med model, system, proces og ændringer
- løbende overvågning af modelperformance og ændringer i inputdata
- procedurer for menneskeligt review i de situationer, hvor en model understøtter en menneskelig beslutning
Udkastet omfatter statiske AI/ML-modeller, der giver samme output ved identiske input. Dynamiske modeller, som kontinuerligt og automatisk lærer under brug, er ikke omfattet og bør ifølge udkastet ikke anvendes i kritiske GMP-applikationer.
Det samme gælder modeller, der kan give forskellige output ved identiske input. Udkastet kalder disse modeller med “probabilistisk output”. Det skal ikke forveksles med, at en deterministisk klassifikationsmodel kan levere en sandsynligheds- eller confidence-score som en del af sit output.
Generativ AI og store sprogmodeller er heller ikke omfattet og bør ifølge udkastet ikke anvendes i kritiske GMP-applikationer. Ved anvendelse i ikke-kritiske GMP-processer bør kvalificeret personale kontrollere, at outputtet er egnet til den tiltænkte anvendelse.
Annex 22 er fortsat et udkast og er ikke et gældende GMP-krav. Pr. 23. september 2026 er der ikke offentliggjort en endelig version eller en forventet ikrafttrædelsesdato. Indhold og afgrænsninger kan derfor blive ændret. Udkastet viser dog en tydelig regulatorisk retning, hvor intended use, testdata, performance, risici og overvågning skal hænge dokumenteret sammen gennem systemets livscyklus.
Kilder: EU-Kommissionens konsultation om Chapter 4, Annex 11 og Annex 22 og udkastet til Annex 22.
AI ændrer altså ikke behovet for validering. Men valideringsobjektet bliver bredere: Virksomheden skal kunne forbinde intended use, datagrundlag, performance, risici og overvågning gennem hele systemets livscyklus.
Spørgsmålet er derfor ikke kun, om modellen virkede, da den blev godkendt; men om du fortsat kan dokumentere, at den virker, når den bliver en del af den virkelige GxP-proces.
Læs mere:
Kontakt
Få hjælp nu
Find relevante, kvalitetssikrede kurser og efteruddannelse.