AI-validering i pharma

Når 95 procent korrekt ikke er nok

AI-modellers performance afhænger af både data og anvendelse – og kan blive dårligere, hvis virkeligheden ændrer sig. Det stiller særlige krav til testdata, acceptkriterier og overvågning i GxP-processer.

Forestil dig dette: En AI-model gennemgår virksomhedens afvigelser og foreslår, hvilke sager der bør behandles først. Under valideringen klassificerer den 95 procent af sagerne korrekt. Men blandt de resterende fem procent overser den enkelte potentielt kritiske afvigelser.

Er modellen så god nok?

Det kan den samlede andel korrekte klassifikationer ikke besvare. Svaret afhænger af, hvordan outputtet bliver anvendt, hvilke fejl modellen begår, og om virksomheden kan opdage, hvis modellens performance forringes.

AI gør ikke de kendte principper for validering overflødige. Men valideringsopgaven bliver bredere: Ud over at dokumentere, at systemet er implementeret og fungerer som tiltænkt, skal virksomheden kunne dokumentere modellens performance og begrænsninger inden for en klart afgrænset anvendelse.

Den samme model kan indebære forskellig risiko

Valideringen begynder med at definere, hvilken opgave AI-systemet skal løse, og hvordan outputtet skal bruges.

Hvis modellen alene sorterer afvigelser til efterfølgende review, kan risikoen muligvis håndteres gennem menneskelig kontrol. Hvis den automatisk nedprioriterer eller afslutter sager, får den samme fejl en helt anden betydning.

Det afgørende er derfor ikke kun, hvilken teknologi virksomheden anvender. Det er, hvad der kan ske, hvis systemet tager fejl.

Det gælder også en AI-model, der skal forudsige fejl i produktionsudstyr. Hvis modellen giver vedligeholdelsesteamet et ekstra signal, er konsekvensen af et forkert output én. Hvis outputtet automatisk ændrer vedligeholdelsesintervaller eller påvirker procesbeslutninger, er risikoen en anden.

Den tiltænkte anvendelse – intended use – bliver dermed grundlaget for valideringens omfang, acceptkriterierne og de nødvendige kontroller.

95 procent korrekt kan være utilstrækkeligt

AI-modeller kan ikke altid valideres ved blot at sammenligne ét input med ét forventet output. For klassifikationsmodeller skal valideringen i stedet undersøge modellens performance på tværs af relevante datatyper, fejlscenarier og variationer.

I eksemplet med afvigelser er en samlet nøjagtighed (accuracy) på 95 procent ikke i sig selv tilstrækkelig. Nøjagtighed angiver den samlede andel korrekte klassifikationer, men skjuler, hvordan fejlene fordeler sig. Virksomheden kan derfor have brug for forskellige acceptkriterier for forskellige typer fejl.

En overset kritisk afvigelse er en falsk negativ. En mindre alvorlig sag, der fejlagtigt bliver eskaleret, er en falsk positiv. Begge dele er fejl, men konsekvenserne er ikke de samme.

Valideringen skal derfor kunne vise:

  • hvilke fejl modellen begår
  • hvor ofte de forskellige fejl forekommer
  • under hvilke forhold de opstår
  • hvilke fejl der kan påvirke patientsikkerhed, produktkvalitet eller dataintegritet
  • hvordan fejlene opdages og håndteres

Afhængigt af anvendelsen kan relevante mål eksempelvis være sensitivitet, specificitet, nøjagtighed (accuracy), præcision (precision) eller F1-score. For en model, der skal opdage kritiske afvigelser, kan sensitiviteten over for netop disse sager være vigtigere end den samlede nøjagtighed.

Målet er ikke nødvendigvis at dokumentere, at modellen altid har ret. Det er at dokumentere, at dens performance og begrænsninger er acceptable til den konkrete anvendelse.

Hvis modellen erstatter en eksisterende proces, skal den ikke kun vurderes mod et abstrakt mål. Annex 22-udkastet lægger op til, at acceptkriterierne mindst skal svare til performance i den proces, modellen erstatter. Det forudsætter, at virksomheden først har dokumenteret, hvor godt den nuværende proces faktisk fungerer.

Testdata skal rumme de sjældne hændelser

En AI-models performance afhænger blandt andet af de data, den er udviklet, trænet og testet på. Derfor kan valideringen ikke begrænses til selve modellen.

Hvis kritiske afvigelser er sjældne i virksomhedens historiske data, kan modellen opnå en høj samlet nøjagtighed uden at være god til netop de hændelser, den vigtigst skal opdage.

Det er heller ikke tilstrækkeligt, at datasættet er stort. Det skal afspejle de produkter, processer, variationer og fejltyper, som modellen vil møde i praksis. Relevante undergrupper og sjældne, men betydningsfulde hændelser skal være repræsenteret i et omfang, der gør det muligt at vurdere modellens performance med tilstrækkelig sikkerhed.

Virksomheden skal derfor kunne redegøre for, hvor dataene kommer fra, hvordan de er blevet behandlet, og hvordan testdata er holdt uafhængige af de data og aktiviteter, der blev brugt til at udvikle, træne og optimere modellen. Ellers risikerer man at teste modellen på data, som allerede har påvirket dens udvikling, og dermed få et for positivt billede af dens evne til at håndtere nye data.

Sporbarheden bør omfatte både data, modelversion og konfiguration. I praksis er det nemlig ikke kun modellen, der skal vurderes, men den samlede anvendelse: model, dataflow, brugergrænseflade, kontroller og arbejdsgange.

Modellen kan være den samme, mens virkeligheden ændrer sig

En statisk model ændrer ikke automatisk sine parametre efter idriftsættelsen. Den kan derfor valideres i en defineret version med kendte testdata og acceptkriterier.

En dynamisk model lærer og tilpasser sig løbende og automatisk på baggrund af nye data under brug. Dermed kan dens adfærd ændre sig efter den oprindelige validering.

Men selv en statisk model kan miste performance.

Forestil dig, at modellen til klassificering af afvigelser er valideret på data fra én produkttype. Senere bliver den anvendt på en ny proces med andre fejlmønstre, fagudtryk og registreringsrutiner. Modellen er ikke ændret, men de data, den møder, passer ikke længere lige så godt til valideringsgrundlaget.

Derfor bør overvågningen skelne mellem to situationer:

  • Modellen ændrer sig gennem en ny version, konfiguration eller automatisk tilpasning.
  • Anvendelsen eller inputdata ændrer sig, så de bevæger sig væk fra modellens intended use og valideringsgrundlag.

Begge dele kan give behov for review, change control eller hel eller delvis revalidering.

Det kræver, at virksomheden på forhånd har defineret, hvilke performancemål og egenskaber ved inputdata der skal overvåges, og hvornår modellen skal undersøges, begrænses eller tages ud af drift.

Menneskelig kontrol kan være en vigtig sikkerhedsforanstaltning, men kun hvis kontrollen er reel. Revieweren skal kende modellens begrænsninger, have adgang til det nødvendige beslutningsgrundlag og vide, hvilke output der kræver særlig opmærksomhed. Det skal samtidig være klart, hvilket ansvar der ligger hos henholdsvis systemet og den medarbejder, der gennemgår resultatet.

Annex 22 er fortsat et udkast

EU-Kommissionen offentliggjorde i juli 2025 et udkast til et nyt GMP Annex 22 om brug af AI i fremstilling af lægemidler og aktive stoffer. Høringen sluttede den 7. oktober 2025.

Udkastet lægger blandt andet vægt på:

  • klart defineret intended use
  • anvendelsesafhængige performancemål og acceptkriterier
  • repræsentative testdata, der omfatter relevante undergrupper samt almindelige og sjældne variationer
  • uafhængighed, adgangskontrol og sporbarhed for testdata
  • dokumentation og kontrol med model, system, proces og ændringer
  • løbende overvågning af modelperformance og ændringer i inputdata
  • procedurer for menneskeligt review i de situationer, hvor en model understøtter en menneskelig beslutning

Udkastet omfatter statiske AI/ML-modeller, der giver samme output ved identiske input. Dynamiske modeller, som kontinuerligt og automatisk lærer under brug, er ikke omfattet og bør ifølge udkastet ikke anvendes i kritiske GMP-applikationer.

Det samme gælder modeller, der kan give forskellige output ved identiske input. Udkastet kalder disse modeller med “probabilistisk output”. Det skal ikke forveksles med, at en deterministisk klassifikationsmodel kan levere en sandsynligheds- eller confidence-score som en del af sit output.

Generativ AI og store sprogmodeller er heller ikke omfattet og bør ifølge udkastet ikke anvendes i kritiske GMP-applikationer. Ved anvendelse i ikke-kritiske GMP-processer bør kvalificeret personale kontrollere, at outputtet er egnet til den tiltænkte anvendelse.

Annex 22 er fortsat et udkast og er ikke et gældende GMP-krav. Pr. 23. september 2026 er der ikke offentliggjort en endelig version eller en forventet ikrafttrædelsesdato. Indhold og afgrænsninger kan derfor blive ændret. Udkastet viser dog en tydelig regulatorisk retning, hvor intended use, testdata, performance, risici og overvågning skal hænge dokumenteret sammen gennem systemets livscyklus.

Kilder: EU-Kommissionens konsultation om Chapter 4, Annex 11 og Annex 22 og udkastet til Annex 22.

AI ændrer altså ikke behovet for validering. Men valideringsobjektet bliver bredere: Virksomheden skal kunne forbinde intended use, datagrundlag, performance, risici og overvågning gennem hele systemets livscyklus.

Spørgsmålet er derfor ikke kun, om modellen virkede, da den blev godkendt; men om du fortsat kan dokumentere, at den virker, når den bliver en del af den virkelige GxP-proces.

Kursus

GAMP5 AI Accelerated

Vil du blive klogere på, hvordan AI kan bruges i arbejdet med computeriserede systemer i pharma? På dette 2-dages kursus får du målrettet viden om GAMP5-principper kombineret med praktisk brug af AI-værktøjer.

Kursus

GAMP5 AI Accelerated

Vil du blive klogere på, hvordan AI kan bruges i arbejdet med computeriserede systemer i pharma? På dette 2-dages kursus får du målrettet viden om GAMP5-principper kombineret med praktisk brug af AI-værktøjer.

Læs mere:

Digitalisering af GMP

5 fejl før go-live i GMP-produktion

Mange fejl i digitale GMP-projekter opstår længe før go-live. Se 5 klassiske fejl fra uklar impact og validering til dataflow og manglende acceptkriterier.

Tema

Life science og sundhed

Se IDAs tilbud om ernæring, AI og sundhed, sundhedsteknologi, bioscience, bioteknologi, pharma, lægemiddeludvikling og sundhedspolitik og praksis.

Kontakt

Få hjælp nu

Find relevante, kvalitetssikrede kurser og efteruddannelse.