Syntetiske data

Kunstigt oprettede data, så I kan teste AI uden at bruge rigtige kundedata.

Opdateret 15. september 2026Læsetid 3 min.Af Brian Brandt · På engelsk: Synthetic data
Indhold
  1. Hvorfor syntetiske data kan hjælpe dig med GDPR
  2. Sådan virker syntetiske data i praksis
  3. Eksempel: Syntetiske data hos en kontorleder
  4. Syntetiske data er ikke det samme som persondata (PII)
  5. Hvad du skal være opmærksom på
  6. Ofte stillede spørgsmål om Syntetiske data

Syntetiske data er kunstigt genererede data, der statistisk ligner rigtige data, men som ikke stammer fra rigtige personer eller hændelser. De bruges primært til at træne og teste AI uden at udsætte personoplysninger, eller til at udfylde huller, hvor I har for få eksempler. Fordelen er lavere risiko for brud på persondata; faldgruben er, at modellen kan lære kunstige mønstre eller gentage sine egne fejl.

Hvorfor syntetiske data kan hjælpe dig med GDPR

Syntetiske data er en måde at arbejde med kundemateriale uden at behandle rigtige personoplysninger (Persondata (PII)). For en leder betyder det, at I kan lade udviklere og testere køre scenarier på realistiske datasæt uden at tage en juridisk risiko ved at kopiere kundelister eller journaler. Reglerne ændrer sig, så tjek altid Datatilsynet før I beslutter jer for at erstatte eller supplere rigtige data med syntetiske data.

Sådan virker syntetiske data i praksis

Forestil dig, at I har 10.000 ordrelinjer fra de seneste tre år, men kun 50 rækker med en særlig fejltilstand, I vil modellere. En syntetisk generator bruger de 10.000 rigtige rækker som inspiration til at skabe nye rækker, der ligner dem statistisk, men som ikke er kopier af rigtige ordrer. I får flere eksempler at træne på, så modellen kan genkende sjældne mønstre. Den praktiske begrænsning er enkel: hvis generatoren kun kan se jeres egne data, reproducerer den også de fejl og skævheder, der ligger i dem. Kort sagt: nyttigt, men ikke en garanti for objektivitet.

Eksempel: Syntetiske data hos en kontorleder

Kontorlederen i en mellemstor revisionsvirksomhed skal forberede test af et AI-værktøj, der automatiserer journalføring. Det er mandag morgen, to uger før udrulning, og den eksterne leverandør forlanger et stort træningssæt. Kontorlederen har adgang til 4.200 kundemapper, men må ikke dele dem. Hun beder om et syntetisk datasæt baseret på struktur og hyppighed i de rigtige mapper: 4.200 fiktive mapper med realistiske felter, fordeling af branchekoder og almindelige fejl i adressefeltet. Problemet: generatoren kopierer en gammel pladsfejl i et adressefelt, så testen overser en edge-case. Det tager tre dage at rette generatorens regler og køre en ny runde, og testen bliver forsinket en uge. Læringen: syntetiske data sparer deling af personoplysninger, men kræver validering og tid til at fjerne artefakter.

Syntetiske data er ikke det samme som persondata (PII)

Syntetiske data kan ligne rigtige data, men de er ikke persondata, fordi de ikke kan henføres til en identificerbar person. Det betyder dog ikke, at I er fritaget fra at tænke juridisk: hvis en generator fx trænes på et meget lille kundesæt, kan resultatet stadig hænge tæt sammen med rigtige individer. Derfor skal I vurdere risikoen for reversering og genkendelse, især i små eller specialiserede datasæt.

Hvad du skal være opmærksom på

  • Kvalitetskontrol: valider at de syntetiske data ikke bærer uønskede fejl eller bias fra de rigtige data. Test med eksterne scenarier.
  • Overfitting til egne fejl: en generator kan lære og reproducere systematiske fejl, så modellen ender med at forstærke dem.
  • Dokumentation: før I bruger syntetiske data i produktion, dokumenter hvordan de er genereret, hvilke kilder der lå til grund, og hvilke tests I har kørt.
  • Juridisk tjek: i tvivlstilfælde, få et juridisk eller databeskyttelsesfagligt tjek, især hvis I arbejder med sundhedsdata, finans eller andre følsomme kategorier.

Syntetiske data er et praktisk værktøj til at teste og træne AI uden rigtige personoplysninger, og til at skabe flere eksempler. Brug dem, men pas på: de er nyttige, ikke magiske.

Valget om syntetiske data er sjældent kun teknisk. Retningen sættes med AI-rådgivning.

Ofte stillede spørgsmål om Syntetiske data

Er syntetiske data det samme som anonymisering?

Nej. Anonymisering ændrer rigtige data, så individer ikke kan identificeres, mens syntetiske data er helt nye, kunstigt skabte poster. Begge reducerer persondata-risiko, men metoderne og risikovurderingen er forskellige.

Kan vi bruge syntetiske data for at overholde GDPR?

Ja, syntetiske data kan mindske behovet for at dele persondata til test og udvikling, men I skal stadig vurdere risikoen for genkendelse og sikre dokumentation. Tjek altid Datatilsynet ved tvivl.

Koster det meget at lave syntetiske data?

Omkostningerne varierer: nogle værktøjer giver hurtig, automatiseret generation, andre kræver konsulenttid og validering. Regn med tid til opsætning og test, især hvis datasættet er komplekst.

Kan syntetiske data skabe bias i min model?

Ja. Hvis de originale data indeholder skævheder, eller hvis generatoren forstærker visse mønstre, kan bias blive indbygget i det syntetiske sæt. Valider på uafhængige sæt og test for fairness.

Brian Brandt

AI-rådgiver og underviser, grundlægger af AI Hero i Herning. Har bygget digitalt i over 20 år og hjælper danske virksomheder med at få AI i drift. Læs mere om Brian.

Relaterede ord i AI-ordbogen

Mangler der et ord, eller er der noget der er forkert?

Skriv til brian@aihero.dk eller ring på 28 35 84 54. Ordbogen bliver bedre af det.

Tilbage til ordbogen

AI, der kommer i drift. Én mail om måneden.

Brian skriver om, hvad der reelt virker med AI i danske virksomheder, set fra gulvet hos dem, der bruger det hver dag. Ingen hype, ingen nyhedsstrøm.

  • Konkrete eksempler: hvad der virkede, hvad det kostede, og hvad der gik galt
  • Værktøjer jeg selv bruger, testet i praksis, før de nævnes
  • Ét brev om måneden. Ikke mere. Afmeld når du vil.

Du får en mail, hvor du bekræfter din tilmelding. Vi deler aldrig din adresse, privatlivspolitik.