Træning
Hvordan og hvornår bruges jeres dokumenter til at ændre en AI-models viden?
Indhold
Træning er processen, hvor en AI-model gentagne gange ser et datasæt og justerer sine parametre, indtil den laver færre fejl. Træning foregår typisk på store mængder eksempler, tekst, billeder eller tabeller, og er dyr i beregningstid og energi, så det sker sjældent for hver kunde. Efterfølgende kan modellen efter-trænes (fine-tune) på mindre, virksomheds-specifikt materiale.
Sådan virker træning i praksis
Forestil dig en praktikant, der får tonen i jeres kundemails ind med feedback: først et udkast, så en rettelse, så et nyt udkast. Træning er noget lignende, men i stor skala. En model ser millioner eller milliarder af sætninger fra et datasæt, forsøger at forudsige det næste ord eller svare rigtigt, og justerer sine parametre lidt ad gangen for at lave færre fejl. Parametre er de tal i modellen, der bestemmer, hvordan den vælger ord og svar; de ændres under træningen.
Når man træner en helt ny, stor sprogmodel (ofte kaldet pretraining eller fortræning), bruges typisk massive datasæt, herunder offentligt tilgængelig tekst fra internettet. Det er dyrt at køre, både i serveromkostninger og tid, og derfor gentages den grundlæggende træning ikke for hver enkelt kunde. I stedet bruger virksomhederne typisk en allerede trænet model som udgangspunkt og bygger videre med mindre, målrettede efter-træninger.
Bliver vores data brugt til træning?
Det er det spørgsmål ledere oftest stiller, og svaret afhænger af leverandøren og kontrakten. Base-træning af store modeller foregår normalt på store, eksterne datasæt og ikke på jeres egne forretningsdokumenter. Men leverandører kan tilbyde at efter-træne eller finetune en model på jeres datasæt, så modellen bliver bedre til jeres ordvalg eller særlige produkter.
Spørg altid: 1) Bliver jeres uploads brugt til leverandørens fremtidige base-træning? 2) Gemmer leverandøren eksempler? 3) Hvad står der i databehandleraftalen? Hvis du vil tjekke regler og anbefalinger, se Datatilsynet.
Eksempel: Træning og kontrakten hos en indkøbschef
Indkøbschefen i en mellemstor komponentproducent sidder mandag morgen med et tilbudsmøde om et nyt indkøbsstøtteværktøj. Leverandøren lover, at systemet kan blive bedre, hvis producenten uploader 120 PDF-tegninger og 400 fakturaer til “modeltilpasning”. Indkøbschefen vil vide, om de filer ender i leverandørens egen træningspulje. Kontrakten var uklar, så indkøbschefen bad om skriftlig bekræftelse og afsatte to uger til juridisk gennemgang og en teknisk test: de bad om en forklaring af hvordan datasættet bliver indsamlet, hvem der ejer de nye parametre efter en efter-træning, og om der er mulighed for sletning. Resultatet: leverandøren tilbød en aftale, hvor kundens data kun blev brugt til en separat efter-træning, og hvor modellen kunne rulles tilbage, hvis det viste sig problematisk. Det kostede tid og krævede én teknisk ressource i en uge.
Træning er ikke det samme som efter-træning (fine-tune)
Når nogen siger "vi træner modellen på jeres data", kan det betyde to forskellige ting. Pretraining er grundlæggende træning på enorme datasæt og sker sjældent for én kunde. Efter-træning eller fine-tuning er målrettet: I uploader jeres datasæt, og modellen justeres, så den bliver bedre til netop jeres spørgetyper eller terminologi. Efter-træning er ofte billigere og hurtigere, men betyder også, at modellen kan indeholde kunde-specifik viden, med de juridiske og sikkerhedsmæssige konsekvenser, det medfører.
Når medarbejderne selv skal kunne bruge træning og ikke bare kende ordet, sker det hurtigst på en AI-workshop. Er I i tvivl om, hvad træning betyder for jeres eget ansvar, så tag det med i AI-rådgivningen.
Ofte stillede spørgsmål om Træning
Er træning det samme som efter-træning (fine-tune)?
Nej. Træning (pretraining) er grundlæggende læring på enorme datasæt og er dyr og sjælden. Efter-træning eller fine-tuning er en mindre, målrettet justering af en allerede trænet model på jeres data.
Kan en leverandør bruge vores uploads til at træne deres model generelt?
Det afhænger af leverandørens praksis og kontrakten. Bed om en skriftlig forklaring: bliver data anvendt til base-træning, gemmes eksempler, og hvad siger databehandleraftalen? Tjek også relevante regler på Datatilsynet.
Koster træning virksomheden noget?
Ja. Grundlæggende træning af store modeller er dyr i servertid og kræver specialiseret infrastruktur, så det sker sjældent for enkeltkunder. Efter-træning er billigere, men kræver stadig tid til forberedelse af datasæt og juridisk gennemgang.
Hvad skal jeg bede om i en leverandøraftale om træning?
Krav klarhed om hvorvidt jeres data bruges til base-træning, regler for opbevaring og sletning, ejerskab af eventuelle nye parametre efter efter-træning, og en databehandleraftale med konkrete garantier.

AI-rådgiver og underviser, grundlægger af AI Hero i Herning. Har bygget digitalt i over 20 år og hjælper danske virksomheder med at få AI i drift. Læs mere om Brian.