Prætræning
Hvorfor store sprogmodeller er dyre, og hvorfor jeres data ikke bare forsvinder ind i dem.
Indhold
Prætræning er den indledende, dyre fase hvor en sprogmodel lærer sprog, mønstre og fakta ved at forudsige næste token i enorme mængder tekst. Resultatet er en basismodel, der kan fortsætte tekst og genkende mønstre, men som ikke er finindstillet til at føre en samtale eller løse specifikke opgaver, det kommer i efterfølgende faser som instruction tuning og RLHF.
Sådan virker prætræning i praksis
Prætræning svarer til at lade en model læse milliarder af sætninger og lære, hvad der typisk kommer næste. Modellen gætter ord for ord, forbedrer sine gæt og opbygger et statistisk billede af sprog: hvad ord ofte følger hinanden, hvilke formuleringer angiver fakta, og hvordan sætninger struktureres. Forestil dig et kæmpestort opslagsværk bygget af andres noter, meget nyttigt, men generelt, og ikke jeres private mappe.
Prætræning er også den tekniske årsag til, at ordet token ofte dukker op: modellen arbejder med tokens, og det er ved at forudsige disse, den lærer. Når I senere giver instruktioner til en model, sker det oftest på en prætrænet base, som er blevet gjort interaktiv ved instruction tuning.
Hvorfor prætræning betyder noget for din virksomhed
Prætræning forklarer, hvorfor store modeller er dyre og drives af få aktører: det kræver enorme mængder data, regnekraft og tid at gennemføre. Det betyder også, at jeres virksomheds egne dokumenter ikke automatisk "kommer ind" i modellen, når I bruger en standard tjeneste; I bruger en model, der er lært på andres tekst. Hvis I vil have modellen til at kende interne prislister, kundehistorik eller fortrolige processer, skal I enten finjustere den eller bruge teknikker som retrieval eller private fine-tuning-løsninger.
Eksempel: Prætræningens betydning for en IT-ansvarlig
En IT-ansvarlig i en mellemstor rådgivervirksomhed skal beslutte, om de vil lade kundeservice bruge en offentlig chatbot. Det er mandag formiddag, et par dage før et kundeevent, og flere kolleger vil have adgang til generering af korte svar fra modellen. IT-ansvarligens bekymring er, at e-mails og scannede aftaledokumenter ikke pludselig må blive “taget ind” i den model, de bruger. Prætræning betyder, at modellen i forvejen kender meget sprog, men ikke jeres kundedata. Forsøget med at lade kundeservicemedarbejdere kopiere e-mail-tekster ind i chatten viser hurtigt problematikken: nogen placerer et personligt telefonnummer i prompten, og nu er spørgsmålet om logning og sletning oppe. Det kostede IT-ansvarligen to dage med politikudkast, ændring af adgangsrettigheder og en samtale med en leverandør om databehandling. Læringen blev, at prætræningen giver stærke generelle evner, men de praktiske regler omkring virksomhedens data skal på plads, før værktøjet frigives.
Prætræning er ikke det samme som instruction tuning eller fin-tuning
Prætræning skaber basismodellen. Instruction tuning er en efterfølgende fase, hvor modellen lærer at følge menneskelige instruktioner og føre en pæn samtale. Fin-tuning kan være målrettet træning på et lille, virksomhedsspecifikt datasæt for at ændre adfærd. De tre faser bygger oven på hinanden: prætræningen er fundamentet, ikke den færdige assistent.
Hvad du skal være opmærksom på
Prætræning betyder, at modellerne er gode til generel viden, men de kan også gengive forældet eller upålideligt indhold. Hvis I deler følsomme dokumenter i en offentlig chat, så indgår de ikke i den oprindelige prætræning, men de kan blive lagret eller brugt af leverandøren i logfiler, tjek leverandørens databehandling og opbevaring. Overvej også om I har brug for private fin-tuning-løsninger eller søgeteknikker, hvis jeres interne viden skal bruges sikkert. For regler og vejledning, se Datatilsynet.
Det er svært at læse sig til prætræning. I kommer længere med en workshop, hvor I bygger på jeres egne opgaver. Valget om prætræning er sjældent kun teknisk. Retningen sættes med AI-rådgivning.
Ofte stillede spørgsmål om Prætræning
Er prætræning det samme som instruction tuning?
Nej. Prætræning er den brede, første fase hvor modellen lærer sprog fra store mængder tekst. Instruction tuning kommer efter og gør modellen bedre til at følge konkrete instruktioner og føre samtale.
Koster prætræning noget for min virksomhed?
Ja, men omkostningen bæres typisk af dem, der bygger modellen. For jer betyder det, at adgang til stærke prætrænede modeller kan koste via abonnements- eller API-priser, mens selv at prætræne kræver enorme ressourcer.
Bliver vores virksomhedsdata automatisk en del af modellen under prætræning?
Nej. Prætræningsdata kommer fra store, offentligt tilgængelige eller licenserede kilder. Hvis I vil have jeres data ind i modellen, skal I bruge målrettet fin-tuning eller sikre opsætninger fra leverandøren.
Kan vi bruge en prætrænet model uden udviklere?
Ja, I kan bruge prætrænede modeller via standardværktøjer og chatinterfaces, men for at tilpasse modellen til jeres processer eller sikre datahåndtering vil I ofte få brug for teknisk hjælp.

AI-rådgiver og underviser, grundlægger af AI Hero i Herning. Har bygget digitalt i over 20 år og hjælper danske virksomheder med at få AI i drift. Læs mere om Brian.