Instruction tuning
Gør en basismodel til en hjælpsom chatassistent, ikke bare autocomplete.
Indhold
- Hvorfor instruction tuning gør ChatGPT til en hjælpsom assistent
- Sådan virker Instruction tuning i praksis
- Eksempel: Instruction tuning set af en IT-ansvarlig i en mellemstor virksomhed
- Instruction tuning er ikke det samme som fine-tuning eller prompt engineering
- Hvad du skal være opmærksom på
- Ofte stillede spørgsmål om Instruction tuning
Instruction tuning er den træningsfase, hvor en basismodel lærer at følge instruktioner og svare på spørgsmål i stedet for bare at fortsætte tekst. Ved at træne modellen på tusindvis af par bestående af en opgave (instruktion) og et godt svar opstår den såkaldte instruct- eller chat-model, som du møder i produkter som ChatGPT.
Hvorfor instruction tuning gør ChatGPT til en hjælpsom assistent
Instruction tuning forklarer, hvorfor ChatGPT og lignende modeller opfører sig som en samtalepartner fremfor et autokompletteringsværktøj. En base model er trænet på store mængder tekst for at forudsige næste ord; en instruct- eller chat-model er eftertrænet på eksempler, hvor den eksplicit lærer at svare på spørgsmål, følge regler og levere korte eller lange svar afhængig af opgaven. Resultatet er, at den bedre forstår kommandoer som "opsummer denne mail" eller "skriv en e-mail til kunden" og leverer et brugbart svar i stedet for bare at fortsætte sætningen.
Sådan virker Instruction tuning i praksis
Forestil dig en elev, der først har læst alle bøgerne i biblioteket, og bagefter får 10.000 eksempler på spørgsmål og gode svar. De første bøger giver viden; instruction tuning lærer at bruge den viden på en måde, der hjælper folk. I praksis betyder det, at træningsdata indeholder instruktioner, forventet formatering, tone og eventuelle begrænsninger (f.eks. "ikke giv juridisk rådgivning"). Træningssættet kan være menneske-skrevet eller genereret og derefter vurderet, så modellen lærer, hvad et godt svar er.
Eksempel: Instruction tuning set af en IT-ansvarlig i en mellemstor virksomhed
En IT-ansvarlig i en regnskabsafdeling vil gerne bruge en intern chat-assistent til at hjælpe kolleger med budgetskabeloner. To uger før månedsslutningen installeres en chat-model i et testmiljø, trænet på generelle instruktioner. Problemet dukker op med det samme: assistenten leverer svar, men nogle gange kopierer eller gætter forkerte tal fra gamle regneark. IT-ansvarligens håndtering krævede, at teamet samlede 150 eksempler fra egne regneark og virksomhedens tone-of-voice, og brugte dem til at lave en ekstra instruct-fase. Det kostede cirka en uge i arbejdstid at vælge og kvalitetssikre eksemplerne, og der opstod behov for at lære medarbejdere at formulere klare instruktioner. Resultatet var ikke perfekt, og modellen kunne stadig finde på at hallucinere tal, men svarene blev mere relevante og oftere i den ønskede format.
Instruction tuning er ikke det samme som fine-tuning eller prompt engineering
Instruction tuning er en type efter-træning, der fokuserer på at lære modellen at følge instruktioner. Fine-tuning dækker bredere: det kan være at justere en model på virksomhedens specifikke data for at forbedre faglig viden eller personlighed. Prompt engineering er en bruger- eller promptforfatters teknik: du skriver bedre instruktioner for at få et bedre svar uden at ændre modelens vægt. Alle tre hænger sammen i praksis, men de er forskellige værktøjer: instruct-modeller kommer ud som chat-modeller, hvorimod en base model mangler den særlige instruction-adfærd.
Hvad du skal være opmærksom på
Instruction tuning hjælper med at få en model til at opføre sig pænt, men den gør den ikke fejlfri. Modellen kan stadig hallucinere, afspejle skævheder i træningsdata og være følsom over for uklare instruktioner. Hvis I vil have jeres egen instruct-model, skal I regne med tid til at samle, gennemgå og kvalitetssikre trænings-eksempler, og afsætte ressourcer til løbende overvågning, fordi adfærden kan ændre sig, når modellen opdateres. Husk også, at betegnelser som "instruct model", "instruct-model", "chat-model" og "instruct" ofte bruges om hinanden, så spørg altid leverandøren, hvad de konkret mener.
Vil I arbejde videre med instruction tuning på jeres egne opgaver, er det dét, en AI-workshop går ud på.
Ofte stillede spørgsmål om Instruction tuning
Er instruction tuning det samme som fine-tuning?
Nej. Instruction tuning er en efter-træning med fokus på at lære modellen at følge instruktioner og svare som en assistent. Fine-tuning kan dække bredere ændringer, for eksempel at give modellen specifik faglig viden fra jeres egne dokumenter.
Hvorfor findes både "base" og "instruct" modeller?
Base modeller er generelt trænet til at forudsige tekst og bruges som udgangspunkt. Instruction-tunede modeller er eftertrænede til at følge instruktioner, og dem møder du i chatprodukter fordi de er nemmere og mere pålidelige at bruge for almindelige brugere.
Kan vi bruge en instruct-model uden udviklere?
Ja, mange chatprodukter med instruct-modeller er designet til slutbrugere uden teknisk viden. Hvis I vil lave jeres egen instruct-træning med interne data, kræver det typisk både dataarbejde og teknisk støtte.
Koster instruction tuning meget?
Omkostningen afhænger af omfanget: at samle og kvalitetssikre eksempler tager tid, og teknisk efter-træning kan koste enten i form af en leverandørs ydelse eller cloud-ressourcer. Beregn tid til forberedelse, test og løbende overvågning.

AI-rådgiver og underviser, grundlægger af AI Hero i Herning. Har bygget digitalt i over 20 år og hjælper danske virksomheder med at få AI i drift. Læs mere om Brian.