Tokenisering
Forstå hvorfor AI deler danske ord mærkeligt, rammer tælling og øger pris på dansk.
Indhold
Tokenisering er processen, hvor en tekst deles i mindre enheder, tokens, før en sprogmodel kan behandle den. En tokenizer er det program, der bruger en ordliste og regler til at skære teksten op. Den måde danske ord, bindingstegn og sjældne navne bliver hakket på er ofte årsagen til, at modeller laver mærkelige orddelinger eller regner flere tegn, end du forventer.
Sådan virker Tokenisering i praksis
Forestil dig, at du afleverer en lang adresse eller et produktnavn til en model. Tokenizeren deler den sætning op i stykker, som modellen forstår, ofte mindre end ord. På engelsk kan "playground" være ét token, mens på dansk et sammensat ord med bindestreg eller specialtegn kan blive til fire tokens. Hver token er en lille brik i modellens sprogpuslespil. Jo flere tokens, jo længere bliver beregningen, og ofte dyrere er svaret, fordi mange udbydere aflønner efter tokenforbrug.
Tokenisering forklarer også hvorfor små tastefejl kan skabe store problemer: fejlagtig stavning kan splitte et almindeligt ord i flere mærkelige bidder, og sjældne danske ord ender som en række små stykker, som modellen ikke kender fra træningen. Det er derfor, du kan opleve mærkelige sætninger eller misforstået tælling af tegn, når du bruger AI på dansk.
Hvorfor tokenisering giver dumme fejl for marketingfolk
Du skriver en annonce, tæller tegn i et dokument eller sender produktdata til en kundesupportbot, og resultatet stemmer ikke overens med dit forventede antal tegn eller deling. Tokenisering er årsagen. Marketingtekst med forkortelser, emotikoner eller firmaprofilnavne kan blive hakket op, så modellen opfatter det som flere elementer end et menneske ville. På dansk er problemet oftere større, fordi dansk stavemåde, sammensatte ord og specialtegn ikke er lige så godt repræsenteret i de tokeniseringsordbøger, som modellerne er trænet med.
Det betyder konkret, at danske prompts bruger flere tokens end tilsvarende engelske tekster, og at prisen per forespørgsel kan være højere. Det er ikke en fejl i marketingteksten, det er en mekanisk konsekvens af, hvordan tokenizeren arbejder.
Eksempel: Tokenisering hos en digital ansvarlig
Den digitale ansvarlige i en mellemstor webshop sidder mandag morgen, tre dage før en sæsonstart, og skal uploade 120 produktbeskrivelser fra et regneark. Hver beskrivelse indeholder varenummer, mål i mm, en kort teknisk note og et par sammensatte danske ord. Hun sender teksten til en automatisk beskrivelsesgenerator og bemærker, at flere beskrivelser bliver afkortet, fordi modellen rammer et maksimum for tokens. Modellen gengiver også mål som "20 mm" som tre tokens i stedet for to, hvilket forskubber regnearket og skaber fejl i importen.
Hun må splitte opgaven: rydde i de tekniske noter, fjerne unødvendige tegn og køre et par test-kørsler for at se, hvor mange tokens hver beskrivelse bruger. Det tager to timer ekstra arbejde og en forsinkelse på en dag, men hun undgår at importere forkerte data. Læringen er klar: tokenisering er en praktisk grænse, du møder i drift, og lidt oprydning i input sparer tid og penge senere.
Tokenisering er ikke det samme som Token eller Kontekstvindue
Et token er den enkelte enhed, som tokenizeren skaber. Tokenisering er selve processen. Kontekstvindue er et andet begreb: det er hvor mange tokens en model kan "se" ad gangen. To tekster kan være lige lange i ord, men meget forskellige i antal tokens efter tokenisering. Når du arbejder med en dansk sprogmodel, skal du altså lægge mærke til både hvordan teksten bliver tokeniseret, og hvor stort kontekstvinduet er, fordi begge ting bestemmer, hvad modellen kan håndtere i én forespørgsel.
Hvad kan du så gøre næste gang? Ryd op i input, brug enklere stavemåder hvor muligt, og test med korte eksempler, inden du kører et helt datasæt. Med lidt omtanke undgår du mange af de mærkelige fejl, som ellers virker helt tilfældige.
Det er svært at læse sig til tokenisering. I kommer længere med en workshop, hvor I bygger på jeres egne opgaver. Valget om tokenisering er sjældent kun teknisk. Retningen sættes med AI-rådgivning.
Ofte stillede spørgsmål om Tokenisering
Er tokenisering det samme som et token?
Nej. Tokenisering er processen, hvor teksten deles, mens et token er det enkelte stykke tekst, som modellen senere behandler.
Hvorfor koster dansk ofte mere end engelsk i AI?
Dansk tekst bliver ofte delt i flere tokens på grund af stavemåde, sammensatte ord og specialtegn. Flere tokens betyder mere beregning og dermed højere pris hos udbydere, som afregner efter tokenforbrug.
Kan jeg undgå problemer med tokenisering uden udviklere?
Ja. Du kan rydde i input, fjerne unødvendige tegn, bruge enklere ord og teste korte eksempler. Mere avancerede ændringer i tokenizeren kræver udviklerhjælp.
Hvordan adskiller tokenisering sig fra kontekstvindue?
Tokenisering bestemmer hvor mange tokens en tekst giver. Kontekstvindue er hvor mange af disse tokens modellen kan holde i hukommelsen ad gangen. Begge påvirker, hvor meget du kan sende til modellen i én forespørgsel.

AI-rådgiver og underviser, grundlægger af AI Hero i Herning. Har bygget digitalt i over 20 år og hjælper danske virksomheder med at få AI i drift. Læs mere om Brian.