Inferens

Hvor pengene og hastigheden ligger, når I bruger en færdigtrænet model.

Opdateret 15. september 2026Læsetid 4 min.Af Brian Brandt · På engelsk: Inference
Indhold
  1. Sådan virker inferens i praksis
  2. Når I ser prisen på AI: inferens i regnestykket
  3. Eksempel: Inferens hos en dansk virksomheds IT-ansvarlige
  4. Inferens er ikke det samme som Træning
  5. Hvad du skal være opmærksom på
  6. Ofte stillede spørgsmål om Inferens

Inferens er den proces, der kører, når en færdigtrænet sprogmodel bruges til at give et svar eller en forudsigelse. Det er her modellen modtager din prompt, beregner et output og sender tekst tilbage. I praksis betyder inferens, at hver token modellen producerer eller læser bruger regnekraft, og det er den løbende udgift og ventetid, I betaler for, i modsætning til den engangsomkostning, træning er.

Sådan virker inferens i praksis

Når du trykker "send" i en chat eller kalder en model via en API, starter inferens. Modellen læser prompten, vægter konteksten og udspyr tokens ét ad gangen eller i små grupper, indtil svaret er færdigt. Forestil dig en tekstbehandler, hvor hver linje kræver en beregning; her betaler du for hver linje. Hver ekstra token øger regnearbejdet, og større modeller kræver mere kraft pr. token. Derfor påvirker inferens både prisen I ser på jeres regning og den oplevede hastighed for brugeren.

Når I ser prisen på AI: inferens i regnestykket

I prislister fra cloud-udbydere og API-leverandører står "inference-priser" typisk for, hvad I betaler pr. token eller pr. anmodning. Som leder eller indkøber skal du spørge: hvor ofte kører vi modellen, hvor lange svar skal den give, og hvilken ventetid kan vores kunder tåle? Høj gennemløb betyder flere tokens og højere regning. Lav latenstid kan kræve dyrere hardware eller caching. Kort sagt: træningsregningen var engangs-investeringen, inferens er løbende drift, og det er den, I budgetterer for måned efter måned.

Eksempel: Inferens hos en dansk virksomheds IT-ansvarlige

IT-ansvarlig i en mellemstor rådgivningsvirksomhed skulle rulle en intern chat-assistent ud midt i regnskabssæsonen. Klokken var ni om morgenen på en travl mandag, og hjælpen skulle være live inden frokost for at svare ofte stillede spørgsmål fra 40 konsulenter. IT-chefen valgte en hosted API for hurtig udrulning, men opdagede straks en udfordring: standardindstillingen gav 150 token-svar i gennemsnit, og de forventede 10.000 samtaler om måneden ville gøre regningen høj. Holdningen var, at træningen allerede var betalt (en pretrained model), men inferensen var det, der løb løbende. Det krævede nogle justeringer: kortere standard-svar, caching af hyppige spørgsmål og en lavere modelstørrelse på travle tider. Implementeringen tog to dage med to personer i arbejde og gav flere små problemer, enkelte svar blev for korte, og en kollega måtte udarbejde en fallback-procedure til komplekse spørgsmål. Resultatet var ikke perfekt, men driftssikkerheden blev bedre, og forventet månedlig inferensomkostning kunne estimeres mere realistisk.

Inferens er ikke det samme som Træning

Træning handler om at tilpasse eller bygge en model ved at vise den store mængder data, typisk én gang eller sjældnere, og det kræver meget regnekraft over længere tid. Inferens er derimod den gentagne afvikling af den allerede trænede model for at levere svar. Træning kan føre til bedre resultater til jer, men det er inferens, der bestemmer driftsomkostningerne. Husk også: token er den målestok, mange priser bruger, både hvor mange tokens I sender (prompt) og hvor mange modellen returnerer.

Hvad du skal være opmærksom på

Inferensafgifter kan overraske, hvis I ikke måler forbruget: lange svar, hyppige forespørgsler og valg af tung model øger regningen. Overvej at måle tokens per samtale, indføre caching for hyppige spørgsmål, og teste en mindre model før I skalerer. Der er tekniske tricks og organisatoriske valg, men vigtigst: inferens er drift, ikke en engangsoplevelse, og derfor skal budget, overvågning og SLA tænkes ind fra starten. Som en tankeeksperiment: træning er bilen, inferens er benzinen... og I skal betale hver gang I kører.

Det er svært at læse sig til inferens. I kommer længere med en workshop, hvor I bygger på jeres egne opgaver. Valget om inferens er sjældent kun teknisk. Retningen sættes med AI-rådgivning.

Ofte stillede spørgsmål om Inferens

Er inferens det samme som træning?

Nej. Træning er processen med at bygge eller finjustere en model og er ofte en engangsinvestering. Inferens er at bruge den færdigtrænede model løbende til at generere svar, og det er her I betaler for regnekraft og oplever ventetid.

Hvorfor står der "inference-pris" i API-regningen?

API-udbydere fakturerer ofte for inferens efter hvor meget regnekraft I bruger, typisk målt i tokens eller pr. forespørgsel. Det dækker de servere (GPU/CPU) der kører modellen, og det er den løbende driftsomkostning.

Kan jeg reducere mine inferensomkostninger uden udviklere?

Ja. I kan starte med at sænke svarlængde, genbruge eller cache ofte stillede svar og vælge en mindre model i leverandørens tilbud. Mere avancerede optimeringer kræver teknisk hjælp, men simple ændringer kan ofte gøres af den digitale ansvarlige.

Hvad er forskellen på token og inferens?

Token er en enhed af tekst (et ord eller en del af et ord) som modellen læser eller skriver. Inferens er selve kørslen af modellen, og hvert token i prompt eller svar koster regnekraft under inferens.

Brian Brandt

AI-rådgiver og underviser, grundlægger af AI Hero i Herning. Har bygget digitalt i over 20 år og hjælper danske virksomheder med at få AI i drift. Læs mere om Brian.

Relaterede ord i AI-ordbogen

Mangler der et ord, eller er der noget der er forkert?

Skriv til brian@aihero.dk eller ring på 28 35 84 54. Ordbogen bliver bedre af det.

Tilbage til ordbogen

AI, der kommer i drift. Én mail om måneden.

Brian skriver om, hvad der reelt virker med AI i danske virksomheder, set fra gulvet hos dem, der bruger det hver dag. Ingen hype, ingen nyhedsstrøm.

  • Konkrete eksempler: hvad der virkede, hvad det kostede, og hvad der gik galt
  • Værktøjer jeg selv bruger, testet i praksis, før de nævnes
  • Ét brev om måneden. Ikke mere. Afmeld når du vil.

Du får en mail, hvor du bekræfter din tilmelding. Vi deler aldrig din adresse, privatlivspolitik.