Latens

Den ventetid, der gør en chatbot irriterende... og hvad I kan gøre ved det.

Opdateret 15. september 2026Læsetid 4 min.Af Brian Brandt · På engelsk: Latency
Indhold
  1. Sådan virker Latens i praksis
  2. Hvorfor Latens betyder noget for kundeservice og telefonbots
  3. Eksempel: Latens hos en IT-ansvarlig i en webshop
  4. Latens er ikke det samme som token eller prompt
  5. Sådan kommer du i gang med at måle og reducere Latens
  6. Ofte stillede spørgsmål om Latens

Latens er den tid, der går fra I trykker send på en prompt, til AI'en begynder at levere svar (time-to-first-token) og til svaret er færdigt (tokens-per-second). Streaming kan få svaret til at føles hurtigere, fordi de første ord kommer tidligt, men den samlede latens styres af modelstørrelse, hvor komplekst reasoning er, hvor meget kontekst modellen skal bruge, og hvor travlt serverne er.

Sådan virker Latens i praksis

Latens består af flere trin: forespørgslen sendes over netværket, modellen læser prompten og eventuel kontekst, modellen 'tænker' (reasoning) og genererer tokens, og svaret sendes tilbage. En stor sprogmodel bruger flere beregninger per ord, så den kan give længere eller mere komplekse svar, men den tager også længere tid pr. token. Streaming betyder, at brugeren ser de første tokens tidligt, men hvis modellen skal regne langt frem eller bruge en lang kontekst, så kommer resten langsomt. Netværk og serverbelastning kan fordoble eller tredoble oplevet ventetid, selvom modellen i sig selv er hurtig.

Hvorfor Latens betyder noget for kundeservice og telefonbots

Når en chatbot eller en telefonbot er langsom, opfatter kunden det som en dårlig eller uprofessionel oplevelse. For chatbots i live support og voice-bots er time-to-first-token ofte vigtigere end rå throughput; de første ord skal komme hurtigt, ellers afbryder kunden. For batch-job, der genererer rapporter eller oversættelser i sene nattetimer, betyder latens meget mindre, fordi gennemløbstid ikke påvirker en samtale. Derfor er valget mellem en stor model og en lille model ofte et spørgsmål om prioritet: kvalitet kontra hastighed. Som leder skal du spørge: vil I vinde på bedre svar, eller vil I miste kunder på langsom svartid?

Eksempel: Latens hos en IT-ansvarlig i en webshop

En IT-ansvarlig i en mellemstor webshop skal 10 dage før Black Friday rulle en kundeservicebot ud, der kan hjælpe med ordrer og returneringer. Tirsdag formiddag tester hun botten mod 3.000 almindelige spørgsmål fra tidligere chats og finder, at en stor model leverer bedre svar, men bruger 2 til 3 sekunder per token og giver 8 til 12 sekunders pause før første ord. Streaming skjuler noget af ventetiden, men kunderne klager stadig. Hun prøver en mindre model til korte FAQ-svar og bruger den store model kun til komplekse sager. Det kræver opsætning i routing og 1 dags testarbejde; problemet var ikke teknisk umuligt, men kostede tid i koordinering og flere tests med reelle kundehenvendelser.

Latens er ikke det samme som token eller prompt

Latens beskriver tid; et token er en enhed tekst (ord eller stykke af et ord), og en prompt er den tekst, I sender til modellen. Hvis I taler om tokens per second, taler I om, hvor hurtigt modellen producerer tokens, det er en del af latensen, men ikke hele billedet. Streaming påvirker oplevet latens ved at vise tokens tidligt, men den totale tid for en lang eller kompleks prompt kan stadig være høj, fordi modellen skal 'læse' hele konteksten.

Sådan kommer du i gang med at måle og reducere Latens

  1. Mål begge: time-to-first-token og tokens-per-second fra jeres brugsscenarier, ikke kun fra leverandørens tal. 2. Brug kortere kontekster og ryd op i prompts; mindre tekst giver ofte lavere latens. 3. Overvej model-hierarki: en lille model til hurtige, simple svar, og en stor model til komplekse tilfælde. 4. Test med streaming slået til og tilpas brugerfladen, så kunden ser svar komme løbende. 5. Mål serverbelastning og latency på netværket, for ofte er det ikke modellen, men infrastrukturen, der sinker jer.

En skæv sammenligning: en langsom model føles som at lytte til en gammel modemforbindelse, de første tegn tikker ind, men du venter stadig på resten. Latens kan ikke altid fjernes, men I kan gøre den mindre mærkbar, og I kan vælge de rigtige værktøjer, så kunderne ikke hopper fra samtalen.

Det er svært at læse sig til latens. I kommer længere med en workshop, hvor I bygger på jeres egne opgaver. Valget om latens er sjældent kun teknisk. Retningen sættes med AI-rådgivning.

Ofte stillede spørgsmål om Latens

Er latens det samme som svartid?

Latens er en form for svartid, men mere præcist handler den om hvor lang tid det tager fra prompt til første token og til hele svaret er leveret. Svartid kan bruges bredere om enhver forsinkelse i et system.

Hvorfor svarer AI langsomt nogle gange?

Fordi store modeller kræver flere beregninger pr. token, fordi modellen kan bruge meget kontekst eller komplekst reasoning, eller fordi netværk og servere er belastede. Streaming kan skjule lidt af ventetiden, men den samlede behandlingstid forbliver.

Kan jeg reducere latens uden udviklere?

Delvist. I kan prøve kortere prompts og færre kontekst-dokumenter, og skifte til streaming-brugerflade. For routing mellem store og små modeller eller ændringer i infrastruktur skal en udvikler normalt involveres.

Hvad er tokens per second, og hvorfor betyder det noget?

Tokens per second måler hvor hurtigt en model producerer tekst. Højere rate betyder hurtigere færdiggørelse af lange svar. Men time-to-first-token bestemmer ofte brugeroplevelsen i en samtale.

Brian Brandt

AI-rådgiver og underviser, grundlægger af AI Hero i Herning. Har bygget digitalt i over 20 år og hjælper danske virksomheder med at få AI i drift. Læs mere om Brian.

Relaterede ord i AI-ordbogen

Mangler der et ord, eller er der noget der er forkert?

Skriv til brian@aihero.dk eller ring på 28 35 84 54. Ordbogen bliver bedre af det.

Tilbage til ordbogen

AI, der kommer i drift. Én mail om måneden.

Brian skriver om, hvad der reelt virker med AI i danske virksomheder, set fra gulvet hos dem, der bruger det hver dag. Ingen hype, ingen nyhedsstrøm.

  • Konkrete eksempler: hvad der virkede, hvad det kostede, og hvad der gik galt
  • Værktøjer jeg selv bruger, testet i praksis, før de nævnes
  • Ét brev om måneden. Ikke mere. Afmeld når du vil.

Du får en mail, hvor du bekræfter din tilmelding. Vi deler aldrig din adresse, privatlivspolitik.