Evals (evaluering af AI)

Krav til leverandøren: målbar test, ikke tre spørgsmål på et møde.

Opdateret 15. september 2026Læsetid 3 min.Af Brian Brandt · På engelsk: Evals / AI evaluation
Indhold
  1. Sådan virker Evals i praksis
  2. Hvorfor du som leder skal kræve Evals fra leverandøren
  3. Eksempel: Evals hos en kontorleder i en rådgivervirksomhed
  4. Evals er ikke det samme som Benchmark
  5. Hvad du skal være opmærksom på
  6. Ofte stillede spørgsmål om Evals

Evals er et sæt systematiske tests til en AI-løsning: spørgsmål eller opgaver med kendte, korrekte svar (”ground truth”), som køres regelmæssigt, og hver gang modellen eller integrationen ændres. Formålet er at få tal på, hvor ofte chatbotten svarer korrekt, håndterer formatering, finder dokumenter eller ikke hallucinere, så I opdager forringelser før kunderne gør.

Sådan virker Evals i praksis

Et simpelt eval-sæt på 50 spørgsmål dækker flere typer opgaver: cirka 20 faktuelle spørgsmål (direkte faktasvar), 10 spørgsmål der kræver brug af virksomhedens dokumenter (retrieval), 10 scenarier med forkert eller mangelfuld information (robusthed), og 10 spørgsmål om tone, formatering eller korte workflows (fx opsummering, trinvis vejledning). Hvert spørgsmål har et forventet svar eller en vurderingsregel, det er ground truth. Når I kører sættet, får I score på andel korrekte svar, fejltyper og trends over tid. Det er som en pilot, der går tjeklisten igennem før takeoff: I får ikke en garanti, men I opdager kritiske fejl før afgang.

Hvorfor du som leder skal kræve Evals fra leverandøren

Som leder skal du have konkrete mål, ikke mavefornemmelser. Bed leverandøren levere et eval-sæt og en baseline-score før udrulning, og sæt acceptkriterier: for eksempel at korrekthedsprocenten ikke må falde mere end et bestemt antal point efter hver opdatering. Kræv også automatiske rapporter ved versionopgraderinger. Det gør leverandørens løfter målbare, gør opfølgning mulig og beskytter jer imod regressionsfejl, hvor en opdatering fjerner viden eller ændrer tonen.

Eksempel: Evals hos en kontorleder i en rådgivervirksomhed

En kontorleder skal gøre kundehenvendelser tilgængelige for en intern chatbot. Midt i en travl måned laver hun et eval-sæt på 50 spørgsmål: 15 om priser fra en ældre prisliste fra 2019, 10 om aktuelle åbningstider fra intranettet, 10 om hvordan man udfylder en standardblanket, og 15 «svære» spørgsmål baseret på tidligere mails. Før opsætning tager det hende to halve arbejdsdage at samle og annotere svarene. Efter første udrulning opdager hun, at chatbotten gengiver forældede priser i tre eksempler; det kræver en rettelse i dokumentindekseringen og en ny testkørsel. Læringen: et simpelt eval-sæt afslørede en fejl, som ellers først var kommet frem i kundekontakten. Tidsomkostningen var initielt et par dage, men gav et konkret målepunkt ved efterfølgende opdateringer.

Evals er ikke det samme som Benchmark

Evals er jeres interne, praktiske test med ground truth, skræddersyet til jeres data og workflows. En benchmark er en ekstern sammenligning mod andre modeller eller standarder og kan være nyttig ved modelvalg. Benchmarks måler ofte generelle evner, mens evals måler, om netop jeres chatbot løser jeres opgaver korrekt.

Hvad du skal være opmærksom på

Hold ground truth opdateret: gamle svar skaber falske fejl. Vær opmærksom på datakilder og persondata, når I bygger spørgsmål ud fra kunder eller interne sager. Planlæg vedligeholdelse: gør eval-sættet til en del af release-processen, så I altid kører tests ved opdatering. Beslut også, hvem der vurderer tvivlsomme svar, automatiske scorer fanger ikke altid nuance, så menneskelig gennemgang enkelte gange er nødvendig. Evals beskytter ikke mod alt, men det gør jer langt bedre stillet ved at måle i tal i stedet for at stole på tilfældige stikprøver.

Skal I beslutte, hvor meget evals må fylde hos jer, er det den slags valg, AI-rådgivning handler om.

Ofte stillede spørgsmål om Evals

Er Evals det samme som en benchmark?

Nej. En benchmark sammenligner modeller på standardiserede tests, mens Evals er et internt testsæt med jeres egne spørgsmål og korrekte svar, designet til at måle om chatbotten løser jeres konkrete opgaver.

Hvor mange spørgsmål skal et eval-sæt have?

Et praktisk udgangspunkt er 50 spørgsmål, fordelt på faktaspørgsmål, dokumentopslag, robusthed og formatering. Antallet kan justeres op eller ned, men 50 giver ofte et bredt nok billede uden at blive uhåndterligt.

Koster Evals meget at lave?

Der er en startomkostning i tid: typisk nogle dage for at samle og annotere 50 spørgsmål. Til gengæld giver det konkrete tal, som gør opfølgning og krav til leverandør meningsfuldt ved efterfølgende opdateringer.

Kan vi bruge Evals uden udviklere?

Ja, I kan lave grundlæggende evals uden udvikling: samle spørgsmål, definere korrekte svar og afvikle tests med leverandørens værktøj eller simple eksport/import-processer. Ved automatisering og hyppige tests bliver udviklerhjælp dog nyttig.

Brian Brandt

AI-rådgiver og underviser, grundlægger af AI Hero i Herning. Har bygget digitalt i over 20 år og hjælper danske virksomheder med at få AI i drift. Læs mere om Brian.

Relaterede ord i AI-ordbogen

Mangler der et ord, eller er der noget der er forkert?

Skriv til brian@aihero.dk eller ring på 28 35 84 54. Ordbogen bliver bedre af det.

Tilbage til ordbogen

AI, der kommer i drift. Én mail om måneden.

Brian skriver om, hvad der reelt virker med AI i danske virksomheder, set fra gulvet hos dem, der bruger det hver dag. Ingen hype, ingen nyhedsstrøm.

  • Konkrete eksempler: hvad der virkede, hvad det kostede, og hvad der gik galt
  • Værktøjer jeg selv bruger, testet i praksis, før de nævnes
  • Ét brev om måneden. Ikke mere. Afmeld når du vil.

Du får en mail, hvor du bekræfter din tilmelding. Vi deler aldrig din adresse, privatlivspolitik.