Embedding
Talversionen af indholdet, så AI kan sammenligne betydning mellem jeres dokumenter.
Indhold
Embedding er en vektorrepræsentation af tekst eller billede: en lang række tal, hvor tekster med samme betydning ligger tæt på hinanden. Det betyder, at AI kan måle lighed mellem sætninger og dokumenter matematisk og dermed hente relevante dokumenter eller svare på spørgsmål ud fra jeres egne filer.
Sådan virker Embedding i praksis
En embedding oversætter indhold til en punkt i et flerdimensionelt talrum. Forestil dig et kort, hvor hver sætning får et sæt koordinater. To sætninger med samme betydning får nære koordinater, mens helt forskellige sætninger ligger langt fra hinanden. For AI bruges denne afstand til at finde de mest relevante tekster, uden at systemet skal forstå hver enkelt sætning som et menneske gør.
Det praktiske er simpelt: når nogen stiller et spørgsmål, omdannes spørgsmålet til en embedding, og systemet søger efter dokumentembeddings, der ligger tættest på. De fundne dokumenter kan så bruges til at generere et svar, eller vises som søgeresultater. Den teknik kaldes ofte semantisk søgning.
Når leverandøren taler om Embedding: hvad det betyder for jer
Når en leverandør siger, at de "laver embeddings" af jeres dokumenter, mener de, at de oversætter jeres indhold til tal, så AI kan sammenligne betydning. For dig som marketingchef eller leder betyder det, at søgninger ikke længere kun matcher ord, men også mening. En kunde kan finde en gammel prisliste, selv om den bruger ordet "tilbud" hvor I tidligere skrev "rabatsats".
Det kræver dog, at leverandøren viser, hvordan de håndterer jeres filer: hvilke dokumenttyper de indekserer, hvor ofte de opdaterer embeddings, og hvordan I kan slette eller opdatere indhold. Spørg også, om embeddings bliver delt med tredjepart eller brugt til træning af modeller, hvis det er vigtigt for jer.
Eksempel: Embedding hos en kontorleder i en revisorvirksomhed
Kontorlederen sidder mandag morgen kl. 09:30. En klient ringer og spørger efter en gammel fakturamal og en vejledning til momsrefusion fra 2018. Firmets filserver rummer 2.300 PDF-filer, mange scannede, og en samlet mappe med fem års korrespondance. Kontorlederen prøver først at søge på ordet "faktura" men finder kun skabeloner fra sidste år. Leverandørens nye søgefunktion bruger embeddings, og den foreslår to PDF er fra 2018 og en mailtråd fra 2019 som mest relevante. Problemet er, at tre af PDF'erne er scannede, så embeddings var dårlige første gang og de mest relevante dokumenter dukkede ikke op. Løsningen tog tre timer: scannede sider måtte OCR-behandles, nye embeddings blev genereret, og søgeindekset opdateret. Resultat: dokumenterne blev fundet, men arbejdet viste, at kvaliteten af originale filer og processen for opdatering betyder tid og penge i starten.
Hvad du skal være opmærksom på
Embeddings er stærke, men ikke fejlfrie. Kvaliteten afhænger af input: dårlige scannede PDF er giver dårlige embeddings. Embeddings gemmes som tal og kan indeholde information, der stammer fra jeres dokumenter, så tjek hvem der får adgang, og om embeddings bruges til at træne andre modeller. Hvis I behandler persondata, så tjek reglerne hos Datatilsynet. Endelig: embeddings hjælper med at finde mening, men de garanterer ikke korrekthed i et svar. Brug altid en menneskelig godkendelse, når resultaterne skal bruges udadtil.
Embedding er ikke det samme som semantisk søgning
Embedding er selve vektorrepræsentationen, mens semantisk søgning er den funktion, der bruger embeddings til at finde relevante dokumenter. Embeddings er rådata, semantisk søgning er anvendelsen. Begge begreber optræder ofte sammen, men de er ikke det samme.
Det tunge ved embedding er sjældent at komme i gang, men at holde det kørende. Det er jobbet for et AI-team i huset. Vil I have et bud på, om embedding overhovedet er jeres næste skridt, så er det dét, AI-rådgivning er til for.
Ofte stillede spørgsmål om Embedding
Er embedding det samme som en vektor?
Ja. I denne sammenhæng betyder vektor det samme som embedding: en række tal, der repræsenterer betydningen af tekst eller billede.
Kan jeg bruge embeddings uden udviklere?
Ja, flere leverandører tilbyder færdige løsninger, hvor I uploader dokumenter og får semantisk søgning. Men I skal regne med at skulle rydde op i filer og godkende resultater sammen med en teknisk person.
Koster det noget at lave embeddings?
Der er typisk en omkostning: tid til at forberede dokumenter, betaling for den tjeneste der sender indholdet til at lave embeddings, og løbende omkostninger ved opdatering og opbevaring af indekset.
Er embeddings private, eller kan leverandøren bruge dem til at træne deres modeller?
Det afhænger af aftalen. Spørg leverandøren direkte; hvis embeddings eller underliggende tekst bruges til træning af offentlige modeller, skal det stå i kontrakten, og I bør tjekke dataregler hos Datatilsynet.

AI-rådgiver og underviser, grundlægger af AI Hero i Herning. Har bygget digitalt i over 20 år og hjælper danske virksomheder med at få AI i drift. Læs mere om Brian.