Vektordatabase
Der jeres viden gemmes som talrækker, så AI kan finde svar ud fra betydning.
Indhold
En vektordatabase lagrer tekst, billeder og dokumenter som numeriske vektorer (embeddings), så søgning kan finde det, der ligner et spørgsmål i betydning frem for i ordlyd. Den bruges som lageret i RAG-løsninger og semantisk søgning: når nogen stiller et spørgsmål, sammenlignes spørgsmålets vektor med dokumenternes vektorer for at finde de mest relevante stumper.
Sådan virker en vektordatabase i praksis
Når I uploader et dokument, omdannes hver tekststump til en række tal, en såkaldt embedding. En vektordatabase gemmer disse vektorer og kan hurtigt sammenligne dem med en forespørgsel. Forestil dig, at I har 10.000 interne dokumenter: i stedet for at lede efter matchende ord søger databasen efter dokumenter, hvis vektor ligger tættest på spørgsmålets vektor. Det gør den god til spørgsmål hvor ordlyden varierer, et kundesvar formuleret anderledes bliver fundet alligevel. Almindelige databaser kan indeksere ord og fraser, men de kan ikke måle betydningslighed mellem tekster på samme måde.
Hvorfor Vektordatabase er relevant for din virksomhed
Når leverandører i tilbudet skriver "vi gemmer jeres viden i en vektordatabase", så er det her jeres fakta, vejledninger og gamle mailtråde faktisk bor i en RAG-løsning. Som leder skal du vide, at valget påvirker sikkerhed, omkostninger og hvem der kan søge i dataene. En vektordatabase kræver løbende opdatering (nye dokumenter skal embeddes), adgangsstyring så ikke alle medarbejdere kan se alt, og plan for backup og governance, fordi den bliver det primære opslagsted for jeres virksomhedsviden.
Eksempel: Vektordatabase hos en kontorleder i en rådgivervirksomhed
Kontorlederen sidder mandag morgen i et mødelokale i Aarhus, tre dage før et tilbudsfrist. Hun skal samle baggrundsmateriale fra en mappe med 450 dokumenter, inklusiv en scannet 60-siders rapport, gamle tilbud i Word og en mailkæde på ti beskeder. Søgningen i virksomhedens netværksdrev giver kun hits på ældre filnavne, og tidspresset vokser. De beslutter at indeksere materialet i en vektordatabase og køre OCR på de scannede sider. Første forsøg giver upræcise hits, fordi OCR’en fejllæser diagramtekster og nogle dokumenter er på engelsk. Det tager to medarbejdere cirka fem timer at rydde op i scannede sider og genindeksere. Resultatet: næste søgning finder tre relevante afsnit, der ellers ville være overset, men arbejdstiden og opgaven med at sikre korrekt OCR og sprogvalg var en ekstra omkostning. Erfaringen er klar: vektordatabasen hjalp, men den krævede forberedelse, kvalitetssikring og tid.
Vektordatabase er ikke det samme som fuldtekstsøgning eller ChatGPT
En vektordatabase er et lagrings- og søgeværktøj. Den understøtter semantisk søgning ved at finde indhold, der 'betyder' det samme, men den skriver ikke svar selv. ChatGPT er en sprogmodel, der genererer tekst; den bruger eventuelt en vektordatabase i en RAG-opstilling til at hente fakta fra jeres dokumenter. Fuldtekstsøgning matcher ord og fraser; semantisk søgning matcher betydning. Forvent forskellige fejltyper: fuldtekstsøgning misser synonymer, semantisk søgning kan give relevante men upræcise konteksthits.
Hvad du skal være opmærksom på
Tjek hvordan leverandøren håndterer persondata og adgangskontrol, hvis jeres vektordatabase indeholder kunde- eller medarbejderoplysninger, reglerne kan kræve særlig behandling, så tjek Datatilsynet. Overvej også vendor lock-in: ikke alle vektordatabaser gemmer data i et format, som er let at flytte. Planlæg vedligehold: opdateringer, genindeksering efter redigeringer og overvågning af embeddings-drift. Endelig: embeddings kan miste præcision over tid, især når sprog eller terminologi i jeres virksomhed ændrer sig, så sæt en rutine for genindeksering. Tænk på det som at have en bibliotekar, der husker meningen bag bøgerne, ikke kun titlerne, nyttigt, men kræver arbejde og klar ansvarfordeling.
Skal der køre noget med vektordatabase hver dag og ikke kun i et forsøg, er det opgaven for et AI-team i huset.
Ofte stillede spørgsmål om Vektordatabase
Er en vektordatabase det samme som semantisk søgning?
Nej. En vektordatabase er lagrings- og søvemotoren, der gemmer embeddings og udfører sammenligninger. Semantisk søgning beskriver funktionen, at finde indhold efter betydning, som ofte bygger på en vektordatabase.
Kan jeg bruge en vektordatabase uden udviklere?
Ja, der findes færdige løsninger og platforme med brugerflader, men I skal ofte have hjælp til opsætning: OCR på scannede filer, valg af sprogmodel til embeddings og adgangsstyring. Planlæg en teknisk time eller to i starten.
Er vektordatabaser sikre nok til persondata?
Det afhænger af leverandørens hosting, kryptering og adgangskontrol. Hvis databasen indeholder personoplysninger, skal I følge persondatalovgivningen, tjek kravene hos Datatilsynet.
Hvad koster en vektordatabase i praksis?
Omkostninger kommer fra licens eller hosting, løbende embedding-generering når nye dokumenter tilføjes, og tid til datarens og OCR. Et rimeligt budget skal indregne drift og vedligehold, ikke kun den første installation.

AI-rådgiver og underviser, grundlægger af AI Hero i Herning. Har bygget digitalt i over 20 år og hjælper danske virksomheder med at få AI i drift. Læs mere om Brian.