Struktureret og ustruktureret data
Mails, PDF'er og tilbud er pludselig brugbar virksomhedsdata for AI.
Indhold
- Sådan virker Struktureret og ustruktureret data i praksis
- Hvorfor Struktureret og ustruktureret data betyder noget for din virksomhed
- Eksempel: kontorlederen der skal samle materiale før revisionen
- Struktureret og ustruktureret data er ikke det samme som Datasæt eller Vidensbase (knowledge base)
- Sådan kommer du i gang med ustrukturerede data
- Hvad du skal være opmærksom på
- Ofte stillede spørgsmål om Struktureret og ustruktureret data
Struktureret og ustruktureret data er to måder at gemme information på. Struktureret data ligger i faste felter, tænkt regneark, ERP-poster og CRM-felter, hvor hver værdi har et præcist sted. Ustruktureret data er dokumenter, mails, mødenotater, PDF'er, billeder og lyd, hvor informationen er i fri tekst eller billeder og ikke ligger i faste tabeller.
Sådan virker Struktureret og ustruktureret data i praksis
Struktureret data svarer til en mappe med indexkort: du kan slå op på kundenummer og få adresse, betalingsstatus og ordrehistorik straks. Ustruktureret data er som en bunke breve, tilbud og scannede tegninger: det er rigt på viden, men sværere at slå op i. Det nye ved moderne sprogmodeller er, at de kan "læse" fritekst og trække relevant information ud, så en mail bliver til søgbar viden og et PDF-udkast bliver til svar på kundespørgsmål.
Hvorfor Struktureret og ustruktureret data betyder noget for din virksomhed
Som leder skal du se mails, tilbud og mødereferater som ressourcer, ikke støj. Langt størstedelen af en virksomheds information er ustruktureret, ofte anslået til 80 procent, og det er her, mange af de hurtige gevinster med AI findes. Når AI kan forstå jeres fritekst, kan I finde dokumenter, udtrække beløb, opsummere møder og genbruge tilbudstekst uden manuelt arbejde. Det ændrer, hvad I kan automatisere, og hvilke medarbejdere I bør involvere i projekter om data.
Eksempel: kontorlederen der skal samle materiale før revisionen
En kontorleder i en rådgivervirksomhed sidder en mandag morgen tre uger før regnskabsafslutningen. Hun har 5.400 mails, 60 PDF-rapporter fra tidligere projekter, en mappe med scannede tegninger og en gammel prisliste i Excel. Opgaven er at finde alle aftaler med en bestemt leverandør og samle bilag til en ekstern revision. Hun prøver først at søge manuelt gennem mails og PDF'er, men søgeresultater er ufuldstændige, og en nøglekontrakt er scannet som billede. Virksomheden vælger at køre dokumenterne gennem en OCR-service og et søgelag baseret på en sprogmodel. Først virker det ikke helt: OCR'en misser tekst på håndskrevne bilag, og sprogmodellens svar indeholder for brede hits. Det kræver en runde med kvalitetssikring af data, korrektion af OCR-fejl og at lage metadateregler for dokumenttyper. Resultatet er, at kontorlederen efter tre dage kan fremfinde 24 relevante dokumenter, konklusioner og kontraktdatoer samlet i én mappe. Det kostede tid: to dages arbejde fra en deltidsmedarbejder og udgifter til en kort teknisk opsætning, men nu er adgangen til dokumenterne gentagelig for næste revision.
Struktureret og ustruktureret data er ikke det samme som Datasæt eller Vidensbase (knowledge base)
Et datasæt er en samling data, ofte sat i relation og klargjort til analyse eller træning. En vidensbase (knowledge base) er et opslagslager, hvor svar og dokumenter er organiseret til brugere eller tjenester. Struktureret og ustruktureret beskriver formen på dataene, ikke nødvendigvis hvordan de er organiseret eller anvendt. Du kan for eksempel samle ustrukturerede dokumenter i en vidensbase, men hvis de ikke er markeret eller renset, fungerer søgning og AI-svar ringe. Datakvalitet er derfor afgørende: det er forskellen mellem en søgning, der rammer plet, og en der giver irrelevante resultater.
Sådan kommer du i gang med ustrukturerede data
- Gør en hurtig kortlægning: find hvor jeres mails, PDF'er, billeder og lyd ligger, og noter formater, antal og ejerskab.
- Start småt med et pilotområde, for eksempel kundeservice-mails eller tilbudsarkiv, og vælg konkrete spørgsmål, I vil have svar på.
- Rens og standardiser: kør OCR på scannede dokumenter, fjern duplikater og tilføj simple metadata (år, kunde, dokumenttype).
- Test en sprogmodel på pilotdata og mål kvalitet: kan modellen finde kontraktdatoer og opsummere mødenotater korrekt?
- Skaler gradvist og fastlæg ansvar for vedligeholdelse af datasættet og datakvalitet.
Hvad du skal være opmærksom på
Ustrukturerede data kan indeholde personoplysninger og fortrolige oplysninger, så tjek reglerne for behandling og opbevaring, og undersøg hvilke leverandører I bruger. Sprogmodeller kan genbruge tekst på uforudsete måder, så overvej adgangsbegrænsning og logning. Tjek relevante krav og vejledninger hos Datatilsynet. En sprogmodel gør det nemmere at trække viden ud, men det kræver arbejde med datakvalitet og styring; med stor magt følger stort ansvar, og en god styring er det, der adskiller et nyttigt system fra et uoverskueligt arkiv.
Er I i tvivl om, hvad struktureret og ustruktureret data betyder for jeres eget ansvar, så tag det med i AI-rådgivningen.
Ofte stillede spørgsmål om Struktureret og ustruktureret data
Er ustruktureret data det samme som rod?
Nej. Ustruktureret betyder blot, at informationen ikke ligger i faste felter. Det kan være meget værdifuldt indhold, men det kræver behandling, f.eks. OCR og rensning, før AI kan bruge det effektivt.
Kan AI arbejde direkte med mine mails og PDF'er?
Ja, moderne sprogmodeller kan læse fritekst og ekstrahere oplysninger, men ofte skal dokumenter først renses, OCR-behandles og have baseline-metadata for at give pålidelige resultater.
Hvad er forskellen på datasæt og en vidensbase?
Et datasæt er en organiseret samling data til analyse eller træning. En vidensbase er et opslagslager designet til at levere svar. Begge kan indeholde struktureret og ustruktureret data, men de bruges forskelligt.
Hvor meget af virksomhedens data er ustruktureret?
Det varierer, men ofte anslås det, at omkring 80 procent af en virksomheds data er ustruktureret. Det er netop i de dokumenter og mails, AI oftest kan skabe nye muligheder.

AI-rådgiver og underviser, grundlægger af AI Hero i Herning. Har bygget digitalt i over 20 år og hjælper danske virksomheder med at få AI i drift. Læs mere om Brian.