Datasæt
Det leverandøren spørger om første gang: de data, AI skal lære af.
Indhold
Datasæt er en afgrænset, struktureret samling data, typisk eksempler som kundehenvendelser, fakturaer eller produktbilleder, som bruges til at træne, finetune eller teste en AI-model. Et datasæt kan opdeles i trænings-, validerings- og testsæt; renhed og repræsentativitet betyder ofte mere end rå størrelse.
Sådan virker et datasæt i praksis
Et datasæt svarer til de øvelser, du giver en elev: træningssættet er lektierne, valideringssættet er de stikprøver læreren bruger undervejs, og testsættet er eksamen. Træningssættet indeholder de fleste eksempler og er det, modellen lærer mønstre af. Valideringsættet bruges til at følge med i, om modellen begynder at snyde sig til løsninger ved at huske eksemplerne præcist, og testsættet er en endelig kontrol, som må være uvildigt og ikke set før.
Kvaliteten af et datasæt handler om to ting: korrekt mærkning og repræsentativitet. Hvis 20 procent af jeres kundehenvendelser er forkert kategoriseret, lærer modellen de forkerte svar. Og hvis datasættet kun rummer klager fra én kundegruppe, vil modellen arbejde dårligt for de øvrige. Et lille, rent datasæt kan ofte give bedre resultater end et stort, rodet ét, fordi modellen så lærer fra rigtige eksempler i stedet for at blive forvirret af fejl og støj.
Hvorfor leverandøren spørger: 'Har I et datasæt?'
Når en leverandør eller konsulent foreslår en AI-løsning, er deres første praktiske spørgsmål ofte: har I et datasæt? Det er her beslutningen om løsningens realisme bliver taget. Hvis I kan pege på 1.000 relevante, mærkede eksempler, er der en konkret chance for at bygge en prototyp. Uden data bliver løsningen teoretisk og dyr, fordi I først skal indsamle, rense og mærke data.
Du skal kunne svare på tre ting: hvad dataene præcist er (emails, PDF'er, CRM-udtræk), hvor mange eksempler I har, og hvor gode labels er (er emnelinjer rigtige, er svar korrekte). Forbered dig på, at leverandøren vil bede om et lille udsnit først, så modellen kan afprøves hurtigere.
Eksempel: Datasæt hos en kontorleder
En kontorleder på et rådgivningskontor sad en tirsdag morgen med en bunke PDF-forslag og en travl uge foran sig. De havde 3.400 tidligere tilbud som PDF og 2.100 kundemails i en mappe. Leverandøren bad om 500 eksempler med det rigtige svar markeret, hvilke tilbud blev sendt, hvem blev valgt, og hvorfor. Kontorlederen eksporterede 500 tilbud, men fandt hurtigt ud af, at 120 PDF'er var scannede billeder, nogle priser var fra 2017, og flere tilbud manglede firmaspecifikke felter.
Det tog to dage at rydde i de 500 filer: konvertere scannede sider, rette manglende felter og standardisere produktnavne. Den første test viste, at modellen misforstod tre produktkoder, fordi de var stavet forskelligt i to regneark. Modellen kunne trænes videre, men kontorlederen lærte, at tiden til at forberede et rent udvalg ofte er dialogens skjulte omkostning. En ulempe var, at det krævede interne ressourcer og ekstra gennemgang af gamle tilbud, men fordelen var, at leverandøren kunne lave en realistisk prøve inden der blev sat et større budget af.
Datasæt er ikke det samme som rå data eller backup
Rå data er alt, I har liggende: mails, logfiler, scannede kontrakter. Et datasæt er et udvalgt, struktureret udsnit med klare labels, formateret til at blive brugt i træning. Testsæt er ikke for at træne på, men for at kontrollere resultater. Mange forveksler 'meget data' med 'godt datasæt', men masser af ustruktureret, mislabeled data kan skade modellen. Tænk på det som at give en GPS et kort fra 1999: meget information, men muligvis upræcis og upraktisk.
Overvej altid, hvordan I vil opbevare og dele datasættet, hvem der ejer labels, og hvordan I dokumenterer frasortering og rengøring. En AI-model kan kun blive så præcis som det datasæt, den trænes på, så arbejd først med dataudvælgelse før store løfter om resultater.
Det tunge ved datasæt er sjældent at komme i gang, men at holde det kørende. Det er jobbet for et AI-team i huset. Vil I have et bud på, om datasæt overhovedet er jeres næste skridt, så er det dét, AI-rådgivning er til for.
Ofte stillede spørgsmål om Datasæt
Er et datasæt det samme som vores samlede data?
Nej. Et datasæt er et udvalgt og struktureret udsnit af jeres samlede data, ofte med labels, der beskriver det korrekte svar. Rå data kan ligge i systemer; et datasæt er det, I aktivt udvælger og rengør til træning og test.
Hvor mange eksempler skal et datasæt have for AI?
Det afhænger af opgaven og kompleksiteten, men ofte starter leverandører med nogle hundrede til et par tusinde mærkede eksempler for en prototype. Kvaliteten af eksemplerne og konsistensen i labels betyder ofte mere end blot antal.
Kan vi bruge kundemails som datasæt til AI?
Ja, kundemails kan være et godt datasæt, men de skal anonymiseres og renses for personfølsomme oplysninger hvis de indeholder persondata. Tjek eventuelt reglerne hos Datatilsynet før deling med leverandører.
Koster det meget at gøre et datasæt klart?
Omkostningen varierer: en lille forpræparation kan tage få dage internt, mens større rengørings- og mærkningsprojekter kan tage flere uger eller kræve ekstern hjælp. Det er normalt en nødvendig investering før en pålidelig AI-model kan bygges.

AI-rådgiver og underviser, grundlægger af AI Hero i Herning. Har bygget digitalt i over 20 år og hjælper danske virksomheder med at få AI i drift. Læs mere om Brian.