Web scraping

Sådan læser og bruger AI jeres hjemmesidetekst, og hvad I må scrappe.

Opdateret 15. september 2026Læsetid 3 min.Af Brian Brandt
Indhold
  1. Sådan virker Web scraping i praksis
  2. Hvorfor marketingfolk skal kende til AI-crawlere
  3. Eksempel: Web scraping hos en kontorleder
  4. Hvad du skal være opmærksom på
  5. Ofte stillede spørgsmål om Web scraping

Web scraping er automatisk indsamling af data fra hjemmesider, fx priser, produkttekster eller artikler. Det kan være en intern proces, hvor I henter materiale til analyse eller træning af egne modeller, og det kan være eksterne AI-crawlere, som besøger jeres site for at indsamle data til store sprogmodeller. Begge sider har juridiske og praktiske grænser: ophavsret, websites' tekniske restriktioner og persondataregler spiller ind.

Sådan virker Web scraping i praksis

Web scraping svarer i hverdagen til at sende en assistent ind på en hjemmeside og bede vedkommende kopiere bestemte oplysninger ud i et regneark. I stedet for menneskehænder bruger man et program, som åbner sider, finder de relevante felter (titel, pris, beskrivelse) og gemmer dem struktureret. Det betyder, at du kan indsamle data langt hurtigere end manuelt, men også at du nemt kan hente forkerte eller ufuldstændige oplysninger, hvis layoutet på siden ændrer sig eller hvis teksten er et billede. Mange virksomhedssider har flere formater: en HTML-produktside, en PDF-prisliste og scannede tegninger på et projektdokument. Et scraper-værktøj kan hente dem alle, men kræver ofte opsætning og efterkontrol.

Hvorfor marketingfolk skal kende til AI-crawlere

Marketingfolk oplever ofte, at tekster fra hjemmesiden dukker op i AI-svar eller i konkurrenters værktøjer. Det sker, fordi nogle AI-udbydere bruger såkaldte AI-crawlere, der automatisk henter offentligt tilgængeligt indhold fra nettet til træning eller indeks. For jer betyder det, at alt, hvad I har online, potentielt kan blive brugt til at træne modeller eller gengives i svar fra en chatbot. I kan ikke forhindre, at offentligt tilgængeligt indhold bliver læst, men I kan styre, hvad der er offentligt, og bruge tekniske indstillinger som robots.txt eller indholdslisenser, og I kan vælge, hvilke sider I vil gøre maskinlæsbare.

Eksempel: Web scraping hos en kontorleder

En kontorleder på et mellemstort rådgivningsfirma vågner en tirsdag morgen en uge før aflevering af et tilbud. Firmaet har 120 PDF-klientmapper, en gammel prisliste fra 2019 i Excel og en produktoversigt på hjemmesiden. Hun skal samle priser og tjenestebeskrivelser til et nyt salgsark og forsøger først manuelt. Efter tre timer er kun 15 mapper gennemgået, og en kollega er på ferie. De beslutter at køre et simpelt scraping-script på hjemmesiden og hente alle PDF'er automatisk. Scriptet finder også en scannet tegning i et projektark, som kræver manuel gennemgang, og en prisliste der er ufuldstændig fordi nogle poster ligger i et internt system. Scraperen leverer 95 procent af materialet på to timer, men kræver efterfølgende 90 minutters kvalitetssikring og rettelse af fem fejl i datafelterne. Læringen er klar: scraping sparer tid, men kræver tid til opsætning og kontrol, og ikke al information kan automatiseres uden hjælp fra kolleger eller adgang til interne kilder.

Hvad du skal være opmærksom på

Juridisk og praktisk forsigtighed er nødvendig. Ophavsret betyder, at du ikke frit må genbruge tekster og billeder fra andres sider, selv om du teknisk kan hente dem. Sider kan desuden angive i robots.txt, hvilke crawlere de tillader eller blokerer, og mange udbydere respekterer disse anvisninger. Hvis dine scraping-processer henter personoplysninger, gælder GDPR; overvej formål, dataminimering og opbevaring. Endelig er der en praktisk risiko: aggressive crawlere kan belaste en server og skabe fejl for brugere, og nogle websites har tekniske eller juridiske foranstaltninger mod automatisk adgang. Vil du tjekke regler om persondata og behandling, kig hos Datatilsynet. Husk også, at AI-modeller historisk er trænet på store mængder scrapet internetindhold, og at virksomhedsdata derfor kan være inkluderet i træningssæt uden at I er blevet kontaktet.

Vil I have et bud på, om web scraping overhovedet er jeres næste skridt, så er det dét, AI-rådgivning er til for.

Ofte stillede spørgsmål om Web scraping

Er Web scraping det samme som crawling?

De to ord bruges ofte om hinanden, men forskellen er praktisk: crawling er at gennemgå eller indeksere websider automatiseret, mens scraping handler om at udtrække specifikke datafelter fra de sider, crawlere besøger.

Kan vi bruge scraping til at træne en AI med vores egne data?

Ja, I kan scrape egne eller offentligt tilgængelige kilder til analyse og træning, men I skal sikre jer rettigheder til indholdet, håndtere persondata korrekt og kvalitetssikre de indsamlede data, før I bruger dem i en model.

Hvad gør vi, hvis en AI-crawler læser vores hjemmeside og bruger indholdet?

Start med at undersøge, om indholdet er offentligt, og om det er dækket af ophavsret. Brug robots.txt til at kommunikere crawleregler, og overvej at tydeliggøre licens- eller brugsvilkår for indhold. Hvis persondata er involveret, tjek reglerne hos Datatilsynet.

Kræver web scraping udviklere?

En simpel scraping-opgave kan klares med skabelonværktøjer eller tjenester uden tung udvikling, men pålidelige, store eller blandede datakilder kræver typisk teknisk opsætning og løbende vedligeholdelse.

Brian Brandt

AI-rådgiver og underviser, grundlægger af AI Hero i Herning. Har bygget digitalt i over 20 år og hjælper danske virksomheder med at få AI i drift. Læs mere om Brian.

Relaterede ord i AI-ordbogen

Mangler der et ord, eller er der noget der er forkert?

Skriv til brian@aihero.dk eller ring på 28 35 84 54. Ordbogen bliver bedre af det.

Tilbage til ordbogen

AI, der kommer i drift. Én mail om måneden.

Brian skriver om, hvad der reelt virker med AI i danske virksomheder, set fra gulvet hos dem, der bruger det hver dag. Ingen hype, ingen nyhedsstrøm.

  • Konkrete eksempler: hvad der virkede, hvad det kostede, og hvad der gik galt
  • Værktøjer jeg selv bruger, testet i praksis, før de nævnes
  • Ét brev om måneden. Ikke mere. Afmeld når du vil.

Du får en mail, hvor du bekræfter din tilmelding. Vi deler aldrig din adresse, privatlivspolitik.