AI-crawler

Ukendte bot-besøg i loggen, vælg om I vil være synlige for AI eller ej.

Opdateret 15. september 2026Læsetid 4 min.Af Brian Brandt · På engelsk: AI crawler
Indhold
  1. Sådan virker AI-crawler i praksis
  2. Hvorfor I skal tage stilling til AI-crawlere
  3. Sådan tillader eller blokerer du dem i robots.txt
  4. Eksempel: AI-crawler hos en dansk SoMe-ansvarlig
  5. AI-crawler er ikke det samme som Web scraping eller Træning
  6. Hvad du skal være opmærksom på
  7. Ofte stillede spørgsmål om AI-crawler

AI-crawler er et navn for automatiserede bots fra aktører som OpenAI, Anthropic, Google og Perplexity, der systematisk henter indhold fra internettet. Nogle crawlere samler data til fremtidig modeltræning, andre henter sider for at kunne give svar i realtid. De opfører sig som almindelige crawlere, men de bruger indholdet til at træne eller supplere AI-svar.

Sådan virker AI-crawler i praksis

En AI-crawler er ligesom et postbud, der tager en kopi af hvert brev i stedet for at levere det. Trænings-crawlere downloader store mængder indhold og lagrer det i store datasæt, som bruges til at træne modeller. Søge-crawlere eller indeks-crawlere henter sider for at give et AI-værktøj mulighed for at citere eller besvare et spørgsmål i realtid. Begge typer besøger URL'er, læser HTML, følger links og registrerer metadata, men formålet med lagringen og brugen af indholdet er forskelligt.

Hvorfor I skal tage stilling til AI-crawlere

Du vil se poster i serverlogs, brugere spørger, og ledelsen hører om medier, der blokerer AI. Valget er et bevidst strategisk valg mellem synlighed og kontrol. Tillader I crawlere, kan jeres artikler, produktbeskrivelser eller blogindlæg blive brugt direkte i AI-svar og derved give omtale uden klik. Blokerer I dem i robots.txt, får I kontrol over kopiering, men så forsvinder I fra den del af AI-økosystemet, der viser kilder og uddrag.

Sådan tillader eller blokerer du dem i robots.txt

Robots.txt er en simpel tekstfil i roden af dit websted som fortæller bots, hvad de må eller ikke må hente. For at tillade eller blokere en specifik AI-crawler, tilføjer du en linje med dens user-agent navn, for eksempel GPTBot eller ClaudeBot, og angiver Disallow: / eller Allow: /. I praksis skal du:

  1. Checke dine serverlogs for user-agent-navnene der besøger sitet.
  2. Opdatere robots.txt med specifikke regler for de navne, du vil blokere eller tillade.
  3. Overvåge igen, for bots kan ændre navn eller IP-adresser.

Husk, robots.txt er en aftale, ikke en lås; ondsindet scraping ignorerer filen, og nogle bot-udbydere kan ændre, hvordan de navngiver deres crawlere.

Eksempel: AI-crawler hos en dansk SoMe-ansvarlig

En SoMe-ansvarlig på et lille møbelfirma opdager i juli en ny user-agent i webloggen, der downloader produkt- og blog-sider midt i kampagnesæsonen. Hun vil ikke have, at ældre produktark fra 2018 bruges i AI-svar, fordi priser og mål er ændret. Efter en hurtig gennemgang tilføjer hun Disallow for den specifikke user-agent i robots.txt og opdaterer en side med en kort note om opdaterede mål og priser. Modstanden: nogle blogindlæg mister synlighed i AI-svar, og kundesupport får ekstra forespørgsler fra brugere, der nævner AI-uddrag. Besværet kostede en halv dags arbejde og lidt ekstra koordination med marketing, men gav ro om kontrol af ældre indhold.

AI-crawler er ikke det samme som Web scraping eller Træning

Web scraping er den brede teknik, hvor nogen automatisk henter data fra websider, ofte til konkret brug som prissammenligning. Trænings-crawlere er en type scraping, men formålet er at skabe store sæt til maskinlæring. Ikke alle crawlere træner modeller; nogle leverer kun indhold til søgefunktioner eller chat-svar i realtid. Relaterede navne du vil se i logs er GPTBot, ClaudeBot, PerplexityBot og Google-Extended. OpenAI, Anthropic og Perplexity er eksempler på virksomheder bag sådanne crawlere.

Hvad du skal være opmærksom på

Blokering i robots.txt stopper ofte lovlydige crawlere og fjerner jer fra AI-svar, men det stopper ikke ondsindet scraping. Hvis jeres indhold indeholder persondata, kontraktligt følsomme oplysninger eller ophavsretligt materiale, skal I overveje en politik for hvad der må crawles, og en proces til at anmode om fjernelse. Hold øje med nye user-agents, opbevar en kopi af gamle robots.txt-regler, og vær forberedt på at ændre strategi, når crawlere skifter adfærd.

Når medarbejderne selv skal kunne bruge AI-crawler og ikke bare kende ordet, sker det hurtigst på en AI-workshop.

Ofte stillede spørgsmål om AI-crawler

Er GPTBot det samme som OpenAI?

GPTBot er navnet på en crawler, som OpenAI har brugt. OpenAI er firmaet bag botten, men ikke alle AI-crawlere er fra OpenAI. Tjek altid user-agent i dine logs for at se, hvem der besøger.

Hvordan blokerer jeg AI-crawlere i robots.txt?

Find eller opret en robots.txt i webstedets rod og tilføj en section med User-agent: [navn] og Disallow: /. Sæt navnet til det, du ser i dine serverlogs, for eksempel GPTBot eller ClaudeBot.

Forlorer vi synlighed i AI-svar hvis vi blokerer crawlere?

Ja, lovlydige AI-tjenester vil ofte udelukke indhold, der er blokeret via robots.txt. I holder styr på kopiering, men I mister også chancen for at jeres tekst bliver brugt i AI-genererede svar.

Kan jeg tillade nogle AI-bots og blokere andre?

Ja, robots.txt tillader specifikke regler per user-agent, så du kan tillade for eksempel Googlebot, men blokere GPTBot. Overvåg logs, for user-agents og politikker kan ændre sig.

Brian Brandt

AI-rådgiver og underviser, grundlægger af AI Hero i Herning. Har bygget digitalt i over 20 år og hjælper danske virksomheder med at få AI i drift. Læs mere om Brian.

Mangler der et ord, eller er der noget der er forkert?

Skriv til brian@aihero.dk eller ring på 28 35 84 54. Ordbogen bliver bedre af det.

Tilbage til ordbogen

AI, der kommer i drift. Én mail om måneden.

Brian skriver om, hvad der reelt virker med AI i danske virksomheder, set fra gulvet hos dem, der bruger det hver dag. Ingen hype, ingen nyhedsstrøm.

  • Konkrete eksempler: hvad der virkede, hvad det kostede, og hvad der gik galt
  • Værktøjer jeg selv bruger, testet i praksis, før de nævnes
  • Ét brev om måneden. Ikke mere. Afmeld når du vil.

Du får en mail, hvor du bekræfter din tilmelding. Vi deler aldrig din adresse, privatlivspolitik.