Robots.txt
Robots.txt er en almindelig tekstfil i roden af en vært, der fortæller automatiserede klienter, hvilke stier de må hente. RFC 9309, udgivet i 2022, specificerer og udvider den konvention, Martijn Koster definerede i 1994[1], og angiver i samme dokument, at dens regler er en anmodning snarere end adgangskontrol[2]. Siden 2023 har filen haft en anden opgave, den aldrig var designet til: at adskille AI-crawlere, der indsamler træningsdata, fra dem, der henter en side live for at besvare et spørgsmål, gennem tokens, som hver operatør opfinder og dokumenterer på egen hånd.
Tokens, som AI-operatørerne udgiver
Der findes ingen registrering af brugeragent-tokens, så hver operatør navngiver og dokumenterer sine egne. OpenAI driver GPTBot til træningsdata og siger, at et Disallow for det signalerer, at et websteds indhold ikke bør bruges til at træne grundmodeller[3]. Separate tokens dækker søgning og annoncering, mens ChatGPT-User henter en side, fordi en person har bedt om det, et tilfælde hvor OpenAI advarer om, at robots.txt-regler muligvis ikke gælder[4]. Anthropic opdeler ClaudeBot, Claude-User og Claude-SearchBot langs de samme linjer og angiver, at dens bots respekterer Disallow og Crawl-delay[5]. Perplexity dokumenterer PerplexityBot som en søgeindeks-crawler og siger, at dens Perplexity-User-token generelt ignorerer robots.txt[6]. Detaljer pr. bot findes i bot-encyklopædien.
Google-Extended
Google tilføjede Google-Extended den 28. september 2023 som en kontrol over, hvorvidt et websteds indhold hjælper med at forbedre Bard og Vertex AI generative API'er[7]. Det styrer nu træningen af Gemini-modellerne og grundlaget i Gemini Apps og Vertex AI, og Google angiver, at blokering af det ikke påvirker et websteds inklusion i Google Søgning og ikke bruges som et rangeringssignal der[8]. De to kontroller er separate håndtag på den samme crawl: Googlebot bestemmer, om en side indekseres, Google-Extended bestemmer, om den crawlede tekst føder Gemini-træning og -grundlag. Blokering af det efterlader derfor søgetilstedeværelsen, AI Overviews inkluderet, uberørt.
Overholdelse er frivillig
Intet i protokollen håndhæver noget. En crawler kan ignorere reglerne, forfalske sin identitet eller på anden måde undgå opdagelse[9], og Cloudflare rapporterer, at AI-crawlere foretager mere end 50 milliarder anmodninger om dagen til dets netværk, lige under 1% af alle anmodninger det ser, hvoraf nogle ignorerer no-crawl-direktiver[10]. Den første storstilede måling af overholdelse, over 130 selvdeklarerede bots og 40 dages institutionelle weblogs, fandt, at bots er mindre tilbøjelige til at overholde strengere direktiver, og at AI-søgecrawlere sjældent anmoder om filen overhovedet[11]. Udgivere har strammet filen hurtigt. Consent in Crisis-revisionen af 14.000 domæner fandt, at inden for et år kom robots.txt til fuldt ud at begrænse mere end 5% af alle tokens i C4-korpusset og mere end 28% af dets mest aktivt vedligeholdte kilder, med 45% af C4 begrænset af servicevilkår[12]. Se træningsdata versus genfinding for at forstå, hvorfor de to slags blokeringer har forskellige konsekvenser.
At sige, hvad en crawl er til for
To bestræbelser udvider filen fra hvem der må crawle til hvad crawlen er til for. Cloudflare's Content Signals Policy, annonceret den 24. september 2025, tilføjer en content-signal-direktiv med ja- eller nej-værdier for tre anvendelser: søgning, generative svar og modeltræning[13]. Dets administrerede robots.txt anvendte allerede politikken på mere end 3,8 millioner domæner ved lanceringen[14]. IETF AI Preferences arbejdsgruppen standardiserer den samme idé som et ordforråd plus et sæt vedhæftningsmetoder, herunder robots.txt[15]. Begge arver svagheden fra originalen: en præference i en fil er kun værd, hvad læseren vælger at give den. Sammenlign llms.txt, som beder om opmærksomhed snarere end at tilbageholde den, og aftaler om indholdslicensering, som erstatter anmodningen med en kontrakt.
Referencer (15)
- RFC 9309: Robots Exclusion Protocol Arkiv
- RFC 9309: Robots Exclusion Protocol Arkiv
- OpenAI crawlers - OpenAI developer documentation Arkiv
- OpenAI crawlers - OpenAI developer documentation Arkiv
- Does Anthropic crawl data from the web, and how can site owners block the crawler? - Anthropic support Arkiv
- Perplexity crawlers - Perplexity documentation Arkiv
- An update on web publisher controls - Google Arkiv
- Google's common crawlers - Google Search Central Arkiv
- LLMs.txt Tracking Study and Live Dashboard - Originality.ai Arkiv
- Trapping misbehaving bots in an AI Labyrinth - Cloudflare Arkiv
- Scrapers selectively respect robots.txt directives: evidence from a large-scale empirical study
- Consent in Crisis: The Rapid Decline of the AI Data Commons - arXiv Arkiv
- Giving users choice with Cloudflare's new Content Signals Policy Arkiv
- Giving users choice with Cloudflare's new Content Signals Policy Arkiv
- AI Preferences (aipref) - IETF Datatracker Arkiv
Sidst opdateret 2026-09-04. Skrevet og vedligeholdt af Baseline Labs.