Skip to content

Robots.txt

Koncept inden for AI-søgning og SEO
Volatil, sidst kontrolleret 2026-09-04 Denne side indeholder målte tal, der hurtigt ændrer sig.Gennemgået 2026-09-04

Robots.txt er en almindelig tekstfil i roden af en vært, der fortæller automatiserede klienter, hvilke stier de må hente. RFC 9309, udgivet i 2022, specificerer og udvider den konvention, Martijn Koster definerede i 1994[1], og angiver i samme dokument, at dens regler er en anmodning snarere end adgangskontrol[2]. Siden 2023 har filen haft en anden opgave, den aldrig var designet til: at adskille AI-crawlere, der indsamler træningsdata, fra dem, der henter en side live for at besvare et spørgsmål, gennem tokens, som hver operatør opfinder og dokumenterer på egen hånd.

Tokens, som AI-operatørerne udgiver

Der findes ingen registrering af brugeragent-tokens, så hver operatør navngiver og dokumenterer sine egne. OpenAI driver GPTBot til træningsdata og siger, at et Disallow for det signalerer, at et websteds indhold ikke bør bruges til at træne grundmodeller[3]. Separate tokens dækker søgning og annoncering, mens ChatGPT-User henter en side, fordi en person har bedt om det, et tilfælde hvor OpenAI advarer om, at robots.txt-regler muligvis ikke gælder[4]. Anthropic opdeler ClaudeBot, Claude-User og Claude-SearchBot langs de samme linjer og angiver, at dens bots respekterer Disallow og Crawl-delay[5]. Perplexity dokumenterer PerplexityBot som en søgeindeks-crawler og siger, at dens Perplexity-User-token generelt ignorerer robots.txt[6]. Detaljer pr. bot findes i bot-encyklopædien.

Google-Extended

Google tilføjede Google-Extended den 28. september 2023 som en kontrol over, hvorvidt et websteds indhold hjælper med at forbedre Bard og Vertex AI generative API'er[7]. Det styrer nu træningen af Gemini-modellerne og grundlaget i Gemini Apps og Vertex AI, og Google angiver, at blokering af det ikke påvirker et websteds inklusion i Google Søgning og ikke bruges som et rangeringssignal der[8]. De to kontroller er separate håndtag på den samme crawl: Googlebot bestemmer, om en side indekseres, Google-Extended bestemmer, om den crawlede tekst føder Gemini-træning og -grundlag. Blokering af det efterlader derfor søgetilstedeværelsen, AI Overviews inkluderet, uberørt.

Overholdelse er frivillig

Intet i protokollen håndhæver noget. En crawler kan ignorere reglerne, forfalske sin identitet eller på anden måde undgå opdagelse[9], og Cloudflare rapporterer, at AI-crawlere foretager mere end 50 milliarder anmodninger om dagen til dets netværk, lige under 1% af alle anmodninger det ser, hvoraf nogle ignorerer no-crawl-direktiver[10]. Den første storstilede måling af overholdelse, over 130 selvdeklarerede bots og 40 dages institutionelle weblogs, fandt, at bots er mindre tilbøjelige til at overholde strengere direktiver, og at AI-søgecrawlere sjældent anmoder om filen overhovedet[11]. Udgivere har strammet filen hurtigt. Consent in Crisis-revisionen af 14.000 domæner fandt, at inden for et år kom robots.txt til fuldt ud at begrænse mere end 5% af alle tokens i C4-korpusset og mere end 28% af dets mest aktivt vedligeholdte kilder, med 45% af C4 begrænset af servicevilkår[12]. Se træningsdata versus genfinding for at forstå, hvorfor de to slags blokeringer har forskellige konsekvenser.

At sige, hvad en crawl er til for

To bestræbelser udvider filen fra hvem der må crawle til hvad crawlen er til for. Cloudflare's Content Signals Policy, annonceret den 24. september 2025, tilføjer en content-signal-direktiv med ja- eller nej-værdier for tre anvendelser: søgning, generative svar og modeltræning[13]. Dets administrerede robots.txt anvendte allerede politikken på mere end 3,8 millioner domæner ved lanceringen[14]. IETF AI Preferences arbejdsgruppen standardiserer den samme idé som et ordforråd plus et sæt vedhæftningsmetoder, herunder robots.txt[15]. Begge arver svagheden fra originalen: en præference i en fil er kun værd, hvad læseren vælger at give den. Sammenlign llms.txt, som beder om opmærksomhed snarere end at tilbageholde den, og aftaler om indholdslicensering, som erstatter anmodningen med en kontrakt.

Referencer (15)
  1. RFC 9309: Robots Exclusion Protocol Arkiv
    Dokumentation Udgivet 2022-09 Hentet 2026-09-04
  2. RFC 9309: Robots Exclusion Protocol Arkiv
    Dokumentation Udgivet 2022-09 Hentet 2026-09-04
  3. OpenAI crawlers - OpenAI developer documentation Arkiv
    Dokumentation Udgivet 2023-08 Hentet 2026-09-04
  4. OpenAI crawlers - OpenAI developer documentation Arkiv
    Dokumentation Udgivet 2023-08 Hentet 2026-09-04
  5. Does Anthropic crawl data from the web, and how can site owners block the crawler? - Anthropic support Arkiv
    Dokumentation Udgivet 2024 Hentet 2026-09-04
  6. Perplexity crawlers - Perplexity documentation Arkiv
    Dokumentation Udgivet 2024 Hentet 2026-09-04
  7. An update on web publisher controls - Google Arkiv
    Leverandørdokumentation Udgivet 2023-09-28 Hentet 2026-09-04
  8. Google's common crawlers - Google Search Central Arkiv
    Dokumentation Udgivet 2025 Hentet 2026-09-04
  9. LLMs.txt Tracking Study and Live Dashboard - Originality.ai Arkiv
    Leverandørdokumentation Udgivet 2026-07-03 Hentet 2026-09-04
  10. Trapping misbehaving bots in an AI Labyrinth - Cloudflare Arkiv
    Leverandørdokumentation Udgivet 2025-03-19 Hentet 2026-09-04 Enkeltkilde Volatil, sidst kontrolleret 2026-09-04
  11. Scrapers selectively respect robots.txt directives: evidence from a large-scale empirical study
    Akademisk Udgivet 2025-05-27 Hentet 2026-09-04
  12. Consent in Crisis: The Rapid Decline of the AI Data Commons - arXiv Arkiv
    Akademisk Udgivet 2024-07-20 Hentet 2026-09-04 Volatil, sidst kontrolleret 2026-09-04
  13. Giving users choice with Cloudflare's new Content Signals Policy Arkiv
    Leverandørdokumentation Udgivet 2025-09-24 Hentet 2026-09-04
  14. Giving users choice with Cloudflare's new Content Signals Policy Arkiv
    Leverandørdokumentation Udgivet 2025-09-24 Hentet 2026-09-04
  15. AI Preferences (aipref) - IETF Datatracker Arkiv
    Dokumentation Udgivet 2025 Hentet 2026-09-04

Sidst opdateret 2026-09-04. Skrevet og vedligeholdt af Baseline Labs.

George
Online
0%