Skip to content

Robots.txt

Koncept inom AI-sökning och SEO
Flyktig, senast kontrollerad 2026-09-04 Denna sida innehåller mätvärden som snabbt förändras.Granskad 2026-09-04

Robots.txt är en oformaterad textfil i roten av en värd som talar om för automatiserade klienter vilka sökvägar de får hämta. RFC 9309, publicerad 2022, specificerar och utökar konventionen som Martijn Koster definierade 1994[1], och anger i samma dokument att dess regler är en begäran snarare än åtkomstkontroll[2]. Sedan 2023 har filen haft en andra uppgift den aldrig var avsedd för: att skilja AI-crawlers som samlar in träningsdata från dem som hämtar en sida live för att svara på en fråga, genom tokens som varje operatör uppfinner och dokumenterar på egen hand.

Tokens som AI-operatörerna publicerar

Inget register över användaragent-tokens existerar, så varje operatör namnger och dokumenterar sina egna. OpenAI driver GPTBot för träningsdata och säger att en Disallow för den signalerar att en webbplats innehåll inte ska användas för att träna grundmodeller[3]. Separata tokens täcker sökning och annonsering, medan ChatGPT-User hämtar en sida för att en person bad om det, ett fall där OpenAI varnar för att robots.txt-regler kanske inte gäller[4]. Anthropic delar upp ClaudeBot, Claude-User och Claude-SearchBot längs samma linjer och anger att dess bots respekterar Disallow och Crawl-delay[5]. Perplexity dokumenterar PerplexityBot som en sökindex-crawler och säger att dess Perplexity-User-token generellt ignorerar robots.txt[6]. Detaljer per bot finns i bot-encyklopedin.

Google-Extended

Google lade till Google-Extended den 28 september 2023 som en kontroll över huruvida en webbplats innehåll hjälper till att förbättra Bard och Vertex AI generativa API:er[7]. Den styr nu träning av Gemini-modellerna och grundning i Gemini Apps och Vertex AI, och Google anger att blockering av den inte påverkar en webbplats inkludering i Google Sök och inte används som en rankningssignal där[8]. De två kontrollerna är separata spakar på samma crawl: Googlebot bestämmer om en sida indexeras, Google-Extended bestämmer om den crawlade texten matar Gemini-träning och grundning. Att blockera den lämnar därför Sök-närvaro, AI-översikter inkluderade, orörd.

Efterlevnad är frivillig

Inget i protokollet tvingar fram något. En crawler kan ignorera reglerna, förfalska sin identitet eller på annat sätt undvika upptäckt[9], och Cloudflare rapporterar att AI-crawlers gör mer än 50 miljarder förfrågningar per dag till deras nätverk, strax under 1% av alla förfrågningar de ser, varav vissa ignorerar no-crawl-direktiv[10]. Den första storskaliga mätningen av efterlevnad, över 130 självdeklarerade bots och 40 dagars institutionella webbloggar, fann att bots är mindre benägna att följa strängare direktiv, och att AI-sök-crawlers sällan begär filen alls[11]. Publicister har snabbt skärpt filen. Granskningen "Consent in Crisis" av 14 000 domäner fann att inom ett år kom robots.txt att fullständigt begränsa mer än 5% av alla tokens i C4-korpusen och mer än 28% av dess mest aktivt underhållna källor, med 45% av C4 begränsat av användarvillkor[12]. Se träningsdata kontra hämtning för varför de två typerna av block har olika konsekvenser.

Att säga vad en crawl är till för

Två ansträngningar utökar filen från vem som får crawla till vad crawlen är till för. Cloudflares Content Signals Policy, som tillkännagavs den 24 september 2025, lägger till ett content-signal-direktiv med ja- eller nej-värden för tre användningsområden: sökning, generativa svar och modellträning[13]. Dess hanterade robots.txt tillämpade redan policyn på mer än 3,8 miljoner domäner vid lanseringen[14]. IETF AI Preferences arbetsgrupp standardiserar samma idé som ett ordförråd plus en uppsättning bifogningsmetoder, robots.txt bland dem[15]. Båda ärver svagheten hos originalet: en preferens i en fil är bara värd vad läsaren väljer att ge den. Jämför llms.txt, som ber om uppmärksamhet snarare än att undanhålla den, och innehållslicensavtal, som ersätter begäran med ett kontrakt.

Referenser (15)
  1. RFC 9309: Robots Exclusion Protocol Arkiv
    Dokumentation Publicerad 2022-09 Hämtad 2026-09-04
  2. RFC 9309: Robots Exclusion Protocol Arkiv
    Dokumentation Publicerad 2022-09 Hämtad 2026-09-04
  3. OpenAI crawlers - OpenAI developer documentation Arkiv
    Dokumentation Publicerad 2023-08 Hämtad 2026-09-04
  4. OpenAI crawlers - OpenAI developer documentation Arkiv
    Dokumentation Publicerad 2023-08 Hämtad 2026-09-04
  5. Does Anthropic crawl data from the web, and how can site owners block the crawler? - Anthropic support Arkiv
    Dokumentation Publicerad 2024 Hämtad 2026-09-04
  6. Perplexity crawlers - Perplexity documentation Arkiv
    Dokumentation Publicerad 2024 Hämtad 2026-09-04
  7. An update on web publisher controls - Google Arkiv
    Leverantörsdokumentation Publicerad 2023-09-28 Hämtad 2026-09-04
  8. Google's common crawlers - Google Search Central Arkiv
    Dokumentation Publicerad 2025 Hämtad 2026-09-04
  9. LLMs.txt Tracking Study and Live Dashboard - Originality.ai Arkiv
    Leverantörsdokumentation Publicerad 2026-07-03 Hämtad 2026-09-04
  10. Trapping misbehaving bots in an AI Labyrinth - Cloudflare Arkiv
    Leverantörsdokumentation Publicerad 2025-03-19 Hämtad 2026-09-04 Enkelkälla Flyktig, senast kontrollerad 2026-09-04
  11. Scrapers selectively respect robots.txt directives: evidence from a large-scale empirical study
    Akademisk Publicerad 2025-05-27 Hämtad 2026-09-04
  12. Consent in Crisis: The Rapid Decline of the AI Data Commons - arXiv Arkiv
    Akademisk Publicerad 2024-07-20 Hämtad 2026-09-04 Flyktig, senast kontrollerad 2026-09-04
  13. Giving users choice with Cloudflare's new Content Signals Policy Arkiv
    Leverantörsdokumentation Publicerad 2025-09-24 Hämtad 2026-09-04
  14. Giving users choice with Cloudflare's new Content Signals Policy Arkiv
    Leverantörsdokumentation Publicerad 2025-09-24 Hämtad 2026-09-04
  15. AI Preferences (aipref) - IETF Datatracker Arkiv
    Dokumentation Publicerad 2025 Hämtad 2026-09-04

Senast uppdaterad 2026-09-04. Skriven och underhållen av Baseline Labs.

George
Online
0%