Skip to content

Robots.txt

Konsept innen AI-søk og SEO
Volatil, sist sjekket 2026-09-04 Denne siden inneholder målte tall som endrer seg raskt.Gjennomgått 2026-09-04

Robots.txt er en ren tekstfil i roten av en vert som forteller automatiserte klienter hvilke stier de kan hente. RFC 9309, publisert i 2022, spesifiserer og utvider konvensjonen Martijn Koster definerte i 1994[1], og angir i samme dokument at reglene er en forespørsel snarere enn tilgangskontroll[2]. Siden 2023 har filen hatt en annen jobb den aldri var designet for: å skille AI-crawlere som samler treningsdata fra de som henter en side live for å svare på ett spørsmål, gjennom tokens hver operatør finner opp og dokumenterer selv.

Tokens AI-operatørene publiserer

Det finnes ingen register over user-agent-tokens, så hver operatør navngir og dokumenterer sine egne. OpenAI driver GPTBot for treningsdata og sier at en Disallow for den signaliserer at et nettsteds innhold ikke skal brukes til å trene grunnmodeller[3]. Separate tokens dekker søk og annonsering, mens ChatGPT-User henter en side fordi en person ba om det, et tilfelle der OpenAI advarer om at robots.txt-regler kanskje ikke gjelder[4]. Anthropic deler ClaudeBot, Claude-User og Claude-SearchBot langs de samme linjene og uttaler at deres roboter respekterer Disallow og Crawl-delay[5]. Perplexity dokumenterer PerplexityBot som en søkeindeks-crawler og sier at deres Perplexity-User-token generelt ignorerer robots.txt[6]. Detaljer per bot finnes i bot-leksikonet.

Google-Extended

Google la til Google-Extended 28. september 2023 som en kontroll over hvorvidt et nettsteds innhold bidrar til å forbedre Bard og Vertex AI generative API-er[7]. Den styrer nå trening av Gemini-modellene og forankring i Gemini Apps og Vertex AI, og Google uttaler at blokkering av den ikke påvirker et nettsteds inkludering i Google Søk og ikke brukes som et rangeringssignal der[8]. De to kontrollene er separate spaker på samme gjennomgang: Googlebot bestemmer om en side indekseres, Google-Extended bestemmer om den gjennomgåtte teksten mates til Gemini-trening og forankring. Blokkering av den lar derfor søketilstedeværelsen, inkludert AI-oversikter, være uberørt.

Overholdelse er frivillig

Ingenting i protokollen håndhever noe. En crawler kan ignorere reglene, forfalske sin identitet eller på annen måte unngå oppdagelse[9], og Cloudflare rapporterer at AI-crawlere utfører mer enn 50 milliarder forespørsler per dag til nettverket sitt, like under 1 % av alle forespørsler de ser, noen av dem ignorerer no-crawl-direktiver[10]. Den første store målingen av overholdelse, over 130 selvdeklarerte roboter og 40 dager med institusjonelle weblogger, fant at roboter er mindre sannsynlig å overholde strengere direktiver, og at AI-søkeroboter sjelden ber om filen i det hele tatt[11]. Utgivere har strammet inn filen raskt. Revisjonen "Consent in Crisis" av 14 000 domener fant at innen ett år begrenset robots.txt fullstendig mer enn 5 % av alle tokens i C4-korpuset og mer enn 28 % av de mest aktivt vedlikeholdte kildene, med 45 % av C4 begrenset av tjenestevilkår[12]. Se treningsdata versus gjenfinning for hvorfor de to typene blokkering har forskjellige konsekvenser.

Si hva en gjennomgang er til for

To initiativer utvider filen fra hvem som kan gjennomgå til hva gjennomgangen er til for. Cloudflares Content Signals Policy, annonsert 24. september 2025, legger til et innholdssignaldirektiv med ja- eller nei-verdier for tre bruksområder: søk, generative svar og modelltrening[13]. Deres administrerte robots.txt anvendte allerede policyen på mer enn 3,8 millioner domener ved lansering[14]. IETF AI Preferences arbeidsgruppe standardiserer den samme ideen som et vokabular pluss et sett med vedleggsmetoder, robots.txt blant dem[15]. Begge arver svakheten til originalen: en preferanse i en fil er bare verdt det leseren velger å gi den. Sammenlign llms.txt, som ber om oppmerksomhet i stedet for å holde den tilbake, og lisensavtaler for innhold, som erstatter forespørselen med en kontrakt.

Referanser (15)
  1. RFC 9309: Robots Exclusion Protocol Arkiv
    Dokumentasjon Publisert 2022-09 Hentet 2026-09-04
  2. RFC 9309: Robots Exclusion Protocol Arkiv
    Dokumentasjon Publisert 2022-09 Hentet 2026-09-04
  3. OpenAI crawlere - OpenAI utviklerdokumentasjon Arkiv
    Dokumentasjon Publisert 2023-08 Hentet 2026-09-04
  4. OpenAI crawlere - OpenAI utviklerdokumentasjon Arkiv
    Dokumentasjon Publisert 2023-08 Hentet 2026-09-04
  5. Gjennomgår Anthropic data fra nettet, og hvordan kan nettstedseiere blokkere crawleren? - Anthropic support Arkiv
    Dokumentasjon Publisert 2024 Hentet 2026-09-04
  6. Perplexity crawlere - Perplexity dokumentasjon Arkiv
    Dokumentasjon Publisert 2024 Hentet 2026-09-04
  7. En oppdatering om webutgiverkontroller - Google Arkiv
    Leverandørdokumentasjon Publisert 2023-09-28 Hentet 2026-09-04
  8. Googles vanlige crawlere - Google Search Central Arkiv
    Dokumentasjon Publisert 2025 Hentet 2026-09-04
  9. LLMs.txt Sporingsstudie og Live Dashboard - Originality.ai Arkiv
    Leverandørdokumentasjon Publisert 2026-07-03 Hentet 2026-09-04
  10. Fange uregjerlige roboter i en AI-labyrint - Cloudflare Arkiv
    Leverandørdokumentasjon Publisert 2025-03-19 Hentet 2026-09-04 Enkeltkilde Volatil, sist sjekket 2026-09-04
  11. Skrapere respekterer selektivt robots.txt-direktiver: bevis fra en storstilt empirisk studie
    Akademisk Publisert 2025-05-27 Hentet 2026-09-04
  12. Samtykke i krise: Den raske nedgangen av AI Data Commons - arXiv Arkiv
    Akademisk Publisert 2024-07-20 Hentet 2026-09-04 Volatil, sist sjekket 2026-09-04
  13. Gi brukere valg med Cloudflares nye Content Signals Policy Arkiv
    Leverandørdokumentasjon Publisert 2025-09-24 Hentet 2026-09-04
  14. Gi brukere valg med Cloudflares nye Content Signals Policy Arkiv
    Leverandørdokumentasjon Publisert 2025-09-24 Hentet 2026-09-04
  15. AI Preferences (aipref) - IETF Datatracker Arkiv
    Dokumentasjon Publisert 2025 Hentet 2026-09-04

Sist oppdatert 2026-09-04. Skrevet og vedlikeholdt av Baseline Labs.

George
Online
0%