Robots.txt
Robots.txt er en ren tekstfil i roten av en vert som forteller automatiserte klienter hvilke stier de kan hente. RFC 9309, publisert i 2022, spesifiserer og utvider konvensjonen Martijn Koster definerte i 1994[1], og angir i samme dokument at reglene er en forespørsel snarere enn tilgangskontroll[2]. Siden 2023 har filen hatt en annen jobb den aldri var designet for: å skille AI-crawlere som samler treningsdata fra de som henter en side live for å svare på ett spørsmål, gjennom tokens hver operatør finner opp og dokumenterer selv.
Tokens AI-operatørene publiserer
Det finnes ingen register over user-agent-tokens, så hver operatør navngir og dokumenterer sine egne. OpenAI driver GPTBot for treningsdata og sier at en Disallow for den signaliserer at et nettsteds innhold ikke skal brukes til å trene grunnmodeller[3]. Separate tokens dekker søk og annonsering, mens ChatGPT-User henter en side fordi en person ba om det, et tilfelle der OpenAI advarer om at robots.txt-regler kanskje ikke gjelder[4]. Anthropic deler ClaudeBot, Claude-User og Claude-SearchBot langs de samme linjene og uttaler at deres roboter respekterer Disallow og Crawl-delay[5]. Perplexity dokumenterer PerplexityBot som en søkeindeks-crawler og sier at deres Perplexity-User-token generelt ignorerer robots.txt[6]. Detaljer per bot finnes i bot-leksikonet.
Google-Extended
Google la til Google-Extended 28. september 2023 som en kontroll over hvorvidt et nettsteds innhold bidrar til å forbedre Bard og Vertex AI generative API-er[7]. Den styrer nå trening av Gemini-modellene og forankring i Gemini Apps og Vertex AI, og Google uttaler at blokkering av den ikke påvirker et nettsteds inkludering i Google Søk og ikke brukes som et rangeringssignal der[8]. De to kontrollene er separate spaker på samme gjennomgang: Googlebot bestemmer om en side indekseres, Google-Extended bestemmer om den gjennomgåtte teksten mates til Gemini-trening og forankring. Blokkering av den lar derfor søketilstedeværelsen, inkludert AI-oversikter, være uberørt.
Overholdelse er frivillig
Ingenting i protokollen håndhever noe. En crawler kan ignorere reglene, forfalske sin identitet eller på annen måte unngå oppdagelse[9], og Cloudflare rapporterer at AI-crawlere utfører mer enn 50 milliarder forespørsler per dag til nettverket sitt, like under 1 % av alle forespørsler de ser, noen av dem ignorerer no-crawl-direktiver[10]. Den første store målingen av overholdelse, over 130 selvdeklarerte roboter og 40 dager med institusjonelle weblogger, fant at roboter er mindre sannsynlig å overholde strengere direktiver, og at AI-søkeroboter sjelden ber om filen i det hele tatt[11]. Utgivere har strammet inn filen raskt. Revisjonen "Consent in Crisis" av 14 000 domener fant at innen ett år begrenset robots.txt fullstendig mer enn 5 % av alle tokens i C4-korpuset og mer enn 28 % av de mest aktivt vedlikeholdte kildene, med 45 % av C4 begrenset av tjenestevilkår[12]. Se treningsdata versus gjenfinning for hvorfor de to typene blokkering har forskjellige konsekvenser.
Si hva en gjennomgang er til for
To initiativer utvider filen fra hvem som kan gjennomgå til hva gjennomgangen er til for. Cloudflares Content Signals Policy, annonsert 24. september 2025, legger til et innholdssignaldirektiv med ja- eller nei-verdier for tre bruksområder: søk, generative svar og modelltrening[13]. Deres administrerte robots.txt anvendte allerede policyen på mer enn 3,8 millioner domener ved lansering[14]. IETF AI Preferences arbeidsgruppe standardiserer den samme ideen som et vokabular pluss et sett med vedleggsmetoder, robots.txt blant dem[15]. Begge arver svakheten til originalen: en preferanse i en fil er bare verdt det leseren velger å gi den. Sammenlign llms.txt, som ber om oppmerksomhet i stedet for å holde den tilbake, og lisensavtaler for innhold, som erstatter forespørselen med en kontrakt.
Referanser (15)
- RFC 9309: Robots Exclusion Protocol Arkiv
- RFC 9309: Robots Exclusion Protocol Arkiv
- OpenAI crawlere - OpenAI utviklerdokumentasjon Arkiv
- OpenAI crawlere - OpenAI utviklerdokumentasjon Arkiv
- Gjennomgår Anthropic data fra nettet, og hvordan kan nettstedseiere blokkere crawleren? - Anthropic support Arkiv
- Perplexity crawlere - Perplexity dokumentasjon Arkiv
- En oppdatering om webutgiverkontroller - Google Arkiv
- Googles vanlige crawlere - Google Search Central Arkiv
- LLMs.txt Sporingsstudie og Live Dashboard - Originality.ai Arkiv
- Fange uregjerlige roboter i en AI-labyrint - Cloudflare Arkiv
- Skrapere respekterer selektivt robots.txt-direktiver: bevis fra en storstilt empirisk studie
- Samtykke i krise: Den raske nedgangen av AI Data Commons - arXiv Arkiv
- Gi brukere valg med Cloudflares nye Content Signals Policy Arkiv
- Gi brukere valg med Cloudflares nye Content Signals Policy Arkiv
- AI Preferences (aipref) - IETF Datatracker Arkiv
Sist oppdatert 2026-09-04. Skrevet og vedlikeholdt av Baseline Labs.