Skip to content

AI-crawlere

Konsept innen AI-søk og SEO
Volatil, sist sjekket 2026-09-04 Denne siden inneholder målte tall som endrer seg raskt.Gjennomgått 2026-09-04

AI-crawlere er de automatiserte hentene som drives av AI-selskaper, og de utfører fire forskjellige jobber som nettstedseiere ofte behandler som én. Treningsskrapere samler tekst for modelltrening, søkecrawlere bygger indeksen en svar-motor siterer fra, assistent-hentene trekker en enkelt side live for en brukers spørsmål, og agenter surfer på vegne av en person. OpenAI dokumenterer splitten eksplisitt: GPTBot for trening, OAI-SearchBot for søk, ChatGPT-User for live-henting, hver kontrollert uavhengig i robots.txt[1].

Identifisere en crawler

En user-agent-streng er et krav, ikke bevis. OpenAI publiserer en separat maskinlesbar IP-områdeliste for hver av sine crawlere, slik at en operatør kan sjekke hvor en forespørsel faktisk kom fra[2]. Den generelle testen er å matche kilde-IP-en mot operatørens publiserte områder og, der det støttes, kjøre fremoverbekreftet omvendt DNS: PTR-vertsnavnet må ende på operatørens eget domene og fremover-resolvere tilbake til samme IP. Googlebot støtter begge, med 315 publiserte områder[3].

Overholdelse av robots.txt

Lydighet er delvis og operatørspesifikk. En studie av 130 selvdeklarerte roboter over 40 dager, ved bruk av kontrollerte robots.txt-eksperimenter, fant at roboter overholder mindre jo strengere direktivet blir, og at hele kategorier av roboter, AI-søkeroboter blant dem, sjelden sjekker robots.txt i det hele tatt, så en Disallow-linje er ikke en ensartet kontroll[4].

Gjennomsøk mot henvisning

Forholdet mellom antall sider som er tatt og antall besøkende som er returnert, skiller operatørene med tre størrelsesordener. For de 28 dagene frem til 21. juli 2026, plasserte Cloudflare Radar Mistral på 3 389 sider gjennomsøkt per henvisning, Anthropics ClaudeBot på 2 237, PerplexityBot på 225, GPTBot på 217, Microsoft Copilot på 35 og Google på 4,6[5]. Tallene endrer seg raskt: det samme panelet plasserte Anthropic på 56 969 til 1 i januar 2026 og 2 363 til 1 i juli, ettersom Claude begynte å sitere og lenke til kilder[6]. Volumet skiftet like skarpt i løpet av det foregående året, GPTBot steg fra 5 % til 30 % av AI-crawler-trafikken mens ClaudeBot falt 46 % og Bytespider falt 85 %[7].

Blokkering og hva det koster

Den 1. juli 2025 endret Cloudflare standardinnstillingen på nettverket sitt til å blokkere AI-crawlere med mindre de betaler for innholdet, noe som snudde opt-out-normen[8]. Blokkering er ikke gratis. En forskjøvet differanse-i-differanse-studie av nyhetsutgivere fant at de som blokkerte GenAI-crawlere mistet omtrent 23 % av SimilarWeb-trafikken (ATT -0,262, 95 % KI -0,352 til -0,173)[9]. Mønsteret er også ujevnt etter utgivertype: 60,0 % av anerkjente nyhetssider blokkerer minst én AI-crawler mot 9,1 % av feilinformasjonssider, og blokkering blant anerkjente sider steg fra 23 % i september 2023 til nesten 60 % innen mai 2025[10], noe som forvrenger hva modellene leser. Se ChatGPT-søk og llms.txt.

Data

Anthropic crawl-to-refer ratio, 2026 0150003000045000600002026-012026-032026-052026-07
Anthropic crawl-til-henvisningsforhold, 2026. Tall i sider gjennomsøkt per henvisning.
Vis tallene (4)
Punktsider gjennomsøkt per henvisning
2026-0156969
2026-0311870
2026-0511934
2026-072363
Referanser (10)
  1. Oversikt over OpenAI Crawlers - OpenAI utviklerdokumenter Arkiv
    Dokumentasjon Hentet 2026-09-04
  2. Oversikt over OpenAI Crawlers - OpenAI utviklerdokumenter Arkiv
    Dokumentasjon Hentet 2026-09-04
  3. Web Crawler & AI Bot Reference - Patrick Stox Arkiv
    Leverandørdokumentasjon Publisert 2026-01-01 Hentet 2026-09-04 Enkeltkilde
  4. Scrapers selectively respect robots.txt directives: evidence from a large-scale empirical study - arXiv / ACM IMC 2025 Arkiv
    Akademisk Publisert 2025-05-27 Hentet 2026-09-04
  5. GEO Data Report 2026: Which AI Crawlers & LLM Bots Take the Most - SEOmator (siterer Cloudflare Radar) Arkiv
    Leverandørdokumentasjon Publisert 2026-07-21 Hentet 2026-09-04 Enkeltkilde Volatil, sist sjekket 2026-09-04
  6. GEO Data Report 2026: Which AI Crawlers & LLM Bots Take the Most - SEOmator (siterer Cloudflare Radar) Arkiv
    Leverandørdokumentasjon Publisert 2026-07-21 Hentet 2026-09-04 Enkeltkilde Volatil, sist sjekket 2026-09-04
  7. From Googlebot to GPTBot: Who's crawling your site in 2025 - Cloudflare Blog Arkiv
    Leverandørdokumentasjon Publisert 2025-07-01 Hentet 2026-09-04 Volatil, sist sjekket 2026-09-04
  8. Content Independence Day: no AI crawl without compensation! - Cloudflare Blog Arkiv
    Leverandørdokumentasjon Publisert 2025-07-01 Hentet 2026-09-04
  9. Strategic Response of News Publishers to Generative AI - Zhao & Berman, arXiv 2512.24968 Arkiv
    Akademisk Publisert 2025-12-31 Hentet 2026-09-04 Enkeltkilde
  10. Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web - arXiv 2510.10315 Arkiv
    Akademisk Publisert 2025-10-11 Hentet 2026-09-04

Sist oppdatert 2026-09-04. Skrevet og vedlikeholdt av Baseline Labs.

George
Online
0%