Skip to content

AI-crawlere

Koncept inden for AI-søgning og SEO
Volatil, senest kontrolleret 2026-09-04 Denne side indeholder målte tal, der hurtigt ændrer sig.Gennemgået 2026-09-04

AI-crawlere er de automatiserede hentningsprogrammer, der køres af AI-virksomheder, og de udfører fire forskellige opgaver, som webstedsejere ofte behandler som én. Trænings-scrapere indsamler tekst til modeltræning, søge-crawlere bygger det indeks, en svar-motor citerer fra, assistent-hentningsprogrammer trækker en enkelt side live for en brugers spørgsmål, og agenter browser på en persons vegne. OpenAI dokumenterer eksplicit opdelingen: GPTBot til træning, OAI-SearchBot til søgning, ChatGPT-User til live-hentninger, hver kontrolleret uafhængigt i robots.txt[1].

Identificering af en crawler

En user-agent-streng er en påstand, ikke et bevis. OpenAI udgiver en separat maskinlæsbar IP-områdeliste for hver af sine crawlere, så en operatør kan kontrollere, hvor en anmodning faktisk kom fra[2]. Den generelle test er at matche kilde-IP'en med operatørens offentliggjorte områder og, hvor det understøttes, køre forward-bekræftet reverse DNS: PTR-værtsnavnet skal ende på operatørens eget domæne og forward-opløse tilbage til den samme IP. Googlebot understøtter begge dele, med 315 offentliggjorte områder[3].

Overholdelse af robots.txt

Lydighed er delvis og operatørspecifik. En undersøgelse af 130 selvudnævnte bots over 40 dage, ved hjælp af kontrollerede robots.txt-eksperimenter, viste, at bots overholder mindre, jo strengere direktivet er, og at hele kategorier af bots, herunder AI-søge-crawlere, sjældent kontrollerer robots.txt overhovedet, så en Disallow-linje er ikke en ensartet kontrol[4].

Crawl mod henvisning

Forholdet mellem hentede sider og returnerede besøgende adskiller operatørerne med tre størrelsesordener. I de 28 dage frem til den 21. juli 2026 placerede Cloudflare Radar Mistral på 3.389 crawlede sider per henvisning, Anthropic's ClaudeBot på 2.237, PerplexityBot på 225, GPTBot på 217, Microsoft Copilot på 35 og Google på 4.6[5]. Tallene bevæger sig hurtigt: det samme panel placerede Anthropic på 56.969 til 1 i januar 2026 og 2.363 til 1 i juli, da Claude begyndte at citere og linke kilder[6]. Volumen skiftede lige så skarpt i løbet af det foregående år, hvor GPTBot steg fra 5% til 30% af AI-crawler-trafikken, mens ClaudeBot faldt 46% og Bytespider faldt 85%[7].

Blokering og hvad det koster

Den 1. juli 2025 ændrede Cloudflare standardindstillingen på sit netværk til at blokere AI-crawlere, medmindre de betaler for indholdet, hvilket omvendte opt-out-normen[8]. Blokering er ikke gratis. En forskudt difference-in-differences-undersøgelse af nyhedsudgivere viste, at de, der blokerede GenAI-crawlere, mistede omkring 23% af deres SimilarWeb-trafik (ATT -0.262, 95% CI -0.352 til -0.173)[9]. Mønsteret er også ujævnt efter udgivertype: 60,0% af anerkendte nyhedssider blokerer mindst én AI-crawler mod 9,1% af misinformation-sider, og blokering blandt anerkendte sider steg fra 23% i september 2023 til næsten 60% i maj 2025[10], hvilket forvrænger, hvad modeller læser. Se ChatGPT-søgning og llms.txt.

Data

Anthropic crawl-to-refer ratio, 2026 0150003000045000600002026-012026-032026-052026-07
Anthropic crawl-til-henvisningsforhold, 2026. Tal i crawlede sider per henvisning.
Vis tallene (4)
Punktcrawlede sider per henvisning
2026-0156969
2026-0311870
2026-0511934
2026-072363
Referencer (10)
  1. Oversigt over OpenAI Crawlere - OpenAI udviklerdokumentation Arkiv
    Dokumentation Hentet 2026-09-04
  2. Oversigt over OpenAI Crawlere - OpenAI udviklerdokumentation Arkiv
    Dokumentation Hentet 2026-09-04
  3. Web Crawler & AI Bot Reference - Patrick Stox Arkiv
    Leverandørdokumentation Udgivet 2026-01-01 Hentet 2026-09-04 Enkeltkilde
  4. Scrapers selectively respect robots.txt directives: evidence from a large-scale empirical study - arXiv / ACM IMC 2025 Arkiv
    Akademisk Udgivet 2025-05-27 Hentet 2026-09-04
  5. GEO Data Report 2026: Which AI Crawlers & LLM Bots Take the Most - SEOmator (citerer Cloudflare Radar) Arkiv
    Leverandørdokumentation Udgivet 2026-07-21 Hentet 2026-09-04 Enkeltkilde Volatil, senest kontrolleret 2026-09-04
  6. GEO Data Report 2026: Which AI Crawlers & LLM Bots Take the Most - SEOmator (citerer Cloudflare Radar) Arkiv
    Leverandørdokumentation Udgivet 2026-07-21 Hentet 2026-09-04 Enkeltkilde Volatil, senest kontrolleret 2026-09-04
  7. Fra Googlebot til GPTBot: Hvem crawler dit websted i 2025 - Cloudflare Blog Arkiv
    Leverandørdokumentation Udgivet 2025-07-01 Hentet 2026-09-04 Volatil, senest kontrolleret 2026-09-04
  8. Indholds-uafhængighedsdag: ingen AI-crawl uden kompensation! - Cloudflare Blog Arkiv
    Leverandørdokumentation Udgivet 2025-07-01 Hentet 2026-09-04
  9. Strategisk respons fra nyhedsudgivere på generativ AI - Zhao & Berman, arXiv 2512.24968 Arkiv
    Akademisk Udgivet 2025-12-31 Hentet 2026-09-04 Enkeltkilde
  10. Er misinformation mere åben? En undersøgelse af robots.txt-gatekeeping på nettet - arXiv 2510.10315 Arkiv
    Akademisk Udgivet 2025-10-11 Hentet 2026-09-04

Senest opdateret 2026-09-04. Skrevet og vedligeholdt af Baseline Labs.

George
Online
0%