AI-crawlers
AI-crawlers är de automatiserade hämtare som drivs av AI-företag, och de utför fyra olika uppgifter som webbplatsägare ofta behandlar som en. Träningsskrapor samlar in text för modellträning, sökcrawlers bygger indexet som en svarsmotor citerar från, assistenthämtare hämtar en enskild sida live för en användares fråga, och agenter surfar på en persons vägnar. OpenAI dokumenterar uppdelningen explicit: GPTBot för träning, OAI-SearchBot för sökning, ChatGPT-User för livehämtningar, var och en kontrolleras oberoende i robots.txt[1].
Identifiera en crawler
En user-agent-sträng är ett påstående, inte ett bevis. OpenAI publicerar en separat maskinläsbar IP-intervallista för var och en av sina crawlers, så en operatör kan kontrollera var en förfrågan faktiskt kom ifrån[2]. Det allmänna testet är att matcha käll-IP:n mot operatörens publicerade intervall och, där det stöds, köra framåtbekräftad omvänd DNS: PTR-värdnamnet måste sluta på operatörens egen domän och framåt-resolvera tillbaka till samma IP. Googlebot stöder båda, med 315 publicerade intervall[3].
Efterlevnad av robots.txt
Lydnaden är partiell och operatörsspecifik. En studie av 130 självdeklarerade botar under 40 dagar, med kontrollerade robots.txt-experiment, fann att botar följer direktiven mindre ju strängare de blir, och att hela kategorier av botar, inklusive AI-sökcrawlers, sällan kontrollerar robots.txt alls, så en Disallow-rad är inte en enhetlig kontroll[4].
Genomsökning mot hänvisning
Förhållandet mellan hämtade sidor och återlämnade besökare skiljer operatörerna åt med tre storleksordningar. Under de 28 dagarna fram till den 21 juli 2026 placerade Cloudflare Radar Mistral på 3 389 genomsökta sidor per hänvisning, Anthropics ClaudeBot på 2 237, PerplexityBot på 225, GPTBot på 217, Microsoft Copilot på 35 och Google på 4,6[5]. Siffrorna rör sig snabbt: samma panel placerade Anthropic på 56 969 till 1 i januari 2026 och 2 363 till 1 i juli, då Claude började citera och länka källor[6]. Volymen skiftade lika kraftigt under det föregående året, GPTBot steg från 5 % till 30 % av AI-crawltrafiken medan ClaudeBot föll 46 % och Bytespider föll 85 %[7].
Blockering och dess kostnad
Den 1 juli 2025 ändrade Cloudflare standardinställningen på sitt nätverk för att blockera AI-crawlers om de inte betalar för innehållet, vilket omvände opt-out-normen[8]. Blockering är inte gratis. En förskjuten skillnad-i-skillnader-studie av nyhetsutgivare fann att de som blockerade GenAI-crawlers förlorade cirka 23 % av sin SimilarWeb-trafik (ATT -0,262, 95 % CI -0,352 till -0,173)[9]. Mönstret är också ojämnt beroende på utgivartyp: 60,0 % av ansedda nyhetssajter blockerar minst en AI-crawler jämfört med 9,1 % av desinformationssajter, och blockeringen bland ansedda sajter steg från 23 % i september 2023 till nästan 60 % i maj 2025[10], vilket snedvrider vad modellerna läser. Se ChatGPT Sök och llms.txt.
Data
Visa siffrorna (4)
| Punkt | sidor genomsökta per hänvisning |
|---|---|
| 2026-01 | 56969 |
| 2026-03 | 11870 |
| 2026-05 | 11934 |
| 2026-07 | 2363 |
Referenser (10)
- Översikt över OpenAI Crawlers - OpenAI utvecklardokumentation Arkiv
- Översikt över OpenAI Crawlers - OpenAI utvecklardokumentation Arkiv
- Web Crawler & AI Bot Reference - Patrick Stox Arkiv
- Scrapers selectively respect robots.txt directives: evidence from a large-scale empirical study - arXiv / ACM IMC 2025 Arkiv
- GEO Data Report 2026: Which AI Crawlers & LLM Bots Take the Most - SEOmator (citerar Cloudflare Radar) Arkiv
- GEO Data Report 2026: Which AI Crawlers & LLM Bots Take the Most - SEOmator (citerar Cloudflare Radar) Arkiv
- Från Googlebot till GPTBot: Vem genomsöker din webbplats 2025 - Cloudflare Blogg Arkiv
- Innehållsoberoendedagen: ingen AI-genomsökning utan ersättning! - Cloudflare Blogg Arkiv
- Strategiskt svar från nyhetsutgivare på generativ AI - Zhao & Berman, arXiv 2512.24968 Arkiv
- Är desinformation mer öppen? En studie av robots.txt-grindvakt på webben - arXiv 2510.10315 Arkiv
Senast uppdaterad 2026-09-04. Skriven och underhållen av Baseline Labs.