Träningsskrapor
Träningsskrapor samlar in text i bulk för modellträning snarare än för ett index som ett live-svar hämtar från. OpenAI dokumenterar GPTBot som den crawler som gör dess grundmodeller mer användbara och säkra[1], och säger att en Disallow för den signalerar att en webbplats innehåll inte ska användas i träning[2]. Anthropics ClaudeBot samlar in innehåll som kan bidra till träning[3], och Common Crawls CCBot matar ett offentligt arkiv som samlats in sedan 2008 och som de flesta öppna korpusar är hämtade från[4][5]. Att blockera denna klass är ett separat beslut från att blockera en sökcrawler.
Välja bort
De större operatörerna publicerar en token som enbart kontrollerar träning. Google-Extended avgör om crawlat innehåll får träna framtida Gemini-modeller[6], och Apple är tydlig med att Applebot-Extended inte själv crawlar något: det är en preferens som läses vid träningstillfället, och en sida som nekar den visas fortfarande i sökresultaten[7]. Den separationen är poängen. En webbplats kan neka träningskorpusen och behålla indexposten som en svarsmotor citerar från. Se robots.txt.
Common Crawl
Common Crawl är den största delade indatan. CCBot är en Nutch-baserad crawler byggd på Apache Hadoop[4], som matar en korpus på petabyte som samlats in sedan 2008[5]. Common Crawl publicerar ett robots.txt-block som hindrar crawlern från att crawla en webbplats[8], vilket verkar framåt, på crawls som ännu inte har gjorts. Uttagssiffrorna nedan mäts därför mot en korpus, C4, snarare än mot en live-crawler[9].
Vad det kostar att välja bort
Nekanden har rört sig snabbt och ojämnt. En granskning av 14 000 webbdomäner fann att robots.txt-restriktioner som lades till under ett enda år helt begränsade mer än 5 % av alla C4-tokens och mer än 28 % av dess mest aktivt underhållna källor[9], med användarvillkor som täcker 45 % av korpusen[10]. Bland nyhetssajter nekar 60,0 % av ansedda medier minst en AI-crawler jämfört med 9,1 % av desinformationssajter[11], ett gap som snedvrider vad en modell läser. Blockering är inte gratis: utgivare som blockerar generativa AI-botar ser minskad webbplatstrafik jämfört med dem som inte gör det[12]. Efterlevnaden är i alla fall delvis, eftersom botar lyder mindre ju strängare en direktiv blir[13].
Standardomställningen 2025
Blockering blev standard snarare än en handling. Den 1 juli 2025 ändrade Cloudflare standardinställningen i sitt nätverk till att blockera AI-crawlers om de inte betalar skapare för deras innehåll[14], och blockeringen bland ansedda nyhetssajter hade redan klättrat från 23 % i september 2023 till nästan 60 % i maj 2025[15]. Motparten är betald åtkomst snarare än fri åtkomst, som täcks av innehållslicensavtal och AI-crawlers.
Botar i denna klass
Baseline Labs botregister (v1) spårar 73 av dessa. Var och en har sin egen post med sin user agent, sin robots.txt-token och hur man verifierar den.
- AgentTimesThe Agent Times
- AI2BotAllen Institute
- Ai2Bot-DolmaAllen Institute
- aiHitBotaiHit
- anthropic-aiAnthropic
- ApifyBotApify
- ApifyWebsiteContentCrawlerApify
- Applebot-ExtendedApple
- AwarioAwario
- bedrockbotAmazon
- BrightbotBright Data
- BytespiderByteDance
- CCBotCommon Crawl
- ChatGLM-SpiderZhipu AI
- Claude-WebAnthropic
- ClaudeBotAnthropic
- CotoyogiROIS
- CragCrawlerCragSoftware
- Crawl4AICrawl4AI
- CrawlspaceCrawlspace
- Datenbank CrawlerDatenbank
- DeepSeekBotDeepSeek
- DiffbotDiffbot
- Echobot BotEchobox
- EchoboxBotEchobox
- FacebookBotMeta
- facebookexternalhitMeta
- Factset_spyderbotFactSet
- FirecrawlAgentFirecrawl
- FriendlyCrawlerOkänd
- Google-CloudVertexBotGoogle
- Google-ExtendedGoogle
- Google-FirebaseGoogle
- GPTBotOpenAI
- HenkBotOkänd
- ICC-CrawlerNICT
- ImagesiftBotImageSift
- imageSpiderOkänd
- img2datasetimg2dataset
- ISSCyberRiskCrawlerISS-Corporate
- Kangaroo BotOkänd
- KunatoCrawlerKunato
- laion-huggingface-processorLAION
- LAIONDownloaderLAION
- Linguee BotLinguee
- meta-externalagentMeta
- Mozilla-TabstackMozilla
- MyCentralAIScraperBotOkänd
- NagetBotNaget
- netEstate Imprint CrawlernetEstate
- newsaiOkänd
- omgiliWebz.io
- omgilibotWebz.io
- PanguBotHuawei
- PanscientPanscient
- Poseidon Research CrawlerPoseidon Research
- QuillBotQuillBot
- SBIntuitionsBotSB Intuitions
- ScrapyZyte
- SemrushBot-OCOBSemrush
- SemrushBot-SWASemrush
- ShapBotParallel
- Sidetrade indexer botSidetrade
- TerraCottaCeramic AI
- ThinkbotThinkbot
- TikTokSpiderByteDance
- VelenPublicWebCrawlerVelen
- WARDBotWEBSPARK
- Webzio-ExtendedWebz.io
- xAI-BotxAI
- YaKMeltwater
- YandexAdditionalYandex
- YandexAdditionalBotYandex
Den fullständiga botencyklopedin listar varje klass sida vid sida.
Data
Visa siffrorna (3)
| Punkt | % |
|---|---|
| Alla C4-tokens, robots.txt | 5 |
| Kritiska källor, robots.txt | 28 |
| C4, användarvillkor | 45 |
Referenser (15)
- Översikt över OpenAI Crawlers - OpenAI utvecklardokumentation
- Översikt över OpenAI Crawlers - OpenAI utvecklardokumentation
- Crawlar Anthropic data från webben, och hur kan webbplatsägare blockera crawlern? - Claude support
- Vanliga frågor - Common Crawl
- Översikt - Common Crawl
- Googles vanliga crawlers - Google Search Central
- Om Applebot - Apple Support
- Vanliga frågor - Common Crawl
- Consent in Crisis: the rapid decline of the AI data commons - arXiv 2407.14933
- Consent in Crisis: the rapid decline of the AI data commons - arXiv 2407.14933
- Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web - arXiv 2510.10315
- Strategic Response of News Publishers to Generative AI - arXiv 2512.24968
- Scrapers selectively respect robots.txt directives - arXiv 2505.21733 (ACM IMC 2025)
- Content Independence Day: no AI crawl without compensation - Cloudflare Blog
- Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web - arXiv 2510.10315
Senast uppdaterad 2026-09-04. Skriven och underhållen av Baseline Labs.