Treningsskrapere
Treningsskrapere samler tekst i bulk for modelltrening, snarere enn for en indeks et live svar henter fra. OpenAI dokumenterer GPTBot som crawleren som gjør grunnlagsmodellene mer nyttige og sikre[1], og sier at en Disallow for den signaliserer at et nettsteds innhold ikke skal brukes i trening[2]. Anthropics ClaudeBot samler innhold som kan bidra til trening[3], og Common Crawls CCBot mater et offentlig arkiv samlet siden 2008 som de fleste åpne korpora er kuttet fra[4][5]. Å blokkere denne klassen er en egen beslutning fra å blokkere en søke-crawler.
Velge bort
De større operatørene publiserer et token som kun kontrollerer trening. Google-Extended bestemmer om crawlet innhold kan trene fremtidige Gemini-modeller[6], og Apple er eksplisitt på at Applebot-Extended ikke selv crawler noe: det er en preferanse som leses ved treningstid, og en side som ikke tillater den, vises fortsatt i søkeresultatene[7]. Denne separasjonen er poenget. Et nettsted kan nekte treningskorpuset og beholde indeksinnføringen en svar-motor siterer fra. Se robots.txt.
Common Crawl
Common Crawl er den største delte inndataen. CCBot er en Nutch-basert crawler bygget på Apache Hadoop[4], som mater et korpus på petabyte samlet siden 2008[5]. Common Crawl publiserer en robots.txt-blokk som hindrer crawleren i å crawle et nettsted[8], som virker fremover, på crawls som ennå ikke er tatt. Uttakstallene nedenfor er derfor målt mot et korpus, C4, snarere enn mot en live crawler[9].
Hva det koster å velge bort
Avslag har beveget seg raskt og ujevnt. En revisjon av 14 000 webdomener fant at robots.txt-restriksjoner lagt til i løpet av ett enkelt år fullt ut begrenset mer enn 5 % av alle C4-tokens og mer enn 28 % av de mest aktivt vedlikeholdte kildene[9], med vilkår for bruk som dekker 45 % av korpuset[10]. Blant nyhetssider tillater 60,0 % av anerkjente utsalgssteder minst én AI-crawler, mot 9,1 % av feilinformasjonssider[11], et gap som forvrenger hva en modell leser. Blokking er ikke gratis: utgivere som blokkerer generative AI-roboter ser redusert nettstedtrafikk sammenlignet med de som ikke gjør det[12]. Overholdelse er uansett delvis, siden roboter adlyder mindre jo strengere en instruksjon blir[13].
Standardendringen i 2025
Blokking ble standarden snarere enn en handling. Den 1. juli 2025 endret Cloudflare standardinnstillingen på nettverket sitt til å blokkere AI-crawlere med mindre de betaler skapere for innholdet sitt[14], og blokkering blant anerkjente nyhetssider hadde allerede steget fra 23 % i september 2023 til nesten 60 % innen mai 2025[15]. Motstykket er betalt tilgang snarere enn gratis tilgang, dekket under innholdslisensavtaler og AI-crawlere.
Roboter i denne klassen
Baseline Labs botregister (v1) sporer 73 av disse. Hver har sin egen oppføring med brukeragent, robots.txt-token og hvordan den kan verifiseres.
- AgentTimesThe Agent Times
- AI2BotAllen Institute
- Ai2Bot-DolmaAllen Institute
- aiHitBotaiHit
- anthropic-aiAnthropic
- ApifyBotApify
- ApifyWebsiteContentCrawlerApify
- Applebot-ExtendedApple
- AwarioAwario
- bedrockbotAmazon
- BrightbotBright Data
- BytespiderByteDance
- CCBotCommon Crawl
- ChatGLM-SpiderZhipu AI
- Claude-WebAnthropic
- ClaudeBotAnthropic
- CotoyogiROIS
- CragCrawlerCragSoftware
- Crawl4AICrawl4AI
- CrawlspaceCrawlspace
- Datenbank CrawlerDatenbank
- DeepSeekBotDeepSeek
- DiffbotDiffbot
- Echobot BotEchobox
- EchoboxBotEchobox
- FacebookBotMeta
- facebookexternalhitMeta
- Factset_spyderbotFactSet
- FirecrawlAgentFirecrawl
- FriendlyCrawlerUkjent
- Google-CloudVertexBotGoogle
- Google-ExtendedGoogle
- Google-FirebaseGoogle
- GPTBotOpenAI
- HenkBotUkjent
- ICC-CrawlerNICT
- ImagesiftBotImageSift
- imageSpiderUkjent
- img2datasetimg2dataset
- ISSCyberRiskCrawlerISS-Corporate
- Kangaroo BotUkjent
- KunatoCrawlerKunato
- laion-huggingface-processorLAION
- LAIONDownloaderLAION
- Linguee BotLinguee
- meta-externalagentMeta
- Mozilla-TabstackMozilla
- MyCentralAIScraperBotUkjent
- NagetBotNaget
- netEstate Imprint CrawlernetEstate
- newsaiUkjent
- omgiliWebz.io
- omgilibotWebz.io
- PanguBotHuawei
- PanscientPanscient
- Poseidon Research CrawlerPoseidon Research
- QuillBotQuillBot
- SBIntuitionsBotSB Intuitions
- ScrapyZyte
- SemrushBot-OCOBSemrush
- SemrushBot-SWASemrush
- ShapBotParallel
- Sidetrade indexer botSidetrade
- TerraCottaCeramic AI
- ThinkbotThinkbot
- TikTokSpiderByteDance
- VelenPublicWebCrawlerVelen
- WARDBotWEBSPARK
- Webzio-ExtendedWebz.io
- xAI-BotxAI
- YaKMeltwater
- YandexAdditionalYandex
- YandexAdditionalBotYandex
Den komplette bot-leksikonet lister opp hver klasse side om side.
Data
Vis tallene (3)
| Punkt | % |
|---|---|
| Alle C4-tokens, robots.txt | 5 |
| Kritiske kilder, robots.txt | 28 |
| C4, vilkår for bruk | 45 |
Referanser (15)
- Oversikt over OpenAI Crawlers - OpenAI utviklerdokumentasjon
- Oversikt over OpenAI Crawlers - OpenAI utviklerdokumentasjon
- Crawler Anthropic data fra nettet, og hvordan kan nettstedseiere blokkere crawleren? - Claude support
- Ofte stilte spørsmål - Common Crawl
- Oversikt - Common Crawl
- Googles vanlige crawlere - Google Search Central
- Om Applebot - Apple Support
- Ofte stilte spørsmål - Common Crawl
- Consent in Crisis: the rapid decline of the AI data commons - arXiv 2407.14933
- Consent in Crisis: the rapid decline of the AI data commons - arXiv 2407.14933
- Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web - arXiv 2510.10315
- Strategic Response of News Publishers to Generative AI - arXiv 2512.24968
- Scrapers selectively respect robots.txt directives - arXiv 2505.21733 (ACM IMC 2025)
- Content Independence Day: no AI crawl without compensation - Cloudflare Blog
- Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web - arXiv 2510.10315
Sist oppdatert 2026-09-04. Skrevet og vedlikeholdt av Baseline Labs.