Trænings-scrapere
Trænings-scrapere indsamler tekst i bulk til modeltræning snarere end til et indeks, som et live-svar henter fra. OpenAI dokumenterer GPTBot som den crawler, der gør deres grundmodeller mere nyttige og sikre[1], og siger, at en Disallow for den signalerer, at et websteds indhold ikke bør bruges til træning[2]. Anthropic's ClaudeBot indsamler indhold, der kan bidrage til træning[3], og Common Crawls CCBot leverer et offentligt arkiv indsamlet siden 2008, hvorfra de fleste åbne korpora er skåret[4][5]. At blokere denne klasse er en separat beslutning fra at blokere en søgecrawler.
Fravælgelse
De større operatører udgiver et token, der alene styrer træningen. Google-Extended afgør, om crawlet indhold må træne fremtidige Gemini-modeller[6], og Apple er eksplicit om, at Applebot-Extended ikke selv crawler noget: det er en præference, der læses ved træningstidspunktet, og en side, der blokerer den, vises stadig i søgeresultaterne[7]. Denne adskillelse er pointen. Et websted kan afvise træningskorpusset og beholde indeksindgangen, som en svar-motor citerer fra. Se robots.txt.
Common Crawl
Common Crawl er det største delte input. CCBot er en Nutch-baseret crawler bygget på Apache Hadoop[4], der leverer et korpus på petabytes indsamlet siden 2008[5]. Common Crawl udgiver en robots.txt-blok, der forhindrer crawleren i at crawle et websted[8], hvilket virker fremadrettet på crawls, der endnu ikke er foretaget. Tilbagetræknings-tallene nedenfor er derfor målt mod et korpus, C4, snarere end mod en live crawler[9].
Hvad fravælgelse koster
Afvisninger har bevæget sig hurtigt og ujævnt. En revision af 14.000 webdomæner viste, at robots.txt-restriktioner tilføjet på et enkelt år fuldt ud begrænsede mere end 5% af alle C4-tokens og mere end 28% af dets mest aktivt vedligeholdte kilder[9], med servicevilkår, der dækker 45% af korpusset[10]. Blandt nyhedssider blokerer 60,0% af velrenommerede medier mindst én AI-crawler mod 9,1% af misinformation-sider[11], et gab der forvrænger, hvad en model læser. Blokering er ikke gratis: udgivere, der blokerer generative AI-bots, oplever reduceret webtrafik i forhold til dem, der ikke gør[12]. Overholdelse er i alle tilfælde delvis, da bots adlyder mindre, jo strengere en instruktion bliver[13].
Standardomskiftningen i 2025
Blokering blev standarden snarere end en handling. Den 1. juli 2025 ændrede Cloudflare standardindstillingen på sit netværk til at blokere AI-crawlere, medmindre de betaler skabere for deres indhold[14], og blokering blandt velrenommerede nyhedssider var allerede steget fra 23% i september 2023 til næsten 60% i maj 2025[15]. Modstykket er betalt adgang snarere end gratis adgang, dækket under indholdslicensaftaler og AI-crawlere.
Bots i denne klasse
Baseline Labs' bot-register (v1) sporer 73 af disse. Hver har sin egen post med sin brugeragent, dens robots.txt-token og hvordan man verificerer den.
- AgentTimesThe Agent Times
- AI2BotAllen Institute
- Ai2Bot-DolmaAllen Institute
- aiHitBotaiHit
- anthropic-aiAnthropic
- ApifyBotApify
- ApifyWebsiteContentCrawlerApify
- Applebot-ExtendedApple
- AwarioAwario
- bedrockbotAmazon
- BrightbotBright Data
- BytespiderByteDance
- CCBotCommon Crawl
- ChatGLM-SpiderZhipu AI
- Claude-WebAnthropic
- ClaudeBotAnthropic
- CotoyogiROIS
- CragCrawlerCragSoftware
- Crawl4AICrawl4AI
- CrawlspaceCrawlspace
- Datenbank CrawlerDatenbank
- DeepSeekBotDeepSeek
- DiffbotDiffbot
- Echobot BotEchobox
- EchoboxBotEchobox
- FacebookBotMeta
- facebookexternalhitMeta
- Factset_spyderbotFactSet
- FirecrawlAgentFirecrawl
- FriendlyCrawlerUkendt
- Google-CloudVertexBotGoogle
- Google-ExtendedGoogle
- Google-FirebaseGoogle
- GPTBotOpenAI
- HenkBotUkendt
- ICC-CrawlerNICT
- ImagesiftBotImageSift
- imageSpiderUkendt
- img2datasetimg2dataset
- ISSCyberRiskCrawlerISS-Corporate
- Kangaroo BotUkendt
- KunatoCrawlerKunato
- laion-huggingface-processorLAION
- LAIONDownloaderLAION
- Linguee BotLinguee
- meta-externalagentMeta
- Mozilla-TabstackMozilla
- MyCentralAIScraperBotUkendt
- NagetBotNaget
- netEstate Imprint CrawlernetEstate
- newsaiUkendt
- omgiliWebz.io
- omgilibotWebz.io
- PanguBotHuawei
- PanscientPanscient
- Poseidon Research CrawlerPoseidon Research
- QuillBotQuillBot
- SBIntuitionsBotSB Intuitions
- ScrapyZyte
- SemrushBot-OCOBSemrush
- SemrushBot-SWASemrush
- ShapBotParallel
- Sidetrade indexer botSidetrade
- TerraCottaCeramic AI
- ThinkbotThinkbot
- TikTokSpiderByteDance
- VelenPublicWebCrawlerVelen
- WARDBotWEBSPARK
- Webzio-ExtendedWebz.io
- xAI-BotxAI
- YaKMeltwater
- YandexAdditionalYandex
- YandexAdditionalBotYandex
Den fulde bot-encyklopædi viser alle klasser side om side.
Data
Vis tallene (3)
| Punkt | % |
|---|---|
| Alle C4-tokens, robots.txt | 5 |
| Kritiske kilder, robots.txt | 28 |
| C4, servicevilkår | 45 |
Referencer (15)
- Oversigt over OpenAI Crawlere - OpenAI udviklerdokumentation
- Oversigt over OpenAI Crawlere - OpenAI udviklerdokumentation
- Crawler Anthropic data fra nettet, og hvordan kan webstedsejere blokere crawleren? - Claude support
- Ofte stillede spørgsmål - Common Crawl
- Oversigt - Common Crawl
- Googles almindelige crawlere - Google Search Central
- Om Applebot - Apple Support
- Ofte stillede spørgsmål - Common Crawl
- Samtykke i krise: den hurtige tilbagegang af AI-datafællesskabet - arXiv 2407.14933
- Samtykke i krise: den hurtige tilbagegang af AI-datafællesskabet - arXiv 2407.14933
- Er misinformation mere åben? En undersøgelse af robots.txt gatekeeping på nettet - arXiv 2510.10315
- Nyhedsforlæggeres strategiske reaktion på generativ AI - arXiv 2512.24968
- Scrapere respekterer selektivt robots.txt-direktiver - arXiv 2505.21733 (ACM IMC 2025)
- Indholdets uafhængighedsdag: ingen AI-crawl uden kompensation - Cloudflare Blog
- Er misinformation mere åben? En undersøgelse af robots.txt gatekeeping på nettet - arXiv 2510.10315
Senest opdateret 2026-09-04. Skrevet og vedligeholdt af Baseline Labs.