Skip to content

Träningsskrapor

Koncept inom AI-sökning och SEO
Volatil, senast kontrollerad 2026-09-04 Denna sida innehåller mätvärden som snabbt förändras.Granskad 2026-09-04

Träningsskrapor samlar in text i bulk för modellträning snarare än för ett index som ett live-svar hämtar från. OpenAI dokumenterar GPTBot som den crawler som gör dess grundmodeller mer användbara och säkra[1], och säger att en Disallow för den signalerar att en webbplats innehåll inte ska användas i träning[2]. Anthropics ClaudeBot samlar in innehåll som kan bidra till träning[3], och Common Crawls CCBot matar ett offentligt arkiv som samlats in sedan 2008 och som de flesta öppna korpusar är hämtade från[4][5]. Att blockera denna klass är ett separat beslut från att blockera en sökcrawler.

Välja bort

De större operatörerna publicerar en token som enbart kontrollerar träning. Google-Extended avgör om crawlat innehåll får träna framtida Gemini-modeller[6], och Apple är tydlig med att Applebot-Extended inte själv crawlar något: det är en preferens som läses vid träningstillfället, och en sida som nekar den visas fortfarande i sökresultaten[7]. Den separationen är poängen. En webbplats kan neka träningskorpusen och behålla indexposten som en svarsmotor citerar från. Se robots.txt.

Common Crawl

Common Crawl är den största delade indatan. CCBot är en Nutch-baserad crawler byggd på Apache Hadoop[4], som matar en korpus på petabyte som samlats in sedan 2008[5]. Common Crawl publicerar ett robots.txt-block som hindrar crawlern från att crawla en webbplats[8], vilket verkar framåt, på crawls som ännu inte har gjorts. Uttagssiffrorna nedan mäts därför mot en korpus, C4, snarare än mot en live-crawler[9].

Vad det kostar att välja bort

Nekanden har rört sig snabbt och ojämnt. En granskning av 14 000 webbdomäner fann att robots.txt-restriktioner som lades till under ett enda år helt begränsade mer än 5 % av alla C4-tokens och mer än 28 % av dess mest aktivt underhållna källor[9], med användarvillkor som täcker 45 % av korpusen[10]. Bland nyhetssajter nekar 60,0 % av ansedda medier minst en AI-crawler jämfört med 9,1 % av desinformationssajter[11], ett gap som snedvrider vad en modell läser. Blockering är inte gratis: utgivare som blockerar generativa AI-botar ser minskad webbplatstrafik jämfört med dem som inte gör det[12]. Efterlevnaden är i alla fall delvis, eftersom botar lyder mindre ju strängare en direktiv blir[13].

Standardomställningen 2025

Blockering blev standard snarare än en handling. Den 1 juli 2025 ändrade Cloudflare standardinställningen i sitt nätverk till att blockera AI-crawlers om de inte betalar skapare för deras innehåll[14], och blockeringen bland ansedda nyhetssajter hade redan klättrat från 23 % i september 2023 till nästan 60 % i maj 2025[15]. Motparten är betald åtkomst snarare än fri åtkomst, som täcks av innehållslicensavtal och AI-crawlers.

Botar i denna klass

Baseline Labs botregister (v1) spårar 73 av dessa. Var och en har sin egen post med sin user agent, sin robots.txt-token och hur man verifierar den.

Den fullständiga botencyklopedin listar varje klass sida vid sida.

Data

Share of the C4 training corpus placed off limits, 2024 audit 012.52537.550All C4 tokens, robots.txtCritical sources, robots.txtC4, terms of service
Andel av C4-träningskorpusen som är otillgänglig, granskning 2024. Siffror i %.
Visa siffrorna (3)
Punkt%
Alla C4-tokens, robots.txt5
Kritiska källor, robots.txt28
C4, användarvillkor45
Referenser (15)
  1. Översikt över OpenAI Crawlers - OpenAI utvecklardokumentation
    Dokumentation Hämtad 2026-09-04
  2. Översikt över OpenAI Crawlers - OpenAI utvecklardokumentation
    Dokumentation Hämtad 2026-09-04
  3. Crawlar Anthropic data från webben, och hur kan webbplatsägare blockera crawlern? - Claude support
    Dokumentation Hämtad 2026-09-04
  4. Vanliga frågor - Common Crawl
    Dokumentation Hämtad 2026-09-04
  5. Översikt - Common Crawl
    Dokumentation Hämtad 2026-09-04
  6. Googles vanliga crawlers - Google Search Central
    Dokumentation Hämtad 2026-09-04
  7. Om Applebot - Apple Support
    Dokumentation Hämtad 2026-09-04
  8. Vanliga frågor - Common Crawl
    Dokumentation Hämtad 2026-09-04
  9. Consent in Crisis: the rapid decline of the AI data commons - arXiv 2407.14933
    Akademisk Publicerad 2024-07-20 Hämtad 2026-09-04
  10. Consent in Crisis: the rapid decline of the AI data commons - arXiv 2407.14933
    Akademisk Publicerad 2024-07-20 Hämtad 2026-09-04
  11. Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web - arXiv 2510.10315
    Akademisk Publicerad 2025-10-11 Hämtad 2026-09-04
  12. Strategic Response of News Publishers to Generative AI - arXiv 2512.24968
    Akademisk Publicerad 2025-12-31 Hämtad 2026-09-04 Enkelkälla
  13. Scrapers selectively respect robots.txt directives - arXiv 2505.21733 (ACM IMC 2025)
    Akademisk Publicerad 2025-05-27 Hämtad 2026-09-04
  14. Content Independence Day: no AI crawl without compensation - Cloudflare Blog
    Leverantörsdokumentation Publicerad 2025-07-01 Hämtad 2026-09-04
  15. Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web - arXiv 2510.10315
    Akademisk Publicerad 2025-10-11 Hämtad 2026-09-04 Volatil, senast kontrollerad 2026-09-04

Senast uppdaterad 2026-09-04. Skriven och underhållen av Baseline Labs.

George
Online
0%