Skip to content

Treningsskrapere

Konsept innen AI-søk og SEO
Flyktig, sist sjekket 2026-09-04 Denne siden inneholder målte tall som endrer seg raskt.Gjennomgått 2026-09-04

Treningsskrapere samler tekst i bulk for modelltrening, snarere enn for en indeks et live svar henter fra. OpenAI dokumenterer GPTBot som crawleren som gjør grunnlagsmodellene mer nyttige og sikre[1], og sier at en Disallow for den signaliserer at et nettsteds innhold ikke skal brukes i trening[2]. Anthropics ClaudeBot samler innhold som kan bidra til trening[3], og Common Crawls CCBot mater et offentlig arkiv samlet siden 2008 som de fleste åpne korpora er kuttet fra[4][5]. Å blokkere denne klassen er en egen beslutning fra å blokkere en søke-crawler.

Velge bort

De større operatørene publiserer et token som kun kontrollerer trening. Google-Extended bestemmer om crawlet innhold kan trene fremtidige Gemini-modeller[6], og Apple er eksplisitt på at Applebot-Extended ikke selv crawler noe: det er en preferanse som leses ved treningstid, og en side som ikke tillater den, vises fortsatt i søkeresultatene[7]. Denne separasjonen er poenget. Et nettsted kan nekte treningskorpuset og beholde indeksinnføringen en svar-motor siterer fra. Se robots.txt.

Common Crawl

Common Crawl er den største delte inndataen. CCBot er en Nutch-basert crawler bygget på Apache Hadoop[4], som mater et korpus på petabyte samlet siden 2008[5]. Common Crawl publiserer en robots.txt-blokk som hindrer crawleren i å crawle et nettsted[8], som virker fremover, på crawls som ennå ikke er tatt. Uttakstallene nedenfor er derfor målt mot et korpus, C4, snarere enn mot en live crawler[9].

Hva det koster å velge bort

Avslag har beveget seg raskt og ujevnt. En revisjon av 14 000 webdomener fant at robots.txt-restriksjoner lagt til i løpet av ett enkelt år fullt ut begrenset mer enn 5 % av alle C4-tokens og mer enn 28 % av de mest aktivt vedlikeholdte kildene[9], med vilkår for bruk som dekker 45 % av korpuset[10]. Blant nyhetssider tillater 60,0 % av anerkjente utsalgssteder minst én AI-crawler, mot 9,1 % av feilinformasjonssider[11], et gap som forvrenger hva en modell leser. Blokking er ikke gratis: utgivere som blokkerer generative AI-roboter ser redusert nettstedtrafikk sammenlignet med de som ikke gjør det[12]. Overholdelse er uansett delvis, siden roboter adlyder mindre jo strengere en instruksjon blir[13].

Standardendringen i 2025

Blokking ble standarden snarere enn en handling. Den 1. juli 2025 endret Cloudflare standardinnstillingen på nettverket sitt til å blokkere AI-crawlere med mindre de betaler skapere for innholdet sitt[14], og blokkering blant anerkjente nyhetssider hadde allerede steget fra 23 % i september 2023 til nesten 60 % innen mai 2025[15]. Motstykket er betalt tilgang snarere enn gratis tilgang, dekket under innholdslisensavtaler og AI-crawlere.

Roboter i denne klassen

Baseline Labs botregister (v1) sporer 73 av disse. Hver har sin egen oppføring med brukeragent, robots.txt-token og hvordan den kan verifiseres.

Den komplette bot-leksikonet lister opp hver klasse side om side.

Data

Share of the C4 training corpus placed off limits, 2024 audit 012.52537.550All C4 tokens, robots.txtCritical sources, robots.txtC4, terms of service
Andel av C4-treningskorpuset som er satt utenfor rekkevidde, revisjon 2024. Tall i %.
Vis tallene (3)
Punkt%
Alle C4-tokens, robots.txt5
Kritiske kilder, robots.txt28
C4, vilkår for bruk45
Referanser (15)
  1. Oversikt over OpenAI Crawlers - OpenAI utviklerdokumentasjon
    Dokumentasjon Hentet 2026-09-04
  2. Oversikt over OpenAI Crawlers - OpenAI utviklerdokumentasjon
    Dokumentasjon Hentet 2026-09-04
  3. Crawler Anthropic data fra nettet, og hvordan kan nettstedseiere blokkere crawleren? - Claude support
    Dokumentasjon Hentet 2026-09-04
  4. Ofte stilte spørsmål - Common Crawl
    Dokumentasjon Hentet 2026-09-04
  5. Oversikt - Common Crawl
    Dokumentasjon Hentet 2026-09-04
  6. Googles vanlige crawlere - Google Search Central
    Dokumentasjon Hentet 2026-09-04
  7. Om Applebot - Apple Support
    Dokumentasjon Hentet 2026-09-04
  8. Ofte stilte spørsmål - Common Crawl
    Dokumentasjon Hentet 2026-09-04
  9. Consent in Crisis: the rapid decline of the AI data commons - arXiv 2407.14933
    Akademisk Publisert 2024-07-20 Hentet 2026-09-04
  10. Consent in Crisis: the rapid decline of the AI data commons - arXiv 2407.14933
    Akademisk Publisert 2024-07-20 Hentet 2026-09-04
  11. Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web - arXiv 2510.10315
    Akademisk Publisert 2025-10-11 Hentet 2026-09-04
  12. Strategic Response of News Publishers to Generative AI - arXiv 2512.24968
    Akademisk Publisert 2025-12-31 Hentet 2026-09-04 Enkeltkilde
  13. Scrapers selectively respect robots.txt directives - arXiv 2505.21733 (ACM IMC 2025)
    Akademisk Publisert 2025-05-27 Hentet 2026-09-04
  14. Content Independence Day: no AI crawl without compensation - Cloudflare Blog
    Leverandørdokumentasjon Publisert 2025-07-01 Hentet 2026-09-04
  15. Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web - arXiv 2510.10315
    Akademisk Publisert 2025-10-11 Hentet 2026-09-04 Flyktig, sist sjekket 2026-09-04

Sist oppdatert 2026-09-04. Skrevet og vedlikeholdt av Baseline Labs.

George
Online
0%