Skip to content

Trænings-scrapere

Koncept inden for AI-søgning og SEO
Volatil, senest kontrolleret 2026-09-04 Denne side indeholder målte tal, der ændrer sig hurtigt.Gennemgået 2026-09-04

Trænings-scrapere indsamler tekst i bulk til modeltræning snarere end til et indeks, som et live-svar henter fra. OpenAI dokumenterer GPTBot som den crawler, der gør deres grundmodeller mere nyttige og sikre[1], og siger, at en Disallow for den signalerer, at et websteds indhold ikke bør bruges til træning[2]. Anthropic's ClaudeBot indsamler indhold, der kan bidrage til træning[3], og Common Crawls CCBot leverer et offentligt arkiv indsamlet siden 2008, hvorfra de fleste åbne korpora er skåret[4][5]. At blokere denne klasse er en separat beslutning fra at blokere en søgecrawler.

Fravælgelse

De større operatører udgiver et token, der alene styrer træningen. Google-Extended afgør, om crawlet indhold må træne fremtidige Gemini-modeller[6], og Apple er eksplicit om, at Applebot-Extended ikke selv crawler noget: det er en præference, der læses ved træningstidspunktet, og en side, der blokerer den, vises stadig i søgeresultaterne[7]. Denne adskillelse er pointen. Et websted kan afvise træningskorpusset og beholde indeksindgangen, som en svar-motor citerer fra. Se robots.txt.

Common Crawl

Common Crawl er det største delte input. CCBot er en Nutch-baseret crawler bygget på Apache Hadoop[4], der leverer et korpus på petabytes indsamlet siden 2008[5]. Common Crawl udgiver en robots.txt-blok, der forhindrer crawleren i at crawle et websted[8], hvilket virker fremadrettet på crawls, der endnu ikke er foretaget. Tilbagetræknings-tallene nedenfor er derfor målt mod et korpus, C4, snarere end mod en live crawler[9].

Hvad fravælgelse koster

Afvisninger har bevæget sig hurtigt og ujævnt. En revision af 14.000 webdomæner viste, at robots.txt-restriktioner tilføjet på et enkelt år fuldt ud begrænsede mere end 5% af alle C4-tokens og mere end 28% af dets mest aktivt vedligeholdte kilder[9], med servicevilkår, der dækker 45% af korpusset[10]. Blandt nyhedssider blokerer 60,0% af velrenommerede medier mindst én AI-crawler mod 9,1% af misinformation-sider[11], et gab der forvrænger, hvad en model læser. Blokering er ikke gratis: udgivere, der blokerer generative AI-bots, oplever reduceret webtrafik i forhold til dem, der ikke gør[12]. Overholdelse er i alle tilfælde delvis, da bots adlyder mindre, jo strengere en instruktion bliver[13].

Standardomskiftningen i 2025

Blokering blev standarden snarere end en handling. Den 1. juli 2025 ændrede Cloudflare standardindstillingen på sit netværk til at blokere AI-crawlere, medmindre de betaler skabere for deres indhold[14], og blokering blandt velrenommerede nyhedssider var allerede steget fra 23% i september 2023 til næsten 60% i maj 2025[15]. Modstykket er betalt adgang snarere end gratis adgang, dækket under indholdslicensaftaler og AI-crawlere.

Bots i denne klasse

Baseline Labs' bot-register (v1) sporer 73 af disse. Hver har sin egen post med sin brugeragent, dens robots.txt-token og hvordan man verificerer den.

Den fulde bot-encyklopædi viser alle klasser side om side.

Data

Share of the C4 training corpus placed off limits, 2024 audit 012.52537.550All C4 tokens, robots.txtCritical sources, robots.txtC4, terms of service
Andel af C4-træningskorpusset, der er gjort utilgængeligt, 2024-revision. Tal i %.
Vis tallene (3)
Punkt%
Alle C4-tokens, robots.txt5
Kritiske kilder, robots.txt28
C4, servicevilkår45
Referencer (15)
  1. Oversigt over OpenAI Crawlere - OpenAI udviklerdokumentation
    Dokumentation Hentet 2026-09-04
  2. Oversigt over OpenAI Crawlere - OpenAI udviklerdokumentation
    Dokumentation Hentet 2026-09-04
  3. Crawler Anthropic data fra nettet, og hvordan kan webstedsejere blokere crawleren? - Claude support
    Dokumentation Hentet 2026-09-04
  4. Ofte stillede spørgsmål - Common Crawl
    Dokumentation Hentet 2026-09-04
  5. Oversigt - Common Crawl
    Dokumentation Hentet 2026-09-04
  6. Googles almindelige crawlere - Google Search Central
    Dokumentation Hentet 2026-09-04
  7. Om Applebot - Apple Support
    Dokumentation Hentet 2026-09-04
  8. Ofte stillede spørgsmål - Common Crawl
    Dokumentation Hentet 2026-09-04
  9. Samtykke i krise: den hurtige tilbagegang af AI-datafællesskabet - arXiv 2407.14933
    Akademisk Udgivet 2024-07-20 Hentet 2026-09-04
  10. Samtykke i krise: den hurtige tilbagegang af AI-datafællesskabet - arXiv 2407.14933
    Akademisk Udgivet 2024-07-20 Hentet 2026-09-04
  11. Er misinformation mere åben? En undersøgelse af robots.txt gatekeeping på nettet - arXiv 2510.10315
    Akademisk Udgivet 2025-10-11 Hentet 2026-09-04
  12. Nyhedsforlæggeres strategiske reaktion på generativ AI - arXiv 2512.24968
    Akademisk Udgivet 2025-12-31 Hentet 2026-09-04 Enkeltkilde
  13. Scrapere respekterer selektivt robots.txt-direktiver - arXiv 2505.21733 (ACM IMC 2025)
    Akademisk Udgivet 2025-05-27 Hentet 2026-09-04
  14. Indholdets uafhængighedsdag: ingen AI-crawl uden kompensation - Cloudflare Blog
    Leverandørdokumentation Udgivet 2025-07-01 Hentet 2026-09-04
  15. Er misinformation mere åben? En undersøgelse af robots.txt gatekeeping på nettet - arXiv 2510.10315
    Akademisk Udgivet 2025-10-11 Hentet 2026-09-04 Volatil, senest kontrolleret 2026-09-04

Senest opdateret 2026-09-04. Skrevet og vedligeholdt af Baseline Labs.

George
Online
0%