Skip to content

Søge-crawlere

Koncept inden for AI-søgning og SEO
Volatil, sidst kontrolleret 2026-09-04 Denne side indeholder målte tal, der hurtigt ændrer sig.Gennemgået 2026-09-04

Søge-crawlere henter sider i bulk for at opbygge et indeks, som en svar-motor henter fra ved forespørgselstidspunktet[1]. De er den klasse, en AI-svar normalt citerer: OpenAI kører OAI-SearchBot til ChatGPT's søgefunktioner[2], Anthropic kører Claude-SearchBot[3], og Perplexity kører PerplexityBot for at vise og linke sider i sine resultater[4]. Hvad der adskiller dem fra en trænings-scraper er, hvad der sker med kopien: en indeksindgang kan hentes og linkes tilbage, et træningskorpus absorberes i modelvægte, og de to styres af forskellige robots.txt-tokens[5].

Separate tokens til indeks og træning

Google udgiver forskellige robots.txt-tokens til de to opgaver. GoogleOther er den generiske crawler, som dets produktteams bruger til at hente offentligt tilgængeligt indhold[6], mens Google-Extended er et selvstændigt token, der afgør, om crawlet indhold må træne fremtidige Gemini-modeller[5]. Et websted kan forblive i indekset og ude af træningskorpusset. OpenAI dokumenterer den samme opdeling, idet de kører OAI-SearchBot til søgning og et separat token til modeltræning[2]. Se trænings-scrapere og robots.txt.

Robots.txt-håndtering

Google angiver, at dets almindelige crawlere altid respekterer robots.txt-regler for automatiske crawls[7], og protokollen antager netop det: en crawler læser filen og beslutter, hvad den skal følge[1]. Lydighed på tværs af den bredere befolkning er ujævn, og den blev ikke målt i det meste af protokollens levetid: 2025-papiret, der først testede det i stor skala, på anonymiserede institutionelle weblogs, registrerer, at beviserne før det var anekdotiske[8]. Denne undersøgelse, af 130 selvudnævnte bots over 40 dage, fandt, at overholdelse falder, når et direktiv bliver strengere, og at AI-søge-crawlere ofte slet ikke anmoder om robots.txt[9], så en Disallow-linje er en anmodning snarere end en kontrol.

Hvad indeksering giver

Medlemskab af indekset er forudsætningen for citering. OpenAI angiver, at et websted, der har fravalgt OAI-SearchBot, ikke vil blive vist i ChatGPT-søgeresultater, selvom det stadig kan vises som et navigationslink[2], Anthropic beskriver Claude-SearchBot som analyserende indhold for at forbedre relevansen af søgeresultater[3], og Perplexity beder webmastere om at tillade PerplexityBot, så sider kan vises og linkes[4]. Blokering af søgetokenet for en motor fjerner siden fra den pulje, dens svar trækkes fra, hvilket er en anden beslutning end at nægte træning. Se ChatGPT-søgning, svar-motorer og AI-citeringskilder.

Volumen

Søge-crawling forbliver den største andel af automatiseret hentning. Cloudflare registrerede, at Googlebot steg fra 30 % til 50 % af crawler-anmodninger mellem maj 2024 og maj 2025[10], med GPTBot stigende fra 2,2 % til 7,7 % på en stigning på 305 % i anmodninger[11]. I løbet af 2025 stammede Googlebot 4,5 % af HTML-anmodningerne på Cloudflare-netværket mod 4,2 % for alle andre AI-bots tilsammen[12]. Hentning er et mindretal af erklæret AI-bot-formål: et leverandør-crawler-panel for januar til juli 2026 placerede søgning eller svarhentning på 11,1 % af AI-bot-anmodninger mod 46,5 % for træning[13]. Se Cloudflare og AI-crawlere.

Bots i denne klasse

Baseline Labs bot-register (v1) sporer 33 af disse. Hver har sin egen post med sin brugeragent, sit robots.txt-token og hvordan man verificerer det.

Den fulde bot-encyklopædi viser alle klasser side om side.

Referencer (13)
  1. Web crawler - Wikipedia
    Journalistik Hentet 2026-09-04
  2. Oversigt over OpenAI Crawlers - OpenAI udviklerdokumentation
    Dokumentation Hentet 2026-09-04
  3. Crawler Anthropic data fra nettet, og hvordan kan webstedsejere blokere crawleren? - Claude support
    Dokumentation Hentet 2026-09-04
  4. PerplexityBot - Perplexity udviklerdokumentation
    Dokumentation Hentet 2026-09-04
  5. Googles almindelige crawlere - Google Search Central
    Dokumentation Hentet 2026-09-04
  6. Googles almindelige crawlere - Google Search Central
    Dokumentation Hentet 2026-09-04
  7. Oversigt over Googles crawlere og fetchere - Google Search Central
    Dokumentation Hentet 2026-09-04
  8. Scrapere respekterer selektivt robots.txt-direktiver: beviser fra en storstilet empirisk undersøgelse
    Akademisk Udgivet 2025-05-27 Hentet 2026-09-04
  9. Scrapere respekterer selektivt robots.txt-direktiver - arXiv 2505.21733 (ACM IMC 2025)
    Akademisk Udgivet 2025-05-27 Hentet 2026-09-04
  10. Fra Googlebot til GPTBot: hvem crawler dit websted i 2025 - Cloudflare Blog
    Leverandørdokumentation Udgivet 2025-07-01 Hentet 2026-09-04 Volatil, sidst kontrolleret 2026-09-04
  11. Fra Googlebot til GPTBot: hvem crawler dit websted i 2025 - Cloudflare Blog
    Leverandørdokumentation Udgivet 2025-07-01 Hentet 2026-09-04 Volatil, sidst kontrolleret 2026-09-04
  12. Cloudflare Radar 2025 Årsrapport - Cloudflare Blog
    Leverandørdokumentation Hentet 2026-09-04 Volatil, sidst kontrolleret 2026-09-04
  13. Crawl-to-refer-forhold: AI-crawlere og LLM-bots - Seomator crawler-panel
    Leverandørdokumentation Udgivet 2026-07-21 Hentet 2026-09-04 Enkeltkilde Volatil, sidst kontrolleret 2026-09-04

Sidst opdateret 2026-09-04. Skrevet og vedligeholdt af Baseline Labs.

George
Online
0%