Søge-crawlere
Søge-crawlere henter sider i bulk for at opbygge et indeks, som en svar-motor henter fra ved forespørgselstidspunktet[1]. De er den klasse, en AI-svar normalt citerer: OpenAI kører OAI-SearchBot til ChatGPT's søgefunktioner[2], Anthropic kører Claude-SearchBot[3], og Perplexity kører PerplexityBot for at vise og linke sider i sine resultater[4]. Hvad der adskiller dem fra en trænings-scraper er, hvad der sker med kopien: en indeksindgang kan hentes og linkes tilbage, et træningskorpus absorberes i modelvægte, og de to styres af forskellige robots.txt-tokens[5].
Separate tokens til indeks og træning
Google udgiver forskellige robots.txt-tokens til de to opgaver. GoogleOther er den generiske crawler, som dets produktteams bruger til at hente offentligt tilgængeligt indhold[6], mens Google-Extended er et selvstændigt token, der afgør, om crawlet indhold må træne fremtidige Gemini-modeller[5]. Et websted kan forblive i indekset og ude af træningskorpusset. OpenAI dokumenterer den samme opdeling, idet de kører OAI-SearchBot til søgning og et separat token til modeltræning[2]. Se trænings-scrapere og robots.txt.
Robots.txt-håndtering
Google angiver, at dets almindelige crawlere altid respekterer robots.txt-regler for automatiske crawls[7], og protokollen antager netop det: en crawler læser filen og beslutter, hvad den skal følge[1]. Lydighed på tværs af den bredere befolkning er ujævn, og den blev ikke målt i det meste af protokollens levetid: 2025-papiret, der først testede det i stor skala, på anonymiserede institutionelle weblogs, registrerer, at beviserne før det var anekdotiske[8]. Denne undersøgelse, af 130 selvudnævnte bots over 40 dage, fandt, at overholdelse falder, når et direktiv bliver strengere, og at AI-søge-crawlere ofte slet ikke anmoder om robots.txt[9], så en Disallow-linje er en anmodning snarere end en kontrol.
Hvad indeksering giver
Medlemskab af indekset er forudsætningen for citering. OpenAI angiver, at et websted, der har fravalgt OAI-SearchBot, ikke vil blive vist i ChatGPT-søgeresultater, selvom det stadig kan vises som et navigationslink[2], Anthropic beskriver Claude-SearchBot som analyserende indhold for at forbedre relevansen af søgeresultater[3], og Perplexity beder webmastere om at tillade PerplexityBot, så sider kan vises og linkes[4]. Blokering af søgetokenet for en motor fjerner siden fra den pulje, dens svar trækkes fra, hvilket er en anden beslutning end at nægte træning. Se ChatGPT-søgning, svar-motorer og AI-citeringskilder.
Volumen
Søge-crawling forbliver den største andel af automatiseret hentning. Cloudflare registrerede, at Googlebot steg fra 30 % til 50 % af crawler-anmodninger mellem maj 2024 og maj 2025[10], med GPTBot stigende fra 2,2 % til 7,7 % på en stigning på 305 % i anmodninger[11]. I løbet af 2025 stammede Googlebot 4,5 % af HTML-anmodningerne på Cloudflare-netværket mod 4,2 % for alle andre AI-bots tilsammen[12]. Hentning er et mindretal af erklæret AI-bot-formål: et leverandør-crawler-panel for januar til juli 2026 placerede søgning eller svarhentning på 11,1 % af AI-bot-anmodninger mod 46,5 % for træning[13]. Se Cloudflare og AI-crawlere.
Bots i denne klasse
Baseline Labs bot-register (v1) sporer 33 af disse. Hver har sin egen post med sin brugeragent, sit robots.txt-token og hvordan man verificerer det.
- AddSearchBotAddSearch
- AIWebIndexLyrenth
- amazon-kendraAmazon
- AmazonbotAmazon
- Amzn-SearchBotAmazon
- AndibotAndi
- AnomuraDireqt
- ApplebotApple
- Aranet-SearchBotUkendt
- atlassian-botAtlassian
- AzureAI-SearchBotMicrosoft
- BravebotBrave
- Channel3BotUkendt
- Claude-SearchBotAnthropic
- Cloudflare-AutoRAGCloudflare
- ExaBotExa
- GoogleOtherGoogle
- GoogleOther-ImageGoogle
- GoogleOther-VideoGoogle
- GrokBotxAI
- iAskBotiAsk
- iaskspideriAsk
- LinkupBotLinkup
- meta-webindexerMeta
- OAI-SearchBotOpenAI
- PerplexityBotPerplexity
- PetalBotHuawei
- Querit-SearchBotQuerit
- QueritBotQuerit
- TavilyBotTavily
- TimpibotTimpi
- YouBotYou.com
- ZanistaBotUkendt
Den fulde bot-encyklopædi viser alle klasser side om side.
Referencer (13)
- Web crawler - Wikipedia
- Oversigt over OpenAI Crawlers - OpenAI udviklerdokumentation
- Crawler Anthropic data fra nettet, og hvordan kan webstedsejere blokere crawleren? - Claude support
- PerplexityBot - Perplexity udviklerdokumentation
- Googles almindelige crawlere - Google Search Central
- Googles almindelige crawlere - Google Search Central
- Oversigt over Googles crawlere og fetchere - Google Search Central
- Scrapere respekterer selektivt robots.txt-direktiver: beviser fra en storstilet empirisk undersøgelse
- Scrapere respekterer selektivt robots.txt-direktiver - arXiv 2505.21733 (ACM IMC 2025)
- Fra Googlebot til GPTBot: hvem crawler dit websted i 2025 - Cloudflare Blog
- Fra Googlebot til GPTBot: hvem crawler dit websted i 2025 - Cloudflare Blog
- Cloudflare Radar 2025 Årsrapport - Cloudflare Blog
- Crawl-to-refer-forhold: AI-crawlere og LLM-bots - Seomator crawler-panel
Sidst opdateret 2026-09-04. Skrevet og vedligeholdt af Baseline Labs.