Scrapers oiliúna
Bailíonn scrapers oiliúna téacs go mórchóir le haghaidh oiliúna samhail seachas le haghaidh innéacs a aisghabhann freagra beo. Déanann OpenAI doiciméadú ar GPTBot mar an craoltóir a dhéanann a chuid samhlacha bunúsacha níos úsáidí agus níos sábháilte[1], agus deir sé go léiríonn Diúltú dó nach ceart ábhar suímh a úsáid in oiliúint[2]. Bailíonn ClaudeBot Anthropic ábhar a d'fhéadfadh cur le hoiliúint[3], agus cothaíonn CCBot Common Crawl cartlann phoiblí a bailíodh ó 2008 as a ngearrtar an chuid is mó de chorpora oscailte[4][5]. Cinneadh ar leithligh é an aicme seo a bhlocáil ó craoltóir cuardaigh a bhlocáil.
Diúltú
Foilsíonn na hoibreoirí níos mó comhartha a rialaíonn oiliúint amháin. Cinneann Google-Extended an féidir ábhar craolta a oiliúint ar shamhlacha Gemini amach anseo[6], agus tá Apple soiléir nach ndéanann Applebot-Extended aon rud a chraoladh é féin: is rogha é a léitear ag am oiliúna, agus tá leathanach a dhiúltaíonn dó fós le feiceáil i dtorthaí cuardaigh[7]. Sin é an pointe leis an scaradh sin. Is féidir le suíomh diúltú don chorpas oiliúna agus an iontráil innéacs a choinneáil a luann inneall freagraí. Féach robots.txt.
Common Crawl
Is é Common Crawl an t-ionchur roinnte is mó. Is craoltóir bunaithe ar Nutch é CCBot a tógadh ar Apache Hadoop[4], ag cothú corpas de pheiteabhearta a bailíodh ó 2008[5]. Foilsíonn Common Crawl bloc robots.txt a stopann an craoltóir ó shuíomh a chraoladh[8], a fheidhmíonn ar aghaidh, ar chraoltaí nár tógadh fós. Dá bhrí sin, déantar na figiúirí aistarraingthe thíos a thomhas i gcoinne corpas, C4, seachas i gcoinne craoltóra beo[9].
Cad a chosnaíonn diúltú
D'athraigh diúltaithe go tapa agus go míchothrom. Fuarthas amach in iniúchadh ar 14,000 fearann gréasáin gur chuir srianta robots.txt a cuireadh leis in aon bhliain amháin srian iomlán ar níos mó ná 5% de gach comhartha C4 agus níos mó ná 28% dá fhoinsí is gníomhaí a chothabháil[9], le téarmaí seirbhíse a chlúdaíonn 45% den chorpas[10]. I measc suíomhanna nuachta, diúltaíonn 60.0% de na meáin chreidiúnacha do chraoltóir AI amháin ar a laghad i gcoinne 9.1% de shuíomhanna mífhaisnéise[11], bearna a shaobhann an méid a léann samhail. Níl blocáil saor in aisce: feiceann foilsitheoirí a bhlocálann róbait AI giniúna trácht suímh laghdaithe i gcoinne na ndaoine nach ndéanann[12]. Níl an comhlíonadh iomlán ar aon nós, ós rud é go gcloíonn róbait níos lú de réir mar a éiríonn treoir níos déine[13].
An t-athrú réamhshocraithe 2025
Tháinig blocáil chun bheith mar an réamhshocrú seachas gníomh. Ar 1 Iúil 2025 d'athraigh Cloudflare an réamhshocrú ar a líonra chun craoltóirí AI a bhlocáil mura n-íocann siad cruthaitheoirí as a n-ábhar[14], agus bhí blocáil i measc suíomhanna nuachta creidiúnacha tar éis ardú cheana féin ó 23% i Meán Fómhair 2023 go dtí beagnach 60% faoi Bhealtaine 2025[15]. Is é an comhghleacaí rochtain íoctha seachas rochtain saor in aisce, a chumhdaítear faoi comhaontuithe ceadúnaithe ábhair agus craoltóirí AI.
Róbait san aicme seo
Rianaíonn clárlann róbat Baseline Labs (v1) 73 díobh seo. Tá a iontráil féin ag gach ceann acu lena ghníomhaire úsáideora, a chomhartha robots.txt agus conas é a fhíorú.
- AgentTimesThe Agent Times
- AI2BotAllen Institute
- Ai2Bot-DolmaAllen Institute
- aiHitBotaiHit
- anthropic-aiAnthropic
- ApifyBotApify
- ApifyWebsiteContentCrawlerApify
- Applebot-ExtendedApple
- AwarioAwario
- bedrockbotAmazon
- BrightbotBright Data
- BytespiderByteDance
- CCBotCommon Crawl
- ChatGLM-SpiderZhipu AI
- Claude-WebAnthropic
- ClaudeBotAnthropic
- CotoyogiROIS
- CragCrawlerCragSoftware
- Crawl4AICrawl4AI
- CrawlspaceCrawlspace
- Datenbank CrawlerDatenbank
- DeepSeekBotDeepSeek
- DiffbotDiffbot
- Echobot BotEchobox
- EchoboxBotEchobox
- FacebookBotMeta
- facebookexternalhitMeta
- Factset_spyderbotFactSet
- FirecrawlAgentFirecrawl
- FriendlyCrawlerAnaithnid
- Google-CloudVertexBotGoogle
- Google-ExtendedGoogle
- Google-FirebaseGoogle
- GPTBotOpenAI
- HenkBotAnaithnid
- ICC-CrawlerNICT
- ImagesiftBotImageSift
- imageSpiderAnaithnid
- img2datasetimg2dataset
- ISSCyberRiskCrawlerISS-Corporate
- Kangaroo BotAnaithnid
- KunatoCrawlerKunato
- laion-huggingface-processorLAION
- LAIONDownloaderLAION
- Linguee BotLinguee
- meta-externalagentMeta
- Mozilla-TabstackMozilla
- MyCentralAIScraperBotAnaithnid
- NagetBotNaget
- netEstate Imprint CrawlernetEstate
- newsaiAnaithnid
- omgiliWebz.io
- omgilibotWebz.io
- PanguBotHuawei
- PanscientPanscient
- Poseidon Research CrawlerPoseidon Research
- QuillBotQuillBot
- SBIntuitionsBotSB Intuitions
- ScrapyZyte
- SemrushBot-OCOBSemrush
- SemrushBot-SWASemrush
- ShapBotParallel
- Sidetrade indexer botSidetrade
- TerraCottaCeramic AI
- ThinkbotThinkbot
- TikTokSpiderByteDance
- VelenPublicWebCrawlerVelen
- WARDBotWEBSPARK
- Webzio-ExtendedWebz.io
- xAI-BotxAI
- YaKMeltwater
- YandexAdditionalYandex
- YandexAdditionalBotYandex
Liostaíonn an chiclipéid róbat iomlán gach aicme taobh le taobh.
Sonraí
Taispeáin na huimhreacha (3)
| Pointe | % |
|---|---|
| Gach comhartha C4, robots.txt | 5 |
| Foinsí criticiúla, robots.txt | 28 |
| C4, téarmaí seirbhíse | 45 |
Tagairtí (15)
- Forbhreathnú ar Chraoltóirí OpenAI - Doiciméid forbróra OpenAI
- Forbhreathnú ar Chraoltóirí OpenAI - Doiciméid forbróra OpenAI
- An ndéanann Anthropic sonraí a chraoladh ón ngréasán, agus conas is féidir le húinéirí suímh an craoltóir a bhlocáil? - Tacaíocht Claude
- Ceisteanna coitianta - Common Crawl
- Forbhreathnú - Common Crawl
- Craoltóirí coitianta Google - Google Search Central
- Maidir le Applebot - Tacaíocht Apple
- Ceisteanna coitianta - Common Crawl
- Consent in Crisis: the rapid decline of the AI data commons - arXiv 2407.14933
- Consent in Crisis: the rapid decline of the AI data commons - arXiv 2407.14933
- Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web - arXiv 2510.10315
- Strategic Response of News Publishers to Generative AI - arXiv 2512.24968
- Scrapers selectively respect robots.txt directives - arXiv 2505.21733 (ACM IMC 2025)
- Lá Neamhspleáchais Ábhair: gan aon chraoladh AI gan cúiteamh - Blag Cloudflare
- Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web - arXiv 2510.10315
Nuashonraithe go deireanach 2026-09-04. Scríofa agus cothabháilte ag Baseline Labs.