'Alle KI-Bots blockieren' kostet Sie jetzt aktiv Sichtbarkeit
Der robots.txt-Ratschlag, den Sie vor zwei Jahren kopiert haben, wirkt sich jetzt gegen Sie aus. Jeder große KI-Anbieter hat seine Crawler in zwei Teile aufgeteilt – einen Bot, der auf Ihren Inhalten trainiert, und einen anderen, der Live-Suchantworten liefert. Blockieren Sie alles, und Sie verschwinden aus den ChatGPT-Suchergebnissen, den Abrufantworten von Claude und den Perplexity-Zitaten. Der Trainings-Bot und der Such-Bot erledigen unterschiedliche Aufgaben, und sie als einen zu behandeln, kostet Sie stillschweigend Sichtbarkeit.
Eine Disallow Zeile, zwei sehr unterschiedliche Bots
Als die meisten Websites KI-Bot-Sperren hinzufügten, dachten sie an Trainingsdaten – und das war
vernünftig. Aber die Crawler haben sich seitdem vervielfacht. OpenAI betreibt jetzt drei verschiedene Bots.
Anthropic folgte Anfang 2026. Eine pauschale Disallow: / für einen dieser Namen
erfasst sowohl den Trainings-Crawler als auch den Such-/Abruf-Crawler – und nur einer davon
schadet Ihnen, wenn Sie ihn blockieren.
Die Dokumentation von OpenAI ist eindeutig: "Websites, die sich von OAI-SearchBot abgemeldet haben, werden in den ChatGPT-Suchantworten nicht angezeigt." Die gleiche Logik gilt für Claude-SearchBot und Claude-User. Blockieren Sie diese, und Sie schließen sich von der Zitierung in Echtzeit- KI-Antworten aus. Das geht weit über das zukünftige Modelltraining hinaus, das Sie stoppen wollten.
| Anbieter | Trainings-Bot | Such-/Abruf-Bot | Das Blockieren des Such-Bots entfernt Sie aus… |
|---|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot & ChatGPT-User | ChatGPT-Suchantworten |
| Anthropic | ClaudeBot | Claude-SearchBot & Claude-User | Claude-Suche & Live-Abruf-Antworten |
| Google-Extended | Googlebot (wie Websuche) | Das Blockieren von Google-Extended entfernt Sie nicht aus den KI-Übersichten | |
| ByteDance | Bytespider | - | Nur Training; kein bestätigtes Suchprodukt |
Die Google-Zeile verdient eine eigene Anmerkung. Die KI-Übersichten von Google sind mit dem Kern-
Such-Crawler gebündelt – das Blockieren von Google-Extended meldet Sie vom Gemini-Training ab,
bewirkt aber nichts, um Sie aus den KI-Übersichten zu entfernen. Der Unterschied ist wichtig.
GPTBot führt die Blockierliste an – und wächst weiter
TechnologyChecker.io scannte im ersten Quartal 2026 29,9 Millionen aktive Domains und
platzierte KI-Crawler nach dem Anteil der DISALLOW Regeln. Das Ergebnis: GPTBot
sitzt an der Spitze und übertrifft bereits den älteren CCBot. Die meisten dieser Blöcke
wurden geschrieben, bevor die Trennung von Training und Suche allgemein verstanden wurde –
was bedeutet, dass ein großer Teil davon diese Websites stillschweigend von der KI-Suchzitation
ausschließt.
Eine BuzzStream-Analyse von 100 führenden US-amerikanischen und britischen Nachrichtenverlagen (Januar 2026) ergab, dass 79 % mindestens einen Trainings-Bot blockieren – doch Google-Extended war mit 46 % insgesamt der am wenigsten blockierte Trainings-Crawler, wobei US-Verlage (58 %) weit vor britischen Verlagen (29 %) lagen. Verlage wollen eindeutig blockieren – sie sind nur ungeschickt darin, wie sie es tun.
416 Milliarden Anfragen in fünf Monaten blockiert
Als Cloudflare am 1. Juli 2025 den "Content Independence Day" ausrief und begann, KI-Crawler standardmäßig auf neuen Domains zu blockieren, erhielten wir das erste großflächige Bild davon, wie viel KI-Crawling stattfindet – bis Juni 2026 hatten Bots die Menschen als Mehrheit des HTML-Traffics überholt. Cloudflare-CEO Matthew Prince gab die Gesamtzahl im Dezember 2025 in WIREDs Big Interview bekannt: 416 Milliarden KI-Bot-Anfragen in etwa fünf Monaten abgewehrt – rund 2,8 Milliarden pro Tag. Das ist ein industrieller Extraktionsbetrieb im vollen Umfang, der rund um die Uhr läuft.
Prince bezifferte auch Googles strukturellen Vorteil in klaren Zahlen (Januar 2026, eingereicht zusammen mit der UK CMA-Konsultation): "Google nutzt sein Suchmonopol, um 3,2-mal so viel vom Web zu sehen wie OpenAI, 4,8-mal so viel wie Microsoft und mehr als 6-mal so viel wie fast alle anderen." Diese Asymmetrie bedeutet, dass das Blockieren von Google-Crawlern weit mehr Sichtbarkeit kostet als das Blockieren des Äquivalents eines anderen Anbieters.
Pay-per-Crawl: Ein Mittelweg entsteht
Anstatt binär zu erlauben/blockieren, beginnen Verlage, den Zugang zu berechnen. Der Pay Per Crawl-Marktplatz von Cloudflare (angekündigt 2026) ermöglicht es Verlagen, eine
HTTP 402 Payment Required Antwort mit einem Crawler-Preis-Header zurückzugeben; Cloudflare fungiert
als Merchant of Record. Über eine Milliarde solcher Antworten werden bereits täglich im
Netzwerk von Cloudflare versendet.
Stack Overflow hat die Trennung im Februar 2026 konkretisiert: Ein Lizenzvertrag mit Cloudflare berechnet den Zugang für kommerzielle Trainingszwecke, während der Inhalt der Community frei lesbar bleibt. Trainingsdaten haben einen Wert; die Suchabfrage hilft der Community. Für das eine zu berechnen, während das andere erlaubt wird, ist nun eine aktuelle Produktentscheidung – Unternehmen setzen dies tatsächlich um.
Nicht jedes Blockieren ist falsch
Dieser Beitrag plädiert nicht für einen offenen Zugang zu allem. Es gibt gute Gründe, Trainings-Crawler fernzuhalten, und Sie sollten diese abwägen:
- Trainingsdaten haben einen echten Wert. Wenn Ihre Inhalte originell und maßgeblich sind, extrahieren Trainings-Crawler diesen Wert kostenlos. Der Stack Overflow-Deal schafft einen Präzedenzfall für das Berechnen statt Schenken.
- Trainings-Crawler geben keine Attribution und keinen Verweis-Traffic. Im Gegensatz zu Suchbot-Zitaten hinterlassen Trainingsdurchläufe keine Spuren – Ihre Inhalte verbessern ein Modell ohne Anerkennung und ohne Rückverlinkung.
- IP- und Wettbewerbsrisiko. Wenn Ihre Inhalte proprietär oder domänenspezifisch genug sind, um einen Wettbewerbsvorteil darzustellen, möchten Sie sie möglicherweise nicht in ein öffentliches LLM einbacken, das jeder Konkurrent abfragen kann.
Das Argument hier ist eng gefasst: Blockieren Sie Trainings-Crawler bewusst, wenn Sie sich dafür entscheiden, aber tun Sie es namentlich, damit eine umfassende Regel nicht auch die Such-/Abruf-Bots erfasst, die Zitate und Sichtbarkeit fördern.
Ein weiterer Vorbehalt: Die Durchsetzung von robots.txt ist freiwillig. Bytespider hat eine dokumentierte Geschichte des Ignorierens. Spoofers verwenden routinemäßig Chrome-User-Agents, um die Erkennung zu vermeiden. Ein robots.txt-Eintrag signalisiert Ihre Präferenz und gibt Ihnen eine rechtliche Grundlage für Beschwerden; er verhindert technisch nicht den Zugang. Echte Kontrolle erfordert serverseitige Regeln, WAF-Konfiguration und verifizierte Bot-Signale (Cloudflares Bot-Management kann legitime Crawler anhand von IP und TLS-Fingerprint verifizieren, bevor sie zugelassen oder berechnet werden). Behandeln Sie robots.txt als Ihre erste Schicht und sichern Sie sie dann mit den oben genannten serverseitigen Kontrollen ab.
Trainings-Bots namentlich blockieren
Eine robots.txt, die Training von Suche unterscheidet, sieht so aus:
| Bot | Rolle | Empfohlene Haltung |
|---|---|---|
GPTBot |
OpenAI-Training | Blockieren, wenn Sie die Nutzung von Trainingsdaten ablehnen möchten |
OAI-SearchBot |
ChatGPT-Suchindex | Zulassen – Blockieren entfernt Sie aus den ChatGPT-Suchergebnissen |
ChatGPT-User |
Live-Benutzerabruf | Zulassen – ermöglicht Echtzeit-Browsing in ChatGPT |
ClaudeBot |
Anthropic-Training | Blockieren, wenn Sie die Nutzung von Trainingsdaten ablehnen möchten |
Claude-SearchBot |
Claude-Suchindex | Zulassen – Blockieren entfernt Sie aus den Claude-Suchergebnissen |
Claude-User |
Live-Claude-Abruf | Zulassen – ermöglicht Live-Abruf in Claude |
Google-Extended |
Gemini / SGE-Training | Blockieren, wenn Sie Gemini-Training ablehnen möchten (betrifft nicht AI Overviews) |
Bytespider |
ByteDance-Training | Blockieren – kein Suchprodukt, bekannte robots.txt-Historie |
Der zweite Schritt ist zu prüfen, ob Ihr CDN oder WAF diese Entscheidung bereits für Sie getroffen hat. Cloudflare begann ab dem 1. Juli 2025 standardmäßig, KI-Crawler auf allen neuen Domains zu blockieren. Wenn Sie eine Domain nach diesem Datum eingerichtet oder migriert haben, können KI-Crawler bereits auf Netzwerkebene blockiert sein – einschließlich der Such-Bots, die Sie möglicherweise zulassen möchten. Überprüfen Sie Ihre Cloudflare Sicherheits- → Bot-Einstellungen, bevor Sie davon ausgehen, dass Ihre robots.txt die Arbeit erledigt.
Der dritte Schritt ist, Ihre aktuelle KI-Sichtbarkeit zu messen, damit Sie wissen, was Sie zu verlieren oder zu gewinnen haben. Das ist es, was der Brand-Scanner von Baseline tut.
Quellen: OpenAI Plattform-Dokumente (openai.com/gptbot, openai.com/searchbot); Anthropic Support-Dokumente zu Claude Crawlern (Berichterstattung: Search Engine Journal); TechnologyChecker.io, "robots.txt AI crawlers blocking report Q1 2026" - technologychecker.io (29,9 Mio. Domains); BuzzStream, "How Publishers Are Blocking AI" (Jan 2026) - buzzstream.com; Cloudflare "Content Independence Day" Pressemitteilung (Jul 2025) - cloudflare.com; 416 Mrd. Anfragen Statistik - Matthew Prince bei WIRED Big Interview, 4. Dez 2025 (via Tom's Hardware); Prince über den Google Webzugriffsvorteil (Jan 2026) via Search Engine Land; Cloudflare Pay Per Crawl - blog.cloudflare.com, AI Crawl Control.

