Was der Check prüft
robots.txt je KI-Bot
Wir lesen deine robots.txt so, wie die Bots es tun (RFC 9309): eigene Gruppe vor „*“, längste Regel gewinnt. Für acht Bots siehst du, ob sie die geprüfte Seite lesen dürfen und welche Zeile das entscheidet.
Firewall-Gegenprobe
Wir rufen die Seite einmal als Browser und einmal mit der Kennung von GPTBot, OAI-SearchBot, ClaudeBot und PerplexityBot ab. Weist nur der Bot-Abruf ab, sperrt eine Firewall oder ein CDN, auch wenn die robots.txt alles erlaubt.
Text ohne JavaScript
Wir zählen die Wörter, die direkt im HTML stehen. Ab 150 Wörtern gilt die Seite als lesbar, unter 50 als leer.
Indexierung
Wir suchen noindex und nosnippet im Meta-Tag „robots“ und im HTTP-Header X-Robots-Tag.
llms.txt
Wir prüfen, ob /llms.txt eine Textdatei mit der Überschrift „# Name“ liefert, und zählen ihre Links. Eine HTML-Seite unter dieser Adresse zählt nicht.
Strukturierte Daten
Wir lesen alle JSON-LD-Blöcke der Seite, zeigen ihre Typen (etwa Organization oder LocalBusiness) und melden kaputtes JSON.
Die KI-Crawler im Überblick
Nicht jeder Bot hat dieselbe Aufgabe. Such-Bots bauen den Index, aus dem ChatGPT-Suche, Claude oder Perplexity antworten. Trainings-Crawler sammeln Texte, mit denen künftige Modelle trainiert werden.
| Bot | Anbieter | Aufgabe laut Anbieter |
|---|---|---|
OAI-SearchBot | OpenAI | Suchindex der ChatGPT-Suche. Wer ihn sperrt, erscheint dort nicht mehr in Antworten. |
ChatGPT-User | OpenAI | Abruf im Auftrag eines Nutzers. robots.txt-Regeln gelten dafür laut OpenAI nicht unbedingt. |
GPTBot | OpenAI | Sammelt Inhalte für das Training von OpenAI-Modellen. |
Claude-SearchBot | Anthropic | Suchindex für die Antworten von Claude. |
ClaudeBot | Anthropic | Sammelt Inhalte für das Training von Claude. |
PerplexityBot | Perplexity | Suchindex von Perplexity, laut Anbieter nicht für Training. |
Google-Extended | Kein eigener Crawler, nur ein robots.txt-Eintrag: steuert Gemini-Training und Grounding, nicht die Google-Suche. | |
CCBot | Common Crawl | Crawler von Common Crawl. Der offene Datensatz dient vielen Modellen als Trainingsgrundlage. |
Training sperren, Suche erlauben?
Viele Unternehmen wollen in KI-Antworten vorkommen, ihre Texte aber nicht fürs Training hergeben. Das lässt sich trennen: Such-Bots freigeben, Trainings-Crawler sperren. Wer GPTBot sperrt, verschwindet laut OpenAI nicht aus der ChatGPT-Suche, dafür ist OAI-SearchBot zuständig. Und Google-Extended hat laut Google keinen Einfluss auf die Google-Suche.
# KI-Suche erlauben
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /
# KI-Training sperren (optional)
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /Wer für Trainings-Crawler eine eigene Gruppe anlegt, sperrt nur diese. Alle anderen Bots folgen weiter der Gruppe „User-agent: *“.
Warum JavaScript zum Problem wird
Viele moderne Websites bauen ihren Inhalt erst im Browser per JavaScript auf. Für Menschen sieht das gleich aus, für KI-Crawler nicht: Laut einer Auswertung von Vercel (Dezember 2024) laden die Crawler von OpenAI und Anthropic zwar JavaScript-Dateien, führen sie aber nicht aus. Was erst im Browser entsteht, bleibt für sie unsichtbar.
Häufige Fragen
Sollte ich GPTBot sperren?
Das ist eine Abwägung. GPTBot sammelt Trainingsdaten für OpenAI-Modelle. Wer ihn sperrt, verschwindet laut OpenAI nicht aus der ChatGPT-Suche, dafür ist OAI-SearchBot zuständig. Ohne Training kennt ein künftiges Modell deine Marke aber womöglich schlechter.
Warum meldet der Check eine Firewall-Sperre, obwohl meine robots.txt alles erlaubt?
Die robots.txt ist eine Bitte an die Bots, eine Firewall eine Tür. Viele CDNs und Sicherheits-Plugins blocken KI-Bots anhand ihrer Kennung, unabhängig von der robots.txt. Cloudflare fragt neue Domains seit Juli 2025 bei der Einrichtung, ob KI-Crawler geblockt werden sollen. Unser Abruf kommt nicht von den Adressen der Anbieter, deshalb kann eine Sperre auch Bots gelten, die sich nur als GPTBot ausgeben.
Hält sich jeder Bot an die robots.txt?
Die Crawler in diesem Check halten sich laut ihren Anbietern daran. Ausnahmen nennen die Anbieter selbst: Für ChatGPT-User gelten die Regeln laut OpenAI nicht unbedingt, und Perplexity-User ignoriert die robots.txt laut Perplexity in der Regel. Beide rufen Seiten nur im Auftrag eines Nutzers ab. Wer sie sicher aussperren will, braucht eine Firewall-Regel.
Wie schnell wirkt eine Änderung an der robots.txt?
OpenAI und Perplexity nennen in ihrer Doku etwa 24 Stunden. Den Check kannst du sofort wiederholen: Er liest die robots.txt jedes Mal frisch.
Was ist Google-Extended?
Ein Eintrag für die robots.txt, kein eigener Crawler. Google liest deine Seiten weiter mit dem Googlebot. Google-Extended legt nur fest, ob diese Inhalte für das Training von Gemini und für das Grounding in Gemini-Apps und Vertex AI genutzt werden dürfen. Auf Aufnahme und Ranking in der Google-Suche hat er laut Google keinen Einfluss.
Welche Seite prüft der Check?
Die Adresse, die du eingibst. Ohne Pfad ist das die Startseite, mit Pfad etwa ein Blogartikel oder eine Produktseite. Dazu kommen die Dateien im Hauptverzeichnis, also robots.txt und llms.txt. Sperrt deine robots.txt einzelne Bereiche, zeigen wir sie je Bot unter der Tabelle an.
Speichert ihr meine Daten?
Nein. Wir rufen deine Website ab, werten sie aus und schicken dir das Ergebnis. Gespeichert wird weder die Adresse noch das Ergebnis. Für die Begrenzung der Anfragen zählen wir kurz im Arbeitsspeicher mit, ohne deine IP-Adresse abzulegen.
Quellen
- OpenAI: Overview of OpenAI Crawlers
- Anthropic: Crawler von Anthropic
- Perplexity: Perplexity Crawlers
- Google: Common Crawlers (Google-Extended)
- Google: KI-Funktionen und deine Website
- Common Crawl: CCBot
- Vercel: The rise of the AI crawler
- RFC 9309: Robots Exclusion Protocol
Stand: Oktober 2026
