Kostenloses Tool · ohne E-Mail

KI-Crawler-Check

Prüft in Sekunden, ob ChatGPT, Claude, Perplexity und Gemini deine Website lesen dürfen und können. Zu jedem Punkt bekommst du eine konkrete Lösung für dein System. Gib eine Domain ein oder die Adresse einer einzelnen Seite.

Was der Check prüft

robots.txt je KI-Bot

Wir lesen deine robots.txt so, wie die Bots es tun (RFC 9309): eigene Gruppe vor „*“, längste Regel gewinnt. Für acht Bots siehst du, ob sie die geprüfte Seite lesen dürfen und welche Zeile das entscheidet.

Firewall-Gegenprobe

Wir rufen die Seite einmal als Browser und einmal mit der Kennung von GPTBot, OAI-SearchBot, ClaudeBot und PerplexityBot ab. Weist nur der Bot-Abruf ab, sperrt eine Firewall oder ein CDN, auch wenn die robots.txt alles erlaubt.

Text ohne JavaScript

Wir zählen die Wörter, die direkt im HTML stehen. Ab 150 Wörtern gilt die Seite als lesbar, unter 50 als leer.

Indexierung

Wir suchen noindex und nosnippet im Meta-Tag „robots“ und im HTTP-Header X-Robots-Tag.

llms.txt

Wir prüfen, ob /llms.txt eine Textdatei mit der Überschrift „# Name“ liefert, und zählen ihre Links. Eine HTML-Seite unter dieser Adresse zählt nicht.

Strukturierte Daten

Wir lesen alle JSON-LD-Blöcke der Seite, zeigen ihre Typen (etwa Organization oder LocalBusiness) und melden kaputtes JSON.

Die KI-Crawler im Überblick

Nicht jeder Bot hat dieselbe Aufgabe. Such-Bots bauen den Index, aus dem ChatGPT-Suche, Claude oder Perplexity antworten. Trainings-Crawler sammeln Texte, mit denen künftige Modelle trainiert werden.

BotAnbieterAufgabe laut Anbieter
OAI-SearchBotOpenAISuchindex der ChatGPT-Suche. Wer ihn sperrt, erscheint dort nicht mehr in Antworten.
ChatGPT-UserOpenAIAbruf im Auftrag eines Nutzers. robots.txt-Regeln gelten dafür laut OpenAI nicht unbedingt.
GPTBotOpenAISammelt Inhalte für das Training von OpenAI-Modellen.
Claude-SearchBotAnthropicSuchindex für die Antworten von Claude.
ClaudeBotAnthropicSammelt Inhalte für das Training von Claude.
PerplexityBotPerplexitySuchindex von Perplexity, laut Anbieter nicht für Training.
Google-ExtendedGoogleKein eigener Crawler, nur ein robots.txt-Eintrag: steuert Gemini-Training und Grounding, nicht die Google-Suche.
CCBotCommon CrawlCrawler von Common Crawl. Der offene Datensatz dient vielen Modellen als Trainingsgrundlage.

Training sperren, Suche erlauben?

Viele Unternehmen wollen in KI-Antworten vorkommen, ihre Texte aber nicht fürs Training hergeben. Das lässt sich trennen: Such-Bots freigeben, Trainings-Crawler sperren. Wer GPTBot sperrt, verschwindet laut OpenAI nicht aus der ChatGPT-Suche, dafür ist OAI-SearchBot zuständig. Und Google-Extended hat laut Google keinen Einfluss auf die Google-Suche.

# KI-Suche erlauben
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /

# KI-Training sperren (optional)
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Wer für Trainings-Crawler eine eigene Gruppe anlegt, sperrt nur diese. Alle anderen Bots folgen weiter der Gruppe „User-agent: *“.

Warum JavaScript zum Problem wird

Viele moderne Websites bauen ihren Inhalt erst im Browser per JavaScript auf. Für Menschen sieht das gleich aus, für KI-Crawler nicht: Laut einer Auswertung von Vercel (Dezember 2024) laden die Crawler von OpenAI und Anthropic zwar JavaScript-Dateien, führen sie aber nicht aus. Was erst im Browser entsteht, bleibt für sie unsichtbar.

Häufige Fragen

Sollte ich GPTBot sperren?

Das ist eine Abwägung. GPTBot sammelt Trainingsdaten für OpenAI-Modelle. Wer ihn sperrt, verschwindet laut OpenAI nicht aus der ChatGPT-Suche, dafür ist OAI-SearchBot zuständig. Ohne Training kennt ein künftiges Modell deine Marke aber womöglich schlechter.

Warum meldet der Check eine Firewall-Sperre, obwohl meine robots.txt alles erlaubt?

Die robots.txt ist eine Bitte an die Bots, eine Firewall eine Tür. Viele CDNs und Sicherheits-Plugins blocken KI-Bots anhand ihrer Kennung, unabhängig von der robots.txt. Cloudflare fragt neue Domains seit Juli 2025 bei der Einrichtung, ob KI-Crawler geblockt werden sollen. Unser Abruf kommt nicht von den Adressen der Anbieter, deshalb kann eine Sperre auch Bots gelten, die sich nur als GPTBot ausgeben.

Hält sich jeder Bot an die robots.txt?

Die Crawler in diesem Check halten sich laut ihren Anbietern daran. Ausnahmen nennen die Anbieter selbst: Für ChatGPT-User gelten die Regeln laut OpenAI nicht unbedingt, und Perplexity-User ignoriert die robots.txt laut Perplexity in der Regel. Beide rufen Seiten nur im Auftrag eines Nutzers ab. Wer sie sicher aussperren will, braucht eine Firewall-Regel.

Wie schnell wirkt eine Änderung an der robots.txt?

OpenAI und Perplexity nennen in ihrer Doku etwa 24 Stunden. Den Check kannst du sofort wiederholen: Er liest die robots.txt jedes Mal frisch.

Was ist Google-Extended?

Ein Eintrag für die robots.txt, kein eigener Crawler. Google liest deine Seiten weiter mit dem Googlebot. Google-Extended legt nur fest, ob diese Inhalte für das Training von Gemini und für das Grounding in Gemini-Apps und Vertex AI genutzt werden dürfen. Auf Aufnahme und Ranking in der Google-Suche hat er laut Google keinen Einfluss.

Welche Seite prüft der Check?

Die Adresse, die du eingibst. Ohne Pfad ist das die Startseite, mit Pfad etwa ein Blogartikel oder eine Produktseite. Dazu kommen die Dateien im Hauptverzeichnis, also robots.txt und llms.txt. Sperrt deine robots.txt einzelne Bereiche, zeigen wir sie je Bot unter der Tabelle an.

Speichert ihr meine Daten?

Nein. Wir rufen deine Website ab, werten sie aus und schicken dir das Ergebnis. Gespeichert wird weder die Adresse noch das Ergebnis. Für die Begrenzung der Anfragen zählen wir kurz im Arbeitsspeicher mit, ohne deine IP-Adresse abzulegen.

Quellen

Stand: Oktober 2026

Nächster Schritt

Empfiehlt ChatGPT dich schon?

Lesen dürfen ist die Voraussetzung. Ob KI-Antworten dich auch empfehlen, zeigt der kostenlose KI-Sichtbarkeits-Check: Claire stellt die Kauf-Fragen deiner Zielgruppe live und zeigt, wen die KI stattdessen nennt.

KI-Sichtbarkeit kostenlos prüfen
Dauert meist 1–2 Minuten