
Drei Arten von KI-Crawlern
| Art | Zweck | Beispiel |
|---|---|---|
| Training | Inhalte sammeln, um Modelle zu trainieren | GPTBot, ClaudeBot, CCBot |
| Suche und Index | Inhalte für Suchfunktionen und Antworten in Echtzeit indexieren | OAI-SearchBot, PerplexityBot, Claude-SearchBot |
| Nutzerabruf | eine Seite lesen, weil ein Nutzer das System darum bittet | ChatGPT-User, Perplexity-User, Claude-User |
Diese Unterscheidung ist wichtig: Wer Trainingscrawler sperrt, kann trotzdem in KI-Suchen erscheinen, wenn die Such-Crawler zugelassen sind.
Die wichtigsten Crawler
| Anbieter | Crawler oder Token | Zweck |
|---|---|---|
| OpenAI | GPTBot | Training |
| OpenAI | OAI-SearchBot | Suche in ChatGPT |
| OpenAI | ChatGPT-User | Abruf auf Nutzerwunsch |
| Anthropic | ClaudeBot | Training |
| Anthropic | Claude-SearchBot | Suche in Claude |
| Anthropic | Claude-User | Abruf auf Nutzerwunsch |
| Google-Extended | Token für Training und Gemini-Anwendungen, kein eigener Crawler | |
| Perplexity | PerplexityBot | Index für Perplexity |
| Perplexity | Perplexity-User | Abruf auf Nutzerwunsch |
| Apple | Applebot-Extended | Token für die Nutzung für Apple-KI-Modelle |
| Meta | Meta-ExternalAgent | Training und KI-Produkte |
| Common Crawl | CCBot | offenes Webarchiv, das auch für Training genutzt wird |
| Microsoft | Bingbot | Bing-Suche, auch Grundlage für Copilot |
Die Liste ist nicht vollständig und ändert sich. Die Anbieter dokumentieren ihre Crawler auf eigenen Seiten, die man vor einer Entscheidung prüfen sollte.
Steuerung per robots.txt
Die Crawler der großen Anbieter beachten nach eigenen Angaben die robots.txt. Ein Beispiel, das Suche erlaubt und Training ausschließt:
# Suche und Antworten erlauben
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Training ausschließen
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
Ob diese Kombination passt, ist eine geschäftliche Entscheidung. Wer möchte, dass Modelle das Unternehmen gut kennen, kann Trainingscrawler auch bewusst zulassen.
Googlebot nicht sperren: Google-Extended steuert nur die Nutzung für Gemini. Wer versehentlich den Googlebot sperrt, verschwindet aus der Google-Suche. Ebenso wichtig: Bingbot nicht sperren, weil Bing die Grundlage für mehrere KI-Dienste ist.
Für und Wider einer Sperre
Gründe für eine Sperre
- Inhalte sind das Kernprodukt, etwa bei Verlagen, und sollen nicht ohne Gegenleistung genutzt werden
- rechtliche oder vertragliche Gründe, etwa bei lizenzierten Inhalten
- Serverlast durch häufige Zugriffe
Gründe gegen eine Sperre
- Sichtbarkeit in KI-Antworten ist gewünscht
- das Unternehmen soll in künftigen Modellen bekannt sein
- Besucher aus KI-Systemen sind ein wachsender Kanal
Für die meisten Unternehmen, Dienstleister und Händler überwiegen nach meiner Einschätzung die Vorteile einer Freigabe, zumindest für Such-Crawler.
Rechtlicher Rahmen
Das deutsche Urheberrecht erlaubt Text- und Data-Mining unter bestimmten Bedingungen, sofern der Rechteinhaber keinen Nutzungsvorbehalt in maschinenlesbarer Form erklärt hat. Die robots.txt wird in diesem Zusammenhang häufig als ein Weg genannt, einen solchen Vorbehalt zu erklären. Die rechtliche Bewertung ist aber noch in Bewegung. Wer seine Inhalte rechtssicher schützen will, sollte sich beraten lassen.
Zugriffe beobachten
- Serverlogfiles zeigen, welche Crawler wie oft welche Seiten abrufen. Mehr im Beitrag zur Logfile-Analyse.
- Bot-Schutz und CDN-Dienste bieten oft eigene Berichte und Einstellungen für KI-Crawler. Manche blockieren KI-Crawler standardmäßig, was ungewollt die Sichtbarkeit in KI-Suchen verhindern kann.
- Echtheit prüfen: Manche Bots geben sich als bekannte Crawler aus. Die großen Anbieter veröffentlichen IP-Bereiche, mit denen sich echte Zugriffe erkennen lassen.
Einstellungen des CDN prüfen: Wenn Ihre Website über einen Dienst mit Bot-Schutz läuft, prüfen Sie, ob dort KI-Crawler blockiert werden. Eine Sperre im CDN wirkt unabhängig von der robots.txt.
JavaScript und KI-Crawler
Viele KI-Crawler führen kein JavaScript aus oder nur eingeschränkt. Inhalte, die erst im Browser erzeugt werden, sehen sie nicht. Wer in KI-Antworten erscheinen möchte, sollte die wichtigsten Inhalte im ersten HTML ausliefern. Siehe JavaScript-SEO.
Eine Entscheidungshilfe
| Ziel | Empfehlung |
|---|---|
| Maximale Sichtbarkeit in KI-Antworten | Such- und Nutzer-Crawler zulassen, Trainingscrawler nach eigener Abwägung |
| Inhalte schützen, aber in KI-Suchen erscheinen | Trainingscrawler sperren, Such-Crawler zulassen |
| Inhalte vollständig schützen | alle KI-Crawler sperren, mit dem Wissen, dass die Sichtbarkeit in KI-Antworten sinkt |
| Serverlast begrenzen | Crawl-Frequenz über Serverregeln steuern, einzelne aggressive Bots sperren |
Für die meisten Unternehmen, die Kunden gewinnen wollen, ist die erste oder zweite Variante sinnvoll.
Crawler-Zugriffe richtig interpretieren
In Logfiles tauchen oft Zugriffe auf, die sich als bekannte KI-Crawler ausgeben, aber nicht von deren Anbietern stammen. Manche Bots nutzen falsche Kennungen, um Sperren zu umgehen. Die großen Anbieter veröffentlichen Listen ihrer IP-Bereiche. Ein Abgleich zeigt, welche Zugriffe echt sind. Bei auffällig vielen unechten Zugriffen hilft eine Sperre auf Serverebene oder über das CDN.
Regelmäßige Überprüfung
Neue Crawler kommen hinzu, bestehende ändern ihren Namen oder Zweck. Die robots.txt und die Einstellungen im CDN sollten deshalb mindestens einmal im Jahr überprüft werden. Dabei lohnt ein Blick in die Dokumentation der großen Anbieter, ob sich an ihren Crawlern etwas geändert hat.
Oft gefragt
Beachten alle KI-Crawler die robots.txt?
Die großen Anbieter erklären, dass ihre Crawler die robots.txt beachten. Kleinere oder unbekannte Crawler tun das nicht immer. Gegen sie helfen nur technische Maßnahmen auf dem Server oder im CDN.
Schadet eine Sperre meinen Google-Rankings?
Eine Sperre von GPTBot, ClaudeBot oder Google-Extended hat nach allem, was bekannt ist, keinen Einfluss auf die Google-Rankings. Eine Sperre von Googlebot schon.
Kann ich bereits gesammelte Inhalte zurückholen?
Nein. Eine Sperre wirkt nur für künftige Zugriffe. Inhalte, die bereits in Trainingsdaten eingeflossen sind, bleiben dort.