KI-Crawler: KI-Assistent, der eine Frage beantwortet und die eigene Website als Quelle nennt

Drei Arten von KI-Crawlern

Art Zweck Beispiel
Training Inhalte sammeln, um Modelle zu trainieren GPTBot, ClaudeBot, CCBot
Suche und Index Inhalte für Suchfunktionen und Antworten in Echtzeit indexieren OAI-SearchBot, PerplexityBot, Claude-SearchBot
Nutzerabruf eine Seite lesen, weil ein Nutzer das System darum bittet ChatGPT-User, Perplexity-User, Claude-User

Diese Unterscheidung ist wichtig: Wer Trainingscrawler sperrt, kann trotzdem in KI-Suchen erscheinen, wenn die Such-Crawler zugelassen sind.

Die wichtigsten Crawler

Anbieter Crawler oder Token Zweck
OpenAI GPTBot Training
OpenAI OAI-SearchBot Suche in ChatGPT
OpenAI ChatGPT-User Abruf auf Nutzerwunsch
Anthropic ClaudeBot Training
Anthropic Claude-SearchBot Suche in Claude
Anthropic Claude-User Abruf auf Nutzerwunsch
Google Google-Extended Token für Training und Gemini-Anwendungen, kein eigener Crawler
Perplexity PerplexityBot Index für Perplexity
Perplexity Perplexity-User Abruf auf Nutzerwunsch
Apple Applebot-Extended Token für die Nutzung für Apple-KI-Modelle
Meta Meta-ExternalAgent Training und KI-Produkte
Common Crawl CCBot offenes Webarchiv, das auch für Training genutzt wird
Microsoft Bingbot Bing-Suche, auch Grundlage für Copilot

Die Liste ist nicht vollständig und ändert sich. Die Anbieter dokumentieren ihre Crawler auf eigenen Seiten, die man vor einer Entscheidung prüfen sollte.

Steuerung per robots.txt

Die Crawler der großen Anbieter beachten nach eigenen Angaben die robots.txt. Ein Beispiel, das Suche erlaubt und Training ausschließt:

# Suche und Antworten erlauben
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Training ausschließen
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

Ob diese Kombination passt, ist eine geschäftliche Entscheidung. Wer möchte, dass Modelle das Unternehmen gut kennen, kann Trainingscrawler auch bewusst zulassen.

Googlebot nicht sperren: Google-Extended steuert nur die Nutzung für Gemini. Wer versehentlich den Googlebot sperrt, verschwindet aus der Google-Suche. Ebenso wichtig: Bingbot nicht sperren, weil Bing die Grundlage für mehrere KI-Dienste ist.

Für und Wider einer Sperre

Gründe für eine Sperre

  • Inhalte sind das Kernprodukt, etwa bei Verlagen, und sollen nicht ohne Gegenleistung genutzt werden
  • rechtliche oder vertragliche Gründe, etwa bei lizenzierten Inhalten
  • Serverlast durch häufige Zugriffe

Gründe gegen eine Sperre

  • Sichtbarkeit in KI-Antworten ist gewünscht
  • das Unternehmen soll in künftigen Modellen bekannt sein
  • Besucher aus KI-Systemen sind ein wachsender Kanal

Für die meisten Unternehmen, Dienstleister und Händler überwiegen nach meiner Einschätzung die Vorteile einer Freigabe, zumindest für Such-Crawler.

Rechtlicher Rahmen

Das deutsche Urheberrecht erlaubt Text- und Data-Mining unter bestimmten Bedingungen, sofern der Rechteinhaber keinen Nutzungsvorbehalt in maschinenlesbarer Form erklärt hat. Die robots.txt wird in diesem Zusammenhang häufig als ein Weg genannt, einen solchen Vorbehalt zu erklären. Die rechtliche Bewertung ist aber noch in Bewegung. Wer seine Inhalte rechtssicher schützen will, sollte sich beraten lassen.

Zugriffe beobachten

  • Serverlogfiles zeigen, welche Crawler wie oft welche Seiten abrufen. Mehr im Beitrag zur Logfile-Analyse.
  • Bot-Schutz und CDN-Dienste bieten oft eigene Berichte und Einstellungen für KI-Crawler. Manche blockieren KI-Crawler standardmäßig, was ungewollt die Sichtbarkeit in KI-Suchen verhindern kann.
  • Echtheit prüfen: Manche Bots geben sich als bekannte Crawler aus. Die großen Anbieter veröffentlichen IP-Bereiche, mit denen sich echte Zugriffe erkennen lassen.

Einstellungen des CDN prüfen: Wenn Ihre Website über einen Dienst mit Bot-Schutz läuft, prüfen Sie, ob dort KI-Crawler blockiert werden. Eine Sperre im CDN wirkt unabhängig von der robots.txt.

JavaScript und KI-Crawler

Viele KI-Crawler führen kein JavaScript aus oder nur eingeschränkt. Inhalte, die erst im Browser erzeugt werden, sehen sie nicht. Wer in KI-Antworten erscheinen möchte, sollte die wichtigsten Inhalte im ersten HTML ausliefern. Siehe JavaScript-SEO.

Eine Entscheidungshilfe

Ziel Empfehlung
Maximale Sichtbarkeit in KI-Antworten Such- und Nutzer-Crawler zulassen, Trainingscrawler nach eigener Abwägung
Inhalte schützen, aber in KI-Suchen erscheinen Trainingscrawler sperren, Such-Crawler zulassen
Inhalte vollständig schützen alle KI-Crawler sperren, mit dem Wissen, dass die Sichtbarkeit in KI-Antworten sinkt
Serverlast begrenzen Crawl-Frequenz über Serverregeln steuern, einzelne aggressive Bots sperren

Für die meisten Unternehmen, die Kunden gewinnen wollen, ist die erste oder zweite Variante sinnvoll.

Crawler-Zugriffe richtig interpretieren

In Logfiles tauchen oft Zugriffe auf, die sich als bekannte KI-Crawler ausgeben, aber nicht von deren Anbietern stammen. Manche Bots nutzen falsche Kennungen, um Sperren zu umgehen. Die großen Anbieter veröffentlichen Listen ihrer IP-Bereiche. Ein Abgleich zeigt, welche Zugriffe echt sind. Bei auffällig vielen unechten Zugriffen hilft eine Sperre auf Serverebene oder über das CDN.

Regelmäßige Überprüfung

Neue Crawler kommen hinzu, bestehende ändern ihren Namen oder Zweck. Die robots.txt und die Einstellungen im CDN sollten deshalb mindestens einmal im Jahr überprüft werden. Dabei lohnt ein Blick in die Dokumentation der großen Anbieter, ob sich an ihren Crawlern etwas geändert hat.

Oft gefragt

Beachten alle KI-Crawler die robots.txt?

Die großen Anbieter erklären, dass ihre Crawler die robots.txt beachten. Kleinere oder unbekannte Crawler tun das nicht immer. Gegen sie helfen nur technische Maßnahmen auf dem Server oder im CDN.

Schadet eine Sperre meinen Google-Rankings?

Eine Sperre von GPTBot, ClaudeBot oder Google-Extended hat nach allem, was bekannt ist, keinen Einfluss auf die Google-Rankings. Eine Sperre von Googlebot schon.

Kann ich bereits gesammelte Inhalte zurückholen?

Nein. Eine Sperre wirkt nur für künftige Zugriffe. Inhalte, die bereits in Trainingsdaten eingeflossen sind, bleiben dort.

Mehmet Oruc

Inhaber von SEOKönig · Ihr Personal SEO · Suchmaschinenoptimierung seit 30 Jahren

Informatikstudium, eigene Webkataloge und Suchmaschinen programmiert und verkauft, später Branchenportale, Onlineshops und rund 1.000 Webinstallationen für Kunden umgesetzt. Seit zwei Jahren arbeitet er intensiv mit KI-Systemen. Sein Schwerpunkt: komplexe Websites, die in vielen Städten und Themenfeldern gleichzeitig ranken müssen. Jeder Ratgeber entsteht aus dieser Projektpraxis und wird überarbeitet, sobald sich die Suchsysteme ändern.

Mehr über SEOKönig