robots.txt: Quelltext mit den technischen Angaben, die Suchmaschinen auswerten

Was die robots.txt ist

Die robots.txt ist eine Textdatei, die im Hauptverzeichnis einer Domain liegt, also unter https://www.beispiel.de/robots.txt. Sie folgt dem Robots Exclusion Protocol, einer Konvention, die 1994 entstand und 2022 als Internetstandard RFC 9309 formell festgeschrieben wurde. Seriöse Crawler lesen die Datei, bevor sie eine Website durchsuchen, und halten sich an ihre Anweisungen.

Wichtig ist, was die Datei nicht ist: Sie ist kein Zugriffsschutz. Jeder kann sie lesen, und Crawler, die sich nicht an Regeln halten, ignorieren sie. Vertrauliche Inhalte gehören hinter ein Passwort, nicht in eine robots.txt.

Der Grundaufbau

Eine robots.txt besteht aus Gruppen. Jede Gruppe beginnt mit einer oder mehreren User-agent-Zeilen, gefolgt von Regeln:

User-agent: *
Disallow: /intern/
Allow: /intern/presse/

User-agent: Googlebot-Image
Disallow: /entwuerfe/

Sitemap: https://www.beispiel.de/sitemap.xml
Anweisung Bedeutung
User-agent für welchen Crawler die folgenden Regeln gelten; * für alle
Disallow Pfad, der nicht gecrawlt werden darf
Allow Ausnahme innerhalb eines gesperrten Bereichs
Sitemap Adresse einer XML-Sitemap, unabhängig von Gruppen

Google unterstützt außerdem zwei Platzhalter:

Zeichen Bedeutung Beispiel
* beliebige Zeichenfolge Disallow: /*?sort= sperrt alle URLs mit dem Parameter sort
$ Ende der URL Disallow: /*.pdf$ sperrt alle URLs, die auf .pdf enden

Wie Google Regeln auswertet

  1. Die spezifischste User-agent-Gruppe gilt. Gibt es eine Gruppe für Googlebot und eine für *, folgt der Googlebot ausschließlich seiner eigenen Gruppe. Regeln aus der allgemeinen Gruppe werden dann nicht zusätzlich angewendet – ein häufiger Irrtum.
  2. Die längste passende Regel gewinnt. Passen Disallow: /shop/ und Allow: /shop/angebote/ auf eine URL, gilt die längere, also Allow.
  3. Bei gleich langen Regeln gewinnt Allow.
  4. Groß- und Kleinschreibung zählt bei Pfaden, nicht bei den Anweisungen selbst.
  5. Die Datei darf höchstens 500 Kibibyte groß sein. Alles darüber ignoriert Google.

Beispiele aus der Praxis

Alles erlauben

User-agent: *
Disallow:

Sitemap: https://www.beispiel.de/sitemap.xml

Ein leeres Disallow bedeutet: nichts gesperrt. Für viele kleine Websites ist das die beste robots.txt.

Typische Unternehmenswebsite mit WordPress

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=
Disallow: /suche/

Sitemap: https://www.beispiel.de/sitemap_index.xml

Der Admin-Bereich wird gesperrt, die für manche Funktionen nötige AJAX-Datei bleibt erlaubt, interne Suchergebnisse werden ausgeschlossen.

Onlineshop mit Filtern

User-agent: *
Disallow: /warenkorb
Disallow: /kasse
Disallow: /mein-konto
Disallow: /*?*sort=
Disallow: /*?*view=
Disallow: /*?*preis=
Disallow: /suche

Sitemap: https://www.beispiel.de/sitemap.xml

Warenkorb, Kasse und Kundenkonto werden gesperrt, ebenso Parameter für Sortierung, Ansicht und Preisfilter. Filter, die eigene Rankings verdienen – etwa Marke oder Material –, sollten nicht pauschal gesperrt werden.

KI-Crawler ausschließen

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: *
Disallow:

Damit werden die Crawler von OpenAI und Anthropic sowie die Nutzung für Googles Gemini-Modelle ausgeschlossen, während die normale Suche weiter crawlen darf. Ob das sinnvoll ist, hängt von Ihren Zielen ab – der Beitrag KI-Crawler wägt die Optionen ab.

Was Sie nicht sperren sollten

  • CSS- und JavaScript-Dateien: Google braucht sie, um Seiten korrekt zu rendern. Gesperrte Ressourcen führen dazu, dass Seiten unvollständig oder als nicht mobilfreundlich bewertet werden.
  • Bilder, die in der Bildersuche erscheinen sollen.
  • Seiten, die Sie aus dem Index entfernen wollen: Wenn Google eine Seite nicht crawlen darf, kann es auch ein noindex nicht lesen. Die Seite kann dann weiterhin im Index stehen, oft mit dem Hinweis „Für diese Seite sind keine Informationen verfügbar“.
  • Seiten mit Canonical-Tag auf andere Seiten, wenn die Signale gebündelt werden sollen – auch hier muss Google die Seite lesen können.

robots.txt oder noindex?

Ziel Richtiges Werkzeug
Seite soll nicht gecrawlt werden, um Crawl-Budget zu sparen robots.txt
Seite soll nicht im Index erscheinen noindex (und Crawling erlauben)
Seite soll weder gecrawlt noch indexiert werden erst noindex, nach Entfernung aus dem Index optional robots.txt
Inhalte sollen geschützt sein Passwortschutz

Mehr zum Zusammenspiel im Beitrag Meta Robots.

Die häufigsten Fehler

Diese Fehler begegnen mir immer wieder
  • Disallow: / aus der Entwicklungsphase bleibt nach dem Livegang bestehen – die gesamte Website ist gesperrt
  • Die robots.txt der Testumgebung wird beim Relaunch mit übertragen
  • Die Datei fehlt nicht, sondern liefert einen Serverfehler (5xx): Google stellt das Crawling dann vorübergehend ein, weil es nicht weiß, was erlaubt ist
  • Zu breite Muster: Disallow: /shop sperrt auch /shop-angebote/ und /shopping-ratgeber/
  • Getrennte Gruppen falsch verstanden: Regeln für * gelten nicht für einen Crawler mit eigener Gruppe
  • Ressourcen gesperrt: /wp-content/ oder /assets/ blockiert, sodass Google Seiten ohne Design und Skripte sieht
  • Groß- und Kleinschreibung übersehen: Disallow: /Intern/ sperrt nicht /intern/

Statuscodes der robots.txt

Wie Google reagiert, hängt davon ab, was der Server beim Abruf der Datei zurückgibt:

Antwort Verhalten von Google
200 mit Inhalt Regeln werden befolgt
404 oder 410 Google geht davon aus, dass alles erlaubt ist
5xx oder Zeitüberschreitung Google crawlt vorübergehend nicht; bleibt der Fehler lange bestehen, wird irgendwann eine zwischengespeicherte Version oder volle Erlaubnis angenommen
Weiterleitung wird bis zu einer begrenzten Zahl von Stationen verfolgt

Google speichert die robots.txt in der Regel bis zu 24 Stunden zwischen. Änderungen wirken deshalb nicht sofort.

Die robots.txt testen

  • Bericht zur robots.txt in der Search Console: Unter „Einstellungen“ zeigt Google, welche robots.txt-Dateien für Ihre Domain gefunden wurden, wann sie zuletzt abgerufen wurden und ob es Fehler gab. Dort lässt sich auch ein erneutes Abrufen anstoßen.
  • URL-Prüfung: zeigt für einzelne URLs, ob sie durch die robots.txt blockiert sind.
  • Crawler wie Screaming Frog: können eine robots.txt simulieren und zeigen, welche URLs gesperrt wären – nützlich vor dem Veröffentlichen einer neuen Version.
  • Open-Source-Parser: Google hat seinen robots.txt-Parser als Open Source veröffentlicht; Entwickler können damit Regeln exakt so prüfen, wie Google sie auswertet.

Praxis-Tipp: Nehmen Sie die robots.txt in jede Checkliste für Relaunches und Serverumzüge auf. Rufen Sie die Datei am Tag des Livegangs selbst im Browser auf. Diese zehn Sekunden haben schon vielen Unternehmen wochenlange Rankingverluste erspart.

robots.txt für Subdomains und Protokolle

Jede Subdomain und jedes Protokoll braucht eine eigene robots.txt. Die Datei unter www.beispiel.de gilt nicht für shop.beispiel.de und nicht für http:// statt https://. Wer mehrere Subdomains betreibt, muss jede separat pflegen.

Gut zu wissen

Braucht jede Website eine robots.txt?

Nein. Fehlt sie und liefert der Server einen 404, geht Google davon aus, dass alles erlaubt ist. Eine einfache Datei mit Verweis auf die Sitemap ist trotzdem empfehlenswert.

Kann ich mit der robots.txt verhindern, dass eine Seite bei Google erscheint?

Nicht zuverlässig. Gesperrte Seiten können im Index erscheinen, wenn andere Seiten auf sie verlinken. Für den Ausschluss aus dem Index ist noindex das richtige Mittel.

Unterstützt Google die Anweisung Crawl-delay?

Nein. Google ignoriert Crawl-delay. Bing und einige andere Crawler berücksichtigen sie. Google passt die Crawling-Geschwindigkeit automatisch an die Serverleistung an.

Mehmet Oruc

Inhaber von SEOKönig · Ihr Personal SEO · Suchmaschinenoptimierung seit 30 Jahren

Informatikstudium, eigene Webkataloge und Suchmaschinen programmiert und verkauft, später Branchenportale, Onlineshops und rund 1.000 Webinstallationen für Kunden umgesetzt. Seit zwei Jahren arbeitet er intensiv mit KI-Systemen. Sein Schwerpunkt: komplexe Websites, die in vielen Städten und Themenfeldern gleichzeitig ranken müssen. Jeder Ratgeber entsteht aus dieser Projektpraxis und wird überarbeitet, sobald sich die Suchsysteme ändern.

Mehr über SEOKönig