
Was die robots.txt ist
Die robots.txt ist eine Textdatei, die im Hauptverzeichnis einer Domain liegt, also unter https://www.beispiel.de/robots.txt. Sie folgt dem Robots Exclusion Protocol, einer Konvention, die 1994 entstand und 2022 als Internetstandard RFC 9309 formell festgeschrieben wurde. Seriöse Crawler lesen die Datei, bevor sie eine Website durchsuchen, und halten sich an ihre Anweisungen.
Wichtig ist, was die Datei nicht ist: Sie ist kein Zugriffsschutz. Jeder kann sie lesen, und Crawler, die sich nicht an Regeln halten, ignorieren sie. Vertrauliche Inhalte gehören hinter ein Passwort, nicht in eine robots.txt.
Der Grundaufbau
Eine robots.txt besteht aus Gruppen. Jede Gruppe beginnt mit einer oder mehreren User-agent-Zeilen, gefolgt von Regeln:
User-agent: *
Disallow: /intern/
Allow: /intern/presse/
User-agent: Googlebot-Image
Disallow: /entwuerfe/
Sitemap: https://www.beispiel.de/sitemap.xml
| Anweisung | Bedeutung |
|---|---|
User-agent |
für welchen Crawler die folgenden Regeln gelten; * für alle |
Disallow |
Pfad, der nicht gecrawlt werden darf |
Allow |
Ausnahme innerhalb eines gesperrten Bereichs |
Sitemap |
Adresse einer XML-Sitemap, unabhängig von Gruppen |
Google unterstützt außerdem zwei Platzhalter:
| Zeichen | Bedeutung | Beispiel |
|---|---|---|
* |
beliebige Zeichenfolge | Disallow: /*?sort= sperrt alle URLs mit dem Parameter sort |
$ |
Ende der URL | Disallow: /*.pdf$ sperrt alle URLs, die auf .pdf enden |
Wie Google Regeln auswertet
- Die spezifischste User-agent-Gruppe gilt. Gibt es eine Gruppe für
Googlebotund eine für*, folgt der Googlebot ausschließlich seiner eigenen Gruppe. Regeln aus der allgemeinen Gruppe werden dann nicht zusätzlich angewendet – ein häufiger Irrtum. - Die längste passende Regel gewinnt. Passen
Disallow: /shop/undAllow: /shop/angebote/auf eine URL, gilt die längere, alsoAllow. - Bei gleich langen Regeln gewinnt
Allow. - Groß- und Kleinschreibung zählt bei Pfaden, nicht bei den Anweisungen selbst.
- Die Datei darf höchstens 500 Kibibyte groß sein. Alles darüber ignoriert Google.
Beispiele aus der Praxis
Alles erlauben
User-agent: *
Disallow:
Sitemap: https://www.beispiel.de/sitemap.xml
Ein leeres Disallow bedeutet: nichts gesperrt. Für viele kleine Websites ist das die beste robots.txt.
Typische Unternehmenswebsite mit WordPress
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=
Disallow: /suche/
Sitemap: https://www.beispiel.de/sitemap_index.xml
Der Admin-Bereich wird gesperrt, die für manche Funktionen nötige AJAX-Datei bleibt erlaubt, interne Suchergebnisse werden ausgeschlossen.
Onlineshop mit Filtern
User-agent: *
Disallow: /warenkorb
Disallow: /kasse
Disallow: /mein-konto
Disallow: /*?*sort=
Disallow: /*?*view=
Disallow: /*?*preis=
Disallow: /suche
Sitemap: https://www.beispiel.de/sitemap.xml
Warenkorb, Kasse und Kundenkonto werden gesperrt, ebenso Parameter für Sortierung, Ansicht und Preisfilter. Filter, die eigene Rankings verdienen – etwa Marke oder Material –, sollten nicht pauschal gesperrt werden.
KI-Crawler ausschließen
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: *
Disallow:
Damit werden die Crawler von OpenAI und Anthropic sowie die Nutzung für Googles Gemini-Modelle ausgeschlossen, während die normale Suche weiter crawlen darf. Ob das sinnvoll ist, hängt von Ihren Zielen ab – der Beitrag KI-Crawler wägt die Optionen ab.
Was Sie nicht sperren sollten
- CSS- und JavaScript-Dateien: Google braucht sie, um Seiten korrekt zu rendern. Gesperrte Ressourcen führen dazu, dass Seiten unvollständig oder als nicht mobilfreundlich bewertet werden.
- Bilder, die in der Bildersuche erscheinen sollen.
- Seiten, die Sie aus dem Index entfernen wollen: Wenn Google eine Seite nicht crawlen darf, kann es auch ein
noindexnicht lesen. Die Seite kann dann weiterhin im Index stehen, oft mit dem Hinweis „Für diese Seite sind keine Informationen verfügbar“. - Seiten mit Canonical-Tag auf andere Seiten, wenn die Signale gebündelt werden sollen – auch hier muss Google die Seite lesen können.
robots.txt oder noindex?
| Ziel | Richtiges Werkzeug |
|---|---|
| Seite soll nicht gecrawlt werden, um Crawl-Budget zu sparen | robots.txt |
| Seite soll nicht im Index erscheinen | noindex (und Crawling erlauben) |
| Seite soll weder gecrawlt noch indexiert werden | erst noindex, nach Entfernung aus dem Index optional robots.txt |
| Inhalte sollen geschützt sein | Passwortschutz |
Mehr zum Zusammenspiel im Beitrag Meta Robots.
Die häufigsten Fehler
Disallow: /aus der Entwicklungsphase bleibt nach dem Livegang bestehen – die gesamte Website ist gesperrt- Die robots.txt der Testumgebung wird beim Relaunch mit übertragen
- Die Datei fehlt nicht, sondern liefert einen Serverfehler (5xx): Google stellt das Crawling dann vorübergehend ein, weil es nicht weiß, was erlaubt ist
- Zu breite Muster:
Disallow: /shopsperrt auch/shop-angebote/und/shopping-ratgeber/ - Getrennte Gruppen falsch verstanden: Regeln für
*gelten nicht für einen Crawler mit eigener Gruppe - Ressourcen gesperrt:
/wp-content/oder/assets/blockiert, sodass Google Seiten ohne Design und Skripte sieht - Groß- und Kleinschreibung übersehen:
Disallow: /Intern/sperrt nicht/intern/
Statuscodes der robots.txt
Wie Google reagiert, hängt davon ab, was der Server beim Abruf der Datei zurückgibt:
| Antwort | Verhalten von Google |
|---|---|
| 200 mit Inhalt | Regeln werden befolgt |
| 404 oder 410 | Google geht davon aus, dass alles erlaubt ist |
| 5xx oder Zeitüberschreitung | Google crawlt vorübergehend nicht; bleibt der Fehler lange bestehen, wird irgendwann eine zwischengespeicherte Version oder volle Erlaubnis angenommen |
| Weiterleitung | wird bis zu einer begrenzten Zahl von Stationen verfolgt |
Google speichert die robots.txt in der Regel bis zu 24 Stunden zwischen. Änderungen wirken deshalb nicht sofort.
Die robots.txt testen
- Bericht zur robots.txt in der Search Console: Unter „Einstellungen“ zeigt Google, welche robots.txt-Dateien für Ihre Domain gefunden wurden, wann sie zuletzt abgerufen wurden und ob es Fehler gab. Dort lässt sich auch ein erneutes Abrufen anstoßen.
- URL-Prüfung: zeigt für einzelne URLs, ob sie durch die robots.txt blockiert sind.
- Crawler wie Screaming Frog: können eine robots.txt simulieren und zeigen, welche URLs gesperrt wären – nützlich vor dem Veröffentlichen einer neuen Version.
- Open-Source-Parser: Google hat seinen robots.txt-Parser als Open Source veröffentlicht; Entwickler können damit Regeln exakt so prüfen, wie Google sie auswertet.
Praxis-Tipp: Nehmen Sie die robots.txt in jede Checkliste für Relaunches und Serverumzüge auf. Rufen Sie die Datei am Tag des Livegangs selbst im Browser auf. Diese zehn Sekunden haben schon vielen Unternehmen wochenlange Rankingverluste erspart.
robots.txt für Subdomains und Protokolle
Jede Subdomain und jedes Protokoll braucht eine eigene robots.txt. Die Datei unter www.beispiel.de gilt nicht für shop.beispiel.de und nicht für http:// statt https://. Wer mehrere Subdomains betreibt, muss jede separat pflegen.
Gut zu wissen
Braucht jede Website eine robots.txt?
Nein. Fehlt sie und liefert der Server einen 404, geht Google davon aus, dass alles erlaubt ist. Eine einfache Datei mit Verweis auf die Sitemap ist trotzdem empfehlenswert.
Kann ich mit der robots.txt verhindern, dass eine Seite bei Google erscheint?
Nicht zuverlässig. Gesperrte Seiten können im Index erscheinen, wenn andere Seiten auf sie verlinken. Für den Ausschluss aus dem Index ist noindex das richtige Mittel.
Unterstützt Google die Anweisung Crawl-delay?
Nein. Google ignoriert Crawl-delay. Bing und einige andere Crawler berücksichtigen sie. Google passt die Crawling-Geschwindigkeit automatisch an die Serverleistung an.