
Was der Index ist
Der Google-Index ist eine riesige Datenbank, in der Google Informationen über Hunderte Milliarden Webseiten speichert. Für jede Seite enthält er den Inhalt, erkannte Entitäten, Links, die Sprache, die Aktualität und viele weitere Merkmale. Wenn jemand sucht, durchsucht Google nicht das Internet, sondern diesen Index.
Eine Seite, die nicht im Index ist, kann in den Suchergebnissen nicht erscheinen. Deshalb ist die Indexierung der entscheidende Schritt zwischen dem Crawling und dem Ranking.
Der Weg in den Index
- Crawling: Der Googlebot ruft die Seite ab.
- Rendering: Die Seite wird wie in einem Browser aufgebaut, JavaScript wird ausgeführt.
- Analyse: Google erkennt Inhalte, Struktur, Sprache, Entitäten, strukturierte Daten und Links.
- Kanonisierung: Google prüft, ob es sich um ein Duplikat handelt, und wählt gegebenenfalls eine kanonische Version.
- Qualitätsbewertung: Google entscheidet, ob die Seite wertvoll genug für den Index ist.
- Speicherung: Die Seite wird in den Index aufgenommen und kann ranken.
Nicht jede gecrawlte Seite schafft es bis zum letzten Schritt. Google hat wiederholt erklärt, dass es nicht jede Seite indexiert, die es findet – schlicht, weil nicht jede Seite einen Mehrwert bietet.
Den Indexierungsstatus prüfen
Der Seitenindexierungsbericht
In der Google Search Console zeigt der Bericht „Seiten“ unter „Indexierung“, wie viele Seiten indexiert sind und warum andere es nicht sind. Die Gründe sind in Kategorien aufgeteilt.
Die URL-Prüfung
Für einzelne Seiten zeigt die URL-Prüfung, ob sie im Index ist, wann sie zuletzt gecrawlt wurde, welche kanonische URL Google gewählt hat und wie das gerenderte HTML aussieht.
Die site:-Abfrage
Eine Suche nach site:ihre-domain.de zeigt eine grobe Schätzung der indexierten Seiten. Die Zahl ist ungenau, taugt aber für eine schnelle Einschätzung. Für einzelne URLs ist die URL-Prüfung zuverlässiger.
Die wichtigsten Statusmeldungen und was sie bedeuten
| Status | Bedeutung | Typische Ursache | Handlungsbedarf |
|---|---|---|---|
| Durch noindex-Tag ausgeschlossen | Seite trägt noindex | beabsichtigt oder Fehler | prüfen, ob gewollt |
| Durch robots.txt blockiert | Crawling verboten | beabsichtigt oder Fehler | prüfen, ob gewollt |
| Seite mit Weiterleitung | URL leitet weiter | normal nach Umzügen | meist keiner, interne Links anpassen |
| Nicht gefunden (404) | Seite existiert nicht | gelöschte Seiten | bei Links oder Traffic weiterleiten |
| Soft 404 | Seite liefert 200, wirkt aber leer oder fehlerhaft | leere Kategorien, fehlerhafte Vorlagen | Inhalt ergänzen oder echten 404 liefern |
| Duplikat – vom Nutzer nicht als kanonisch festgelegt | Google hält die Seite für ein Duplikat ohne Canonical | Parameter, Varianten | Canonical setzen |
| Duplikat, Google hat eine andere Seite als der Nutzer als kanonisch bestimmt | Google ignoriert Ihren Canonical | widersprüchliche Signale | Signale vereinheitlichen |
| Alternative Seite mit richtigem kanonischen Tag | Seite verweist korrekt per Canonical auf eine andere | beabsichtigt | keiner |
| Gecrawlt – zurzeit nicht indexiert | Google kennt die Seite, nimmt sie aber nicht auf | Qualität, Duplikate, geringe Bedeutung | Inhalt und Verlinkung verbessern |
| Gefunden – zurzeit nicht indexiert | Google kennt die URL, hat sie aber noch nicht gecrawlt | Crawl-Budget, geringe Priorität, Serverlast | Verlinkung stärken, unwichtige URLs reduzieren |
| Serverfehler (5xx) | Server antwortete mit Fehler | Überlastung, Konfiguration | Server prüfen |
| Blockiert wegen Zugriffsverbot (403) oder Autorisierung (401) | Zugriff verweigert | Sicherheitsregeln, Login | Zugriff für Googlebot erlauben, wenn gewünscht |
Die zwei schwierigsten Fälle
„Gecrawlt – zurzeit nicht indexiert“
Diese Meldung ist die häufigste Quelle für Frustration. Google hat die Seite abgerufen und bewertet, sich aber gegen die Aufnahme entschieden. Die Gründe nennt Google nicht, in der Praxis sind es meist:
- Geringer Mehrwert: Die Seite bietet kaum etwas, was nicht auf anderen, bereits indexierten Seiten steht.
- Hohe Ähnlichkeit zu anderen Seiten der Website, etwa bei Stadtseiten nach Vorlage.
- Wenig interne Links: Die Seite wirkt unwichtig, weil kaum etwas auf sie verweist.
- Allgemein schwache Bewertung der Website: Bei Websites mit vielen schwachen Inhalten indexiert Google neue Seiten zurückhaltender.
Die Lösung ist fast nie, die Indexierung immer wieder zu beantragen. Stattdessen hilft es, die Seite inhaltlich zu verbessern, sie stärker intern zu verlinken oder – wenn sie keinen eigenen Wert hat – mit einer anderen Seite zusammenzuführen.
„Gefunden – zurzeit nicht indexiert“
Hier hat Google die URL entdeckt, aber noch nicht gecrawlt. Bei kleinen Websites erledigt sich das oft von selbst. Bei großen Websites ist es ein Hinweis darauf, dass Google die Seiten nicht für wichtig genug hält oder dass das Crawl-Budget durch andere URLs verbraucht wird. Hilfreich sind eine bessere Verlinkung, weniger wertlose URLs und ein schnellerer Server.
Indexierungsprobleme systematisch lösen
- Überblick verschaffen: Seitenindexierungsbericht exportieren und nach Status gruppieren.
- Gewolltes von Ungewolltem trennen: Viele ausgeschlossene Seiten sind beabsichtigt, etwa weitergeleitete URLs oder Seiten mit noindex. Wichtig sind die Seiten, die indexiert sein sollten, es aber nicht sind.
- Nach Seitentyp auswerten: Betreffen die Probleme bestimmte Verzeichnisse oder Vorlagen? Das deutet auf systematische Ursachen hin.
- Stichproben prüfen: Mit der URL-Prüfung einzelne Seiten ansehen, besonders gerendertes HTML und gewählte kanonische URL.
- Ursache beheben: technisch (noindex, Canonical, robots.txt, Server) oder inhaltlich (Qualität, Duplikate, Verlinkung).
- Validierung starten: In der Search Console die Behebung bestätigen, damit Google die Seiten erneut prüft.
- Beobachten: Die Validierung kann Wochen dauern.
Schneller indexieren
Für neue oder aktualisierte Seiten gibt es mehrere Wege, die Indexierung zu beschleunigen:
- Interne Links von starken, häufig gecrawlten Seiten wie der Startseite oder aktuellen Übersichtsseiten
- Aktuelle XML-Sitemap mit korrektem
lastmod - URL-Prüfung und Indexierung beantragen für einzelne wichtige Seiten
- Externe Links, etwa aus Pressemitteilungen oder sozialen Netzwerken, die Google schnell entdeckt
Die Indexing API von Google ist offiziell nur für Stellenangebote und Livestreams gedacht. Ihre Nutzung für andere Inhalte ist nicht vorgesehen.
Seiten aus dem Index entfernen
Manchmal soll eine Seite gerade nicht im Index sein. Die richtigen Wege:
| Ziel | Methode |
|---|---|
| Seite dauerhaft entfernen, Inhalt existiert nicht mehr | 404 oder 410 zurückgeben |
| Seite entfernen, Inhalt ist umgezogen | 301-Weiterleitung |
| Seite erreichbar lassen, aber nicht in der Suche | noindex |
| Dringend und vorübergehend ausblenden | Entfernen-Tool in der Search Console (wirkt etwa sechs Monate) |
| Vertrauliche Inhalte | Passwortschutz |
Die robots.txt ist kein geeignetes Mittel, um Seiten aus dem Index zu entfernen, weil Google dann die noindex-Anweisung nicht lesen kann.
Erfahrungswert: Wenn bei einer Website viele gute Seiten mit „Gecrawlt – zurzeit nicht indexiert“ hängen, liegt die Ursache selten bei diesen Seiten allein. Häufig hat die Website insgesamt zu viele schwache Seiten. Nach einer Bereinigung – weniger, aber stärkere Seiten – werden die verbleibenden oft von selbst indexiert.
Oft gefragt
Wie lange dauert es, bis eine neue Seite indexiert wird?
Von wenigen Stunden bis zu mehreren Wochen. Gut verlinkte Seiten auf etablierten Websites werden meist innerhalb weniger Tage indexiert.
Warum ist meine Seite indexiert, erscheint aber nicht in den Suchergebnissen?
Indexiert bedeutet nur, dass die Seite ranken kann. Ob sie für eine bestimmte Suchanfrage erscheint, hängt vom Ranking ab. Oft steht sie auf hinteren Positionen, die kaum jemand sieht.
Sollten alle Seiten meiner Website indexiert sein?
Nein. Seiten ohne Suchwert – Filter, interne Suche, Danke-Seiten, Warenkorb – gehören nicht in den Index. Ziel ist, dass alle wertvollen Seiten indexiert sind und keine wertlosen.