
Die Herkunft der Formel
WDF*IDF ist eine Variante der Termgewichtung aus dem Information Retrieval, dem Fachgebiet, das sich mit dem Auffinden von Informationen in Dokumentensammlungen beschäftigt. Das Grundprinzip heißt TF-IDF (Term Frequency – Inverse Document Frequency) und wird seit Jahrzehnten in Suchsystemen eingesetzt.
Die Idee: Ein Begriff ist für ein Dokument besonders kennzeichnend, wenn er darin häufig vorkommt, in anderen Dokumenten aber selten. Das Wort „und“ kommt überall vor und sagt deshalb nichts über den Inhalt. Das Wort „Dachrinnenheizung“ kommt in wenigen Dokumenten vor – wenn es in einem Text mehrfach auftaucht, handelt dieser Text wahrscheinlich davon.
Die beiden Bestandteile
WDF: Within Document Frequency
Der WDF misst, wie häufig ein Begriff innerhalb eines Dokuments vorkommt. Anders als die einfache Keyword-Dichte wird die Häufigkeit logarithmisch gedämpft. Das bedeutet: Die ersten Erwähnungen eines Begriffs erhöhen den Wert stark, weitere Wiederholungen immer weniger. Zwanzig Erwähnungen sind nicht doppelt so viel wert wie zehn.
Vereinfacht lautet die Formel:
WDF(i) = log₂(Häufigkeit des Begriffs i im Dokument + 1) ÷ log₂(Gesamtzahl der Wörter im Dokument)
IDF: Inverse Document Frequency
Der IDF misst, wie selten ein Begriff in einer Gesamtmenge von Dokumenten ist. Seltene Begriffe erhalten einen hohen Wert, häufige einen niedrigen.
IDF(i) = log₁₀(Anzahl aller Dokumente ÷ Anzahl der Dokumente, die den Begriff enthalten)
Multipliziert ergibt sich der WDF*IDF-Wert: eine Kennzahl dafür, wie stark ein Begriff ein Dokument im Vergleich zu anderen prägt.
Wie Tools die Formel für SEO einsetzen
SEO-Tools, die mit WDF*IDF arbeiten, gehen meist so vor:
- Sie ermitteln die Top-Ergebnisse bei Google für einen Suchbegriff, etwa die ersten zehn oder zwanzig.
- Sie berechnen für die in diesen Dokumenten vorkommenden Begriffe die WDF*IDF-Werte.
- Sie stellen die Durchschnittswerte als Kurve dar.
- Sie vergleichen Ihren eigenen Text mit dieser Kurve und zeigen, welche Begriffe bei Ihnen fehlen oder überrepräsentiert sind.
Das Ergebnis ist eine Liste von Begriffen, die in den gut rankenden Texten typischerweise vorkommen – sogenannte Proof-Keywords oder Begleitbegriffe.
Wofür die Analyse nützlich ist
Richtig eingesetzt, ist die WDFIDF-Analyse ein gutes Werkzeug zur Themenrecherche*. Sie zeigt, welche Aspekte die erfolgreichen Texte behandeln. Fehlen in Ihrem Text Begriffe wie „Kosten“, „Förderung“ oder „Genehmigung“, die in allen Top-Texten zu „Photovoltaikanlage“ vorkommen, ist das ein Hinweis auf eine inhaltliche Lücke.
Ein Texter schreibt über „Pflasterarbeiten“. Die Analyse zeigt, dass die Top-Ergebnisse häufig Begriffe wie „Unterbau“, „Frostschutzschicht“, „Splitt“, „Randsteine“, „Gefälle“ und „Rüttelplatte“ enthalten. Der eigene Entwurf erwähnte den Unterbau kaum. Der Texter ergänzt daraufhin einen Abschnitt über den richtigen Aufbau – nicht weil die Kurve es verlangt, sondern weil Leser diese Information erwarten.
Wo die Methode in die Irre führt
Sie ist kein Rankingfaktor
Google verwendet keine WDF*IDF-Kurven, um Rankings zu bestimmen. Die Suchmaschine nutzt weit komplexere Sprachmodelle. Einen Text an eine Kurve anzupassen, bringt deshalb keinen direkten Vorteil.
Sie misst Wörter, nicht Bedeutung
Die Formel erkennt nicht, ob ein Begriff sinnvoll verwendet wird. Ein Text, der alle Begriffe enthält, aber schlecht erklärt, schneidet in der Analyse gut ab und bei Lesern schlecht.
Sie kopiert den Durchschnitt
Wer seine Texte an den Top-Ergebnissen ausrichtet, bildet den Durchschnitt nach. Google belohnt aber zunehmend Inhalte, die etwas Eigenes bieten: eigene Erfahrungen, Daten, Perspektiven. Die Kurve kann das nicht abbilden.
Sie verführt zum Überoptimieren
Wenn Texter versuchen, jeden Begriff auf den Durchschnittswert zu bringen, entstehen gestelzte Texte, in denen Fachbegriffe ohne Zusammenhang eingestreut werden.
Von WDF*IDF zu Entitäten und semantischer Vollständigkeit
Moderne Content-Tools arbeiten zunehmend mit anderen Methoden: Sie erkennen Entitäten, analysieren Fragen und Unterthemen oder nutzen Sprachmodelle, um die inhaltliche Abdeckung zu bewerten. Diese Ansätze sind näher an dem, wie Google Inhalte versteht. Der Grundgedanke bleibt derselbe: Ein guter Text deckt ein Thema so vollständig ab, dass alle wichtigen Aspekte vorkommen. Mehr dazu im Beitrag Entitäten.
So setze ich die Analyse ein
- Vor dem Schreiben: Die Analyse der Top-Ergebnisse liefert eine Liste von Unterthemen und Fachbegriffen. Sie fließt ins Briefing ein, zusammen mit den Fragen aus „Weitere Fragen“ und den Kundenfragen.
- Beim Schreiben: Der Text wird für Leser geschrieben. Die Begriffsliste dient als Erinnerung, keine Kurve als Vorgabe.
- Nach dem Schreiben: Ein kurzer Abgleich zeigt, ob ein wichtiges Unterthema vergessen wurde. Werte werden nicht „auf Linie gebracht“.
Übersicht: Keyword-Dichte, WDF*IDF und semantische Analyse
| Methode | Misst | Nutzen heute |
|---|---|---|
| Keyword-Dichte | Häufigkeit eines Begriffs im Verhältnis zur Textlänge | gering, höchstens als Warnung vor Übertreibung |
| WDF*IDF | Gewichtete Häufigkeit im Vergleich zu anderen Dokumenten | mittel, als Recherchehilfe für Unterthemen |
| Entitäten- und Themenanalyse | Abdeckung von Konzepten, Fragen und Zusammenhängen | hoch, näher an Googles Verständnis |
Gut zu wissen
Ist WDF*IDF veraltet?
Als Zielgröße ja. Als Werkzeug zur Recherche von Unterthemen kann die Analyse weiterhin hilfreich sein, sollte aber nicht über die Qualität eines Textes entscheiden.
Brauche ich ein WDF*IDF-Tool?
Nicht zwingend. Eine sorgfältige Analyse der Top-Ergebnisse, der Box „Weitere Fragen“ und der Kundenfragen liefert oft dieselben Erkenntnisse – und dazu solche, die die Formel nicht erfasst.
Warum ist die Methode vor allem in Deutschland bekannt?
Einige deutschsprachige SEO-Experten und Tool-Anbieter haben das Konzept in den 2010er-Jahren stark verbreitet. Im englischsprachigen Raum spricht man eher von TF-IDF oder von semantischer Optimierung.