LSI-Keywords
Definition: LSI-Keywords (Latent Semantic Indexing Keywords) ist ein vereinfachend genutzter SEO-Begriff für semantisch verwandte Wörter, Synonyme und thematisch verbundene Ausdrücke die gemeinsam mit einem Hauptkeyword in einem Text auftreten und Suchmaschinen helfen den Kontext und die vollständige Themenrelevanz eines Artikels zu verstehen. Wichtige Klarstellung: Googles Algorithmus verwendet kein klassisches LSI-System (Scott Huffman, Google, 2019); der Begriff ist im SEO-Kontext eine vereinfachende Metapher für das Prinzip der semantischen Themenabdeckung. Das zugrundeliegende Prinzip ist jedoch valide: ein Artikel über «E-Mail-Marketing» der auch «Newsletter», «Betreffzeile», «Open Rate», «Segmentierung», «Automation» und «Bounce Rate» enthält, wird von Googles modernem Sprachverständnis (BERT, MUM) als thematisch vollständiger und relevanter bewertet als ein Artikel der nur den Hauptbegriff wiederholt. Praktische Bedeutung: LSI-Keywords = semantische Themenabdeckung durch verwandte Begriffe; wichtiger als Keyword-Dichte für modernes SEO.
Erläuterung
Latent Semantic Indexing (LSI) als wissenschaftliche Methode wurde 1988–1990 an den Bell Laboratories von Scott Deerwester, Susan Dumais, Thomas Landauer und Kollegen entwickelt und 1990 im «Journal of the American Society for Information Science» publiziert (Deerwester et al., «Indexing by Latent Semantic Analysis», 1990). LSI nutzt Singular Value Decomposition (SVD) – eine mathematische Matrixtechnik – um semantische Ähnlichkeiten zwischen Dokumenten und Begriffen auf Basis von Ko-Vorkommen zu berechnen: Begriffe die häufig in denselben Dokumenten vorkommen, teilen semantische Ähnlichkeit. Susan Dumais (später Forscherin bei Microsoft Research) führte LSI zu einer wichtigen Technik im Information Retrieval. Im SEO-Kontext wurde der Begriff «LSI Keywords» durch die SEO-Community ab ca. 2004–2010 popularisiert als vereinfachende Erklärung für semantisches Themenverständnis bei Suchmaschinen – auch wenn Google technisch kein LSI-System implementiert. Google-Mitarbeiter John Mueller (Webmaster Trends Analyst) und Gary Illyes bestätigten mehrfach (2018–2021) in öffentlichen Statements und Tweets dass «LSI Keywords» kein offizielles Google-Konzept sind. Googles tatsächliche Sprachverarbeitungssysteme sind weit fortgeschrittener: Word2Vec (Google Research, Tomas Mikolov et al., 2013) ermöglichte semantische Wortvektor-Berechnungen; BERT (Bidirectional Encoder Representations from Transformers, Jacob Devlin et al., Google AI Language, Oktober 2019) revolutionierte Googles Sprachverständnis: bidirektionaler Kontext bedeutet dass ein Wort basierend auf allen umliegenden Wörtern verstanden wird – nicht nur den vorhergehenden. MUM (Multitask Unified Model, Google I/O 2021) erweiterte dies auf multimodales und mehrsprachiges Verständnis. Das Prinzip hinter LSI-Keywords – dass semantische Vollständigkeit durch ko-vorkommende relevante Begriffe Googles Relevanzbewertung verbessert – ist trotz terminologischer Ungenauigkeit ein valider SEO-Optimierungsansatz der durch Tools wie SurferSEO, Clearscope und MarketMuse operationalisiert wird.
Semantische Themenabdeckung: Praktische Anwendung
- Wie semantische Vollständigkeit entsteht: Natürliches Schreiben: ein Experte der umfassend über sein Fachthema schreibt integriert automatisch semantisch verwandte Begriffe; Problem: KI-generierter oder Template-basierter Content ist oft semantisch flach (wiederholt Hauptkeyword ohne semantische Tiefe); Content-Lücken-Analyse: Vergleich des eigenen Artikels mit Top-10-Rankings zeigt welche semantisch verwandten Begriffe fehlen; Ko-Vorkommen: Begriffe die in denselben Top-10-Artikeln häufig zusammen mit dem Hauptkeyword erscheinen → hohe Wahrscheinlichkeit semantischer Relevanz
- LSI-/Semantik-Keywords identifizieren: Google SERP Bottom: «Verwandte Suchanfragen» am Ende der Suchergebnisseite zeigt semantisch verwandte Queries; People Also Ask: häufige Fragen rund um das Hauptthema; Google Autocomplete: Eingabe des Hauptkeywords + Leerzeichen zeigt häufige Ergänzungen; Ahrefs «Also Rank For»: welche anderen Keywords ranken Seiten die für das Hauptkeyword auf Seite 1 sind?; LSIGraph.com (kostenloses Tool): visualisiert semantisch verwandte Begriffe; SurferSEO/Clearscope: TF-IDF-basierte Empfehlungen für semantisch relevante Begriffe basierend auf Top-10-Analyse
- Unterscheidung LSI-Keywords / Synonyme / Long-Tail: Synonyme: direkt bedeutungsgleiche Begriffe («SEO» = «Suchmaschinenoptimierung»); beide zu verwenden zeigt semantische Breite; LSI-Keywords im erweiterten Sinn: thematisch verwandte Begriffe die zum Themenfeld gehören aber nicht direkt synonym sind («Content Marketing» → «Redaktionsplan», «Blog», «Lead Nurturing»); Long-Tail-Keywords: spezifischere Varianten des Hauptkeywords («Content Marketing Strategie B2B», «Content Marketing KPIs messen»); alle drei Kategorien sollten im Long-Form-Content natürlich vorkommen
Google BERT und modernes Sprachverständnis
- Was BERT geändert hat: Vor BERT: Google verstand Keywords in linearer Reihenfolge und konnte Präpositionen und Kontext oft nicht korrekt interpretieren; BERT (Oktober 2019): bidirektionaler Kontext – jedes Wort wird basierend auf allen umgebenden Wörtern verstanden; Beispiel: «Kann ich mir eine Medizin kaufen» vs. «Ich habe eine Medizin für jemanden gekauft» – BERT unterscheidet diese Intentionen; für LSI-Keyword-Strategie: nicht mehr wichtig einzelne Keywords mechanisch zu streuen, sondern natürlichen Fließtext zu schreiben der semantischen Kontext liefert; Auswirkung: 10% aller englischen Suchanfragen betroffen laut Google
- Praktische BERT-Konsequenzen für Content: Conversational Language: natürlich geschriebene Texte performen besser als Keyword-fragmentierte Formulierungen; Präzision über Wiederholung: ein präziser Satz mit allen relevanten semantischen Bezügen übertrifft dreimalige Keyword-Wiederholung; Suchanfragen-Kontext: lange Suchanfragen werden besser verstanden → Long-Tail-Content profitiert; Voice-Search-Fitness: BERT verbessert Voice-Search-Ergebnisqualität; conversational Content ohne erzwungene Keyword-Dichte ist ideal für Voice
- TF-IDF als praxisnahe Alternative zu LSI: TF-IDF (Term Frequency-Inverse Document Frequency): misst wie charakteristisch ein Begriff für ein Dokument im Verhältnis zu einem Textkorpus ist; in SEO-Tools wie SurferSEO implementiert: analysiert Top-10-Seiten für ein Keyword und identifiziert Begriffe die dort häufiger vorkommen als im allgemeinen Web; Optimierungs-Empfehlung: Begriffe die in Top-10-Seiten häufig sind aber im eigenen Artikel fehlen → Optimierungskandidaten; Grenze: TF-IDF ist kein direktes Google-Ranking-Signal; es ist eine Proxy-Metrik für semantische Vollständigkeit