Crawling
Definition: Crawling (auch Spidering oder Webcrawling) ist der automatisierte Prozess, bei dem ein Suchmaschinen-Bot (Crawler oder Spider) systematisch Webseiten besucht, deren Inhalte analysiert und Links zu weiteren Seiten verfolgt. Crawling ist die erste Stufe des dreiteiligen Google-Prozesses Crawling → Indexierung → Ranking und Voraussetzung dafür, dass eine Seite überhaupt in den Suchergebnissen erscheinen kann.
Erläuterung
Googles Crawler – der Googlebot – startet von einer Liste bekannter URLs und folgt von dort aus jedem Link, den er findet. So entdeckt Google kontinuierlich neue Seiten und aktualisiert seinen Index. Stellen Sie sich den Googlebot wie einen automatisierten Webbrowser vor, der jede erreichbare Seite besucht, analysiert und die gefundenen Links in eine Warteschlange für zukünftige Crawls einreiht.
Wie Crawling funktioniert – der Prozess
- Googlebot startet von bekannten, häufig besuchten URLs (z. B. populäre Websites, Sitemaps)
- Die Seite wird heruntergeladen und das HTML analysiert
- Alle gefundenen Links werden extrahiert und in die Crawl-Queue eingereiht
- JavaScript wird in einer zweiten Phase gerendert (verzögert)
- Gecrawlte Inhalte werden zur Indexierung weitergeleitet
Faktoren, die die Crawl-Häufigkeit beeinflussen
- Seitenladegeschwindigkeit: Langsame Seiten werden seltener gecrawlt – Google möchte Server nicht überlasten
- Interne Verlinkung: Gut verlinkte Seiten erhalten häufiger Besuche vom Googlebot
- Klicktiefe: Seiten, die nur 1–2 Klicks von der Homepage entfernt sind, werden häufiger gecrawlt als tief verschachtelte Seiten
- Sitemap: URLs in der XML-Sitemap werden schneller entdeckt und gecrawlt
- Domain-Autorität: Websites mit hoher Autorität haben ein grösseres Crawl-Budget – ihre Seiten werden häufiger besucht
Was das Crawling behindert
- robots.txt-Blockierungen: Wichtige URLs versehentlich für Crawler gesperrt
- Zu tiefe Website-Struktur: Mehr als 4–5 Klicks von der Homepage → selten gecrawlt
- Zu viele URL-Parameter: Facettierte Navigation, Session-IDs erzeugen unzählige Duplicate-Content-URLs und verschwenden Crawl-Budget
- Langsame Serverantwortzeiten: Über 1–2 Sekunden TTFB bremst Crawling
- Interne Verlinkungsfehler: Broken Links führen zu 404-Seiten und verschwenden Crawl-Budget
Crawling vs. Indexierung: Der Unterschied
- Crawling = Google besucht die Seite und liest den Inhalt
- Indexierung = Google entscheidet, die Seite in den Suchindex aufzunehmen
- Alle indizierten Seiten wurden gecrawlt – aber nicht alle gecrawlten Seiten werden indexiert