Googlebot
Definition: Googlebot ist der Web-Crawler (Spider) von Google, der das Internet automatisch durchsucht, Webseiten besucht, deren Inhalte für den Google-Suchindex analysiert und Links zu neuen URLs verfolgt. Er gibt sich gegenüber Webservern mit einem charakteristischen User-Agent-String zu erkennen und respektiert die Anweisungen in robots.txt-Dateien und Meta-Robots-Tags.
Erläuterung
Der Googlebot ist Googles Werkzeug, um das Web ständig aktuell zu halten. Ohne Googlebot gäbe es keine Google-Suchergebnisse – er ist die erste Stufe des Crawling-Indexierungs-Ranking-Prozesses. Technisch verhält er sich ähnlich wie ein Webbrowser, liest HTML, führt JavaScript aus und folgt Links – allerdings ohne visuelle Darstellung und mit anderen Prioritäten als ein Nutzer.
Googlebot-Typen
- Googlebot Smartphone (Hauptcrawler): Crawlt Websites als mobiles Gerät – Grundlage der Mobile-First-Indexierung seit 2019
- Googlebot Desktop: Sekundärer Crawler; wird für Websites verwendet, die noch keine Mobile-First-Indexierung haben
- Googlebot-Image: Speziell für Bildsuche; analysiert Bilder und Alt-Texte
- Googlebot-Video: Für Video-Inhalte und YouTube-ähnliche Seiten
- Google-InspectionTool: Wird ausgelöst, wenn man in der Search Console das URL-Prüftool nutzt
- APIs-Google: Spezieller Crawler für API-basierte Inhalte
Wie Googlebot JavaScript behandelt
Googlebot kann JavaScript ausführen und rendern – aber mit Verzögerung:
- Phase 1: HTML-Crawl – sofort beim ersten Besuch
- Phase 2: JavaScript-Rendering – in einer separaten Queue, kann Stunden bis Tage später erfolgen
- Für SEO-kritische Inhalte (Navigation, H1, primärer Text) gilt: im initialen HTML verfügbar sein, nicht erst nach JavaScript-Ausführung
Googlebot-Zugriff steuern
- robots.txt: Crawling bestimmter Bereiche erlauben oder verbieten (blockiert Crawling, nicht Indexierung)
- Meta-Robots-Tag:
<meta name="robots" content="noindex, nofollow">– verhindert Indexierung einer Seite - X-Robots-Tag: HTTP-Header-Variante der Robots-Direktiven; auch für Nicht-HTML-Ressourcen wie PDFs nutzbar
Echten Googlebot von Fälschungen unterscheiden
- Echter Googlebot: Reverse-DNS-Lookup des crawlenden IP ergibt Hostnamen mit googlebot.com oder google.com
- Viele Scraper tarnen sich als Googlebot – diese haben keine verifizierbaren Google-IPs
- In der Google Search Console sehen Sie den echten Googlebot-Traffic und Crawl-Statistiken