Marketing Glossar

2.413 Fachbegriffe aus 22 Bereichen des Online Marketings

Web Scraping

Definition: Web Scraping (auch Web Harvesting oder Web Data Extraction) bezeichnet die automatisierte Extraktion strukturierter Daten aus Webseiten mithilfe von Crawler-Programmen oder spezialisierten Scraping-Tools. Das Programm sendet HTTP-Anfragen, parst den zurückgegebenen HTML-Code (oder JSON aus APIs) mit CSS-Selektoren oder XPath und speichert relevante Daten strukturiert in Datenbanken oder CSV-Dateien. Im Online-Marketing wird Scraping primär für Wettbewerbsanalysen, Preismonitoring, SEO-Audits und Keyword-Recherche eingesetzt. Wichtige Tools: Python-Libraries BeautifulSoup (statisches HTML), Scrapy (Crawling-Framework), Playwright/Puppeteer (JavaScript-gerenderte Seiten) sowie No-Code-Tools wie Apify, Octoparse und ParseHub. Scraping bewegt sich in einem rechtlich komplexen Bereich: robots.txt, Terms of Service und DSGVO setzen Grenzen.

Erläuterung

Scraping teilt sich in zwei Hauptkategorien: statisches HTML-Scraping (direktes Parsen der Server-Antwort – schnell, ressourcenschonend) und dynamisches Scraping mit Headless-Browsern (für JavaScript-gerenderte SPAs – langsamer, aber erfasst auch Client-seitig geladene Inhalte). Für Marketing-Anwendungsfälle ist die Frage «Brauche ich einen Headless-Browser?» entscheidend: Preislisten die via API geladen werden, erfordern Playwright oder Puppeteer; statische Meta-Tags sind mit BeautifulSoup extrahierbar.

Tools und Technologien

Marketing-Anwendungsfälle

Technische Herausforderungen

Rechtliche Rahmenbedingungen

Praxistipp: Für Marketing-Teams ohne Python-Kenntnisse ist Apify (apify.com) die praktikabelste Einstiegslösung: fertige Scraper-Templates (Actors) für Amazon, Google, Instagram und Social Media; keine eigene Infrastruktur; API-Zugriff für automatisierte Workflows. Für Wettbewerber-Meta-Tag-Analysen reicht oft Screaming Frog (kostenpflichtig, GUI) ohne Programmierung. Wenn Sie selbst scrapen: Setzen Sie immer einen realistischen User-Agent-Header, fügen Sie 2–5 Sekunden Delay zwischen Anfragen ein (time.sleep(random.uniform(2,5)) in Python) und respektieren Sie robots.txt. Das reduziert das Risiko des IP-Blockings erheblich. Bei Preis-Monitoring von Wettbewerbern: Prüfen Sie zunächst ob nicht eine offizielle API, ein Datenfeed (Google Shopping) oder ein Preisvergleichsportal die Daten bereits strukturiert liefert – das ist einfacher und rechtlich sicherer als eigenes Scraping.