Datenbereinigung (CRM)
Definition: Datenbereinigung im CRM (englisch: Data Cleansing oder Data Scrubbing) bezeichnet den systematischen Prozess der Identifikation, Korrektur und Vervollständigung fehlerhafter, unvollständiger, veralteter, falsch formatierter oder inkonsistenter Datensätze in einem CRM-System. Sie umfasst ein breites Spektrum an Maßnahmen: das Entfernen oder Korrigieren ungültiger E-Mail-Adressen, die Standardisierung von Telefonnummernformaten, das Aktualisieren veralteter Unternehmensadressen und Positionen, die Bereinigung von Groß-/Kleinschreibung in Namensfeldern sowie die Eliminierung von Duplikaten (Datendeduplizierung). Datenbereinigung ist nicht als einmaliges Projekt, sondern als kontinuierlicher Prozess zu verstehen: B2B-Kontaktdaten veralten laut einer Studie von MarketSharp und Salesforce jährlich zu 25–30 %, da Mitarbeitende Positionen wechseln, Unternehmen umziehen oder fusionieren. Die wirtschaftliche Relevanz schlechter Datenqualität ist erheblich: Die IBM Global Data Quality Research (2016) bezifferte die jährlichen Kosten fehlerhafter Daten für US-Unternehmen auf 3,1 Billionen USD. Experian Data Quality (2022) ermittelte, dass Marketing-Teams im Schnitt 27 % ihrer Kapazität mit Datenproblemen verbringen.
Erläuterung
Die wissenschaftliche Auseinandersetzung mit Datenqualität reicht bis in die 1990er-Jahre zurück. Richard Wang und Diane Strong von der MIT Sloan School of Management entwickelten 1996 im Journal of Management Information Systems ein vielzitiertes Framework zur Messung von Datenqualität entlang vier Dimensionen: Genauigkeit (Accuracy), Vollständigkeit (Completeness), Konsistenz (Consistency) und Aktualität (Timeliness). Dieses Rahmenwerk bildet bis heute die theoretische Grundlage für CRM-Datenqualitätsprogramme. Im CRM-Kontext unterscheidet man zwischen präventiver Datenbereinigung (Validierungsregeln beim Dateneingang verhindern Fehler an der Quelle), reaktiver Datenbereinigung (nachträgliche Korrektur bestehender Fehler) und predictiver Datenbereinigung (KI-gestützte Identifikation wahrscheinlicher Fehler auf Basis von Mustern). Tools für die reaktive Bereinigung sind u. a. Clearbit (gegründet 2014, 2023 von HubSpot für einen nicht öffentlich kommunizierten Preis übernommen), das Firmendaten aus öffentlichen Quellen anreichert und veraltete Felder aktualisiert; ZoomInfo (Börsengang 2020, Marktkapitalisierung zeitweise über 20 Milliarden USD), das besonders für B2B-Kontaktdaten genutzt wird; sowie Dedupe.ly, Validity (ehemals DemandTools) und Dataloader.io für Salesforce-spezifische Bereinigungsprozesse. HubSpot bietet nativ eine Duplicate-Management-Funktion (ab Professional-Tier), die ähnliche Kontakte automatisch identifiziert und zur Zusammenführung vorschlägt. Salesforce stellt mit dem Duplicate Management Feature (verfügbar ab Salesforce Essentials) regelbasierte Duplikatprüfungen bereit. Ein wichtiges Konzept in der Datenbereinigung ist das „Data Quality Score" – ein Maß für den aktuellen Gesundheitszustand der CRM-Datenbasis. Einige Unternehmen berechnen diesen Score als prozentualen Anteil vollständig ausgefüllter Pflichtfelder bei allen aktiven Kontakten und visualisieren ihn in einem CRM-Dashboard. Gartner empfahl in einer Studie von 2021, einen Mindestwert von 80 % als Qualitätsziel für Pflichtfelder anzustreben. Ein besonders kritischer Bereich der Datenbereinigung ist die E-Mail-Validierung: Ungültige E-Mail-Adressen führen zu Hard Bounces, die die Sender Reputation gefährden und im schlimmsten Fall zur Sperrung durch E-Mail-Dienstanbieter führen. Dienste wie NeverBounce (2014 gegründet), ZeroBounce und Kickbox ermöglichen die Validierung von E-Mail-Listen vor dem Versand und reduzieren die Bounce-Rate nachweislich um 90–95 %.
Methoden und Kategorien der CRM-Datenbereinigung
- Standardisierung: Vereinheitlichung von Formaten (Telefonnummern: +49 89 123456 statt 089/123456), Groß-/Kleinschreibung in Namensfeldern, ISO-konforme Länder- und Bundeslandcodes. Wird idealerweise über Importregeln und Workflow-basierte Formatierungen automatisiert.
- Validierung: Prüfung auf Gültigkeit (E-Mail-Syntaxcheck, Postleitzahlenvalidierung, Telefonnummernformat) direkt bei der Dateneingabe über Formularvalidierungsregeln oder beim Import über API-Validierungslogiken.
- Anreicherung (Data Enrichment): Ergänzung fehlender Felder durch externe Datenquellen (Clearbit, ZoomInfo, LinkedIn-Daten) wie Branche, Unternehmensgröße, Umsatz oder Social-Media-Profile.
- Deduplizierung: Identifikation und Zusammenführung doppelter Datensätze; ausführlich im Eintrag Datendeduplizierung beschrieben.
- Veraltete Datensätze: Systematische Identifikation von Kontakten, bei denen seit einem definierten Zeitraum keine Interaktion stattgefunden hat und keine aktuellen Daten vorliegen – für Bereinigung, Archivierung oder Re-Engagement.
Datenbereinigung in der Praxis: Prozessschritte
- Audit: Quantifizierung des aktuellen Datenqualitätsniveaus durch Export und Analyse: Wie viele Kontakte fehlen E-Mail-Adressen? Wie viele haben ungültige Telefonnummern? Wie hoch ist der Duplikatanteil?
- Priorisierung: Festlegung, welche Datenfeldgruppen für welche Geschäftsprozesse kritisch sind und daher vorrangig bereinigt werden (z. B. E-Mail-Adressen und Unternehmensname für Marketing; Telefon und Ansprechpartner für Vertrieb).
- Automatisierung der Prävention: Einrichtung von Pflichtfeldern, Dropdown-Optionen statt Freitextfelder, Importregeln und Formularvalidierungen, die Fehler künftig an der Quelle verhindern.