Deskriptive Statistik
Definition: Die deskriptive Statistik (auch beschreibende Statistik) umfasst ein System von Methoden zur numerischen Zusammenfassung, Beschreibung und visuellen Darstellung von Datensätzen durch Kennzahlen wie Mittelwert, Median, Modus, Varianz, Standardabweichung, Spannweite, Quartile und Häufigkeitsverteilungen, ohne dabei inferenzielle Schlussfolgerungen auf eine zugrunde liegende Grundgesamtheit zu ziehen. Sie bildet das methodische Fundament jeder quantitativen Analyse und ist in der Regel der erste Schritt der Datenauswertung, bevor weiterführende Verfahren der Inferenzstatistik (Signifikanztests, Konfidenzintervalle, Regressionsmodelle) eingesetzt werden. Die Grundlagen der modernen deskriptiven Statistik wurden im 19. Jahrhundert durch Wissenschaftler wie Karl Friedrich Gauss (Normalverteilung, 1809), Adolphe Quetelet (statistische Sozialforschung, 1835) und Francis Galton (Korrelation und Regression, 1888) gelegt. Karl Pearson, der auch den Chi-Quadrat-Test entwickelte, systematisierte Ende des 19. Jahrhunderts viele der heute geläufigen deskriptiven Maße und führte den Begriff der „Standardabweichung" 1894 in die Statistik ein. In der Marketingforschung ist deskriptive Statistik das wichtigste Werkzeug für die Aufbereitung und Kommunikation von Umfrageergebnissen, Leistungskennzahlen und Kundendaten: Jede Angabe von Durchschnittswerten, prozentualen Anteilen, Verteilungen oder Zeitreihen ist eine Anwendung deskriptiver Statistik.
Erläuterung
Die deskriptive Statistik lässt sich in vier Hauptbereiche unterteilen: Lagemaße, Streuungsmaße, Formmaße und Zusammenhangsmaße. Lagemaße beschreiben die zentrale Tendenz einer Verteilung und sind damit oft die erste Zahl, die Entscheidungsträger nach einer Datenerhebung sehen wollen. Der arithmetische Mittelwert (Durchschnitt) ist die Summe aller Werte geteilt durch die Anzahl der Werte; er ist sensitiv gegenüber Ausreißern und verzerrend bei schiefen Verteilungen – typisches Beispiel: der durchschnittliche Warenkorbwert wird von wenigen Großbestellungen nach oben getrieben. Der Median (Zentralwert) teilt eine sortierte Wertereihe in zwei gleich große Hälften und ist robust gegen Ausreißer; er ist für schiefe Verteilungen (Einkommensverteilungen, Warenkorbwerte, Klickzahlen) aussagekräftiger als der Mittelwert. Der Modus ist der häufigste Wert und relevant bei kategorialen Daten. Streuungsmaße quantifizieren, wie weit die Werte um die zentrale Tendenz streuen. Die Varianz berechnet sich als durchschnittliche quadrierte Abweichung vom Mittelwert; die Standardabweichung ist die Quadratwurzel der Varianz und hat dieselbe Einheit wie die Originalvariable. Die Spannweite (Maximum minus Minimum) ist einfach interpretierbar, aber anfällig für Ausreißer; der Interquartilsabstand (IQR = 75. Perzentil minus 25. Perzentil) ist robuster und beschreibt die Streuung der mittleren 50 % der Daten. Formmaße wie Schiefe (Asymmetrie der Verteilung) und Kurtosis (Wölbung / Tailedness) beschreiben die Form der Verteilung und sind relevant, um zu prüfen, ob statistische Voraussetzungen (z. B. Normalverteilungsannahme) für nachgelagerte Tests erfüllt sind. Zusammenhangsmaße wie der Pearson-Korrelationskoeffizient r (für metrische Variablen) und Spearmans Rangkorrelation ρ (für ordinale Variablen oder nicht-lineare Zusammenhänge) quantifizieren die Stärke und Richtung bivariatem Zusammenhängen. In modernen Datenanalyse-Workflows wird deskriptive Statistik in Python mit der pandas-Bibliothek (df.describe() liefert in einer Zeile Mittelwert, Standardabweichung, Quartile und Extremwerte für alle numerischen Spalten), in R (summary()-Funktion, psych::describe()), in SPSS (Analyze → Descriptive Statistics → Descriptives/Frequencies) und in Excel (MITTELWERT, MEDIAN, STABW-Funktionen sowie das Analyse-Toolpak) durchgeführt. Die wichtigsten grafischen Darstellungsformen sind: Histogramme (Häufigkeitsverteilung metrischer Variablen), Boxplots (Median, Quartile und Ausreißer auf einen Blick), Balken- und Säulendiagramme (Häufigkeiten nominaler und ordinaler Variablen), Streudiagramme (bivariate Zusammenhänge) und Heatmaps (Korrelationsmatrizen).
Lagemaße im Überblick
- Arithmetisches Mittel: Summe aller Werte / Anzahl der Werte; intuitiv und weit verbreitet; anfällig für Ausreißer; geeignet für symmetrische, normalverteilte Daten.
- Median: Mittlerer Wert der sortierten Reihe (bei gerader Anzahl: Durchschnitt der beiden mittleren Werte); robust gegen Ausreißer; besser geeignet für schiefe Verteilungen (Einkommen, Warenkörbe, Web-Session-Dauern).
- Modus: Häufigster Wert; einziges Lagemaß für nominalskalierte Daten (z. B. meistgewählte Produktkategorie); eine Verteilung kann mehrere Modi aufweisen (bimodal, multimodal).
- Gewichtetes Mittel: Mittelwert unter Berücksichtigung unterschiedlicher Gewichte (z. B. umsatzgewichteter Durchschnittspreis, bevölkerungsgewichtete Kundenzufriedenheit).
Streuungsmaße im Überblick
- Standardabweichung (SD): Quadratwurzel der Varianz; gleiche Einheit wie Originalvariable; bei Normalverteilung liegen ca. 68 % aller Werte im Bereich Mittelwert ± 1 SD und ca. 95 % im Bereich ± 2 SD.
- Variationskoeffizient (CV): Standardabweichung / Mittelwert; dimensionsloser Relativwert; ermöglicht Vergleich der Streuung zwischen Variablen mit unterschiedlichen Einheiten oder Größenordnungen.
- Interquartilsabstand (IQR): 75. Perzentil minus 25. Perzentil; beschreibt die Streuung der mittleren 50 % der Daten; robust gegen Ausreißer; Basis der Boxplot-Darstellung.
- Spannweite: Maximum minus Minimum; einfach berechenbar; sehr anfällig für Ausreißer; aussagekräftig nur bei sauberen, ausreißerfreien Daten.