Stichprobe (Sample)
Definition: Eine Stichprobe (englisch: Sample) ist eine definierte Teilmenge aus einer Grundgesamtheit (Population), die für eine Untersuchung ausgewählt wird, um auf Basis ihrer Merkmale Schlussfolgerungen über die gesamte Grundgesamtheit zu ziehen. Da es in der Marktforschung, der Sozialwissenschaft und der Qualitätskontrolle meist weder möglich noch wirtschaftlich sinnvoll ist, alle Elemente einer Grundgesamtheit zu erfassen (Vollerhebung oder Zensus), werden Stichproben eingesetzt, um mit vertretbarem Aufwand statistisch belastbare Aussagen zu erzielen. Die Qualität einer Stichprobe wird durch drei Dimensionen bestimmt: erstens durch das Ziehungsverfahren (zufällig oder nicht zufällig), zweitens durch die Größe (die den Stichprobenfehler beeinflusst) und drittens durch das Ausmaß systematischer Verzerrungen (Bias) in der tatsächlich realisierten Stichprobe. Im Marketingkontext sind Stichproben grundlegend für alle quantitativen Befragungen, für A/B-Tests im digitalen Marketing, für Panels zur Marktverfolgung sowie für die statistische Qualitätssicherung von Datenprodukten.
Erläuterung
Das Konzept der Stichprobe ist eng mit der Inferenzstatistik verbunden: Aus einer Stichprobe geschätzte Kennzahlen (z. B. Mittelwerte, Anteile) sind mit Unsicherheit behaftet, die durch Konfidenzintervalle quantifiziert wird. Der Stichprobenfehler (Sampling Error) ist die zufällige Abweichung zwischen dem Stichprobenergebnis und dem wahren Populationswert. Er nimmt mit steigendem Stichprobenumfang ab – und zwar proportional zur Wurzel aus n, was bedeutet, dass eine Verdopplung der Stichprobengröße die Genauigkeit nur um den Faktor √2 (ca. 41 %) verbessert.
Neben dem zufälligen Stichprobenfehler gibt es systematische Verzerrungen (Bias), die durch eine unzureichende Stichprobenziehung entstehen und durch eine noch so große Stichprobe nicht beseitigt werden können. Häufige Biasquellen sind: Selbstselektion (nur bestimmte Personengruppen nehmen freiwillig teil), Coverage Bias (Teile der Grundgesamtheit sind im Auswahlrahmen nicht enthalten), Non-Response Bias (Personen, die nicht antworten, unterscheiden sich systematisch von Antwortenden) und Social-Desirability Bias (Befragte antworten so, wie sie denken, dass es erwartet wird).
Die notwendige Stichprobengröße hängt vom gewünschten Konfidenzniveau (üblicherweise 95 %), der akzeptierten Fehlertoleranz (Margin of Error) und der erwarteten Varianz des zu messenden Merkmals ab. Für Anteilsschätzungen gilt: n = z² × p × (1-p) / e², wobei z der z-Wert für das Konfidenzniveau, p die erwartete Auftretenswahrscheinlichkeit und e die gewünschte Fehlertoleranz ist. Bei p = 0,5 (maximale Varianz) und e = 0,05 ergibt sich für ein 95%-Konfidenzniveau eine Mindeststichprobengröße von ca. 384 Elementen. Für Subgruppenanalysen muss für jede relevante Untergruppe eine ausreichende Fallzahl eingeplant werden.
Im digitalen Marketing sind Stichprobenfragen besonders bei A/B-Tests relevant: Ein zu kleines Sample führt zu einer unzureichenden statistischen Power – der Fähigkeit des Tests, einen tatsächlich vorhandenen Effekt zu erkennen. Eine Power von 80 % gilt als Mindeststandard; sie bedeutet, dass ein echter Effekt mit 80-prozentiger Wahrscheinlichkeit als statistisch signifikant erkannt wird. Vor jedem A/B-Test sollte eine Power-Analyse durchgeführt werden, die Mindestlaufzeit und Mindest-Trafficzahlen bestimmt.
Referenzen: Cochran (1977): "Sampling Techniques". Wiley. – Lohr (2019): "Sampling: Design and Analysis". CRC Press. – Groves et al. (2009): "Survey Methodology". Wiley. – Diekmann (2016): "Empirische Sozialforschung". Rowohlt. – Kohavi/Tang/Xu (2020): "Trustworthy Online Controlled Experiments". Cambridge University Press.
Stichprobenverfahren im Vergleich
- Einfache Zufallsstichprobe: Jedes Element der Grundgesamtheit hat die gleiche Auswahlwahrscheinlichkeit; Ziehung durch Zufallszahlen aus vollständigem Auswahlrahmen – theoretisch ideal, praktisch oft durch fehlende Auswahlrahmen begrenzt.
- Systematische Stichprobe: Jedes k-te Element einer geordneten Liste wird gezogen (z. B. jeder 10. Eintrag in einer Kundendatenbank) – praktisch einfach umzusetzen, aber anfällig bei periodischen Mustern in der Liste.
- Geschichtete Stichprobe: Grundgesamtheit wird in Schichten (Strata) unterteilt, aus jeder Schicht wird proportional oder disproportional gezogen – erhöht Präzision bei bekannter Schichtenstruktur und ermöglicht Subgruppenanalysen.
- Klumpenstichprobe: Auswahl ganzer natürlicher Gruppen (Haushalte, Schulklassen, Filialen) per Zufall; innerhalb der Klumpen Vollerhebung oder weitere Stichprobenziehung – kostengünstig, aber weniger effizient (Design Effect zu beachten).
- Quotenstichprobe: Vorgabe von Quoten für Merkmalsgruppen; Auswahl innerhalb der Quoten nicht zufällig – weit verbreitet in der kommerziellen Marktforschung, erfüllt das Zufallsprinzip nur eingeschränkt.
Stichproben im digitalen Marketing
- A/B-Test-Stichprobengröße: Power-Analyse vor Teststart bestimmt die Mindestanzahl an Nutzern pro Variante; Unterschreitung führt zu unzuverlässigen Ergebnissen und falschen Optimierungsentscheidungen.
- Online-Panel-Qualität: Kommerziell verfügbare Online-Panels weisen systematische Zusammensetzungsverzerrungen auf (überrepräsentiert: digital-affine, incentive-sensible Bevölkerungsgruppen); Gewichtung ist Standard, aber keine vollständige Korrektur.
- Sampling in Analytics-Tools: Google Analytics 4 und ähnliche Tools verwenden bei großen Datenmengen Sampling – d. h., nur ein Teil der Ereignisse wird verarbeitet; bei Business-kritischen Entscheidungen auf ungesampelte Daten zurückgreifen.
- Holdout-Gruppen: Im Conversion-Rate-Optimierung und im CRM werden Holdout-Samples (Kontrollgruppen, die keine Maßnahme erhalten) genutzt, um den inkrementellen Effekt einer Intervention zu messen.