Konfidenzintervall
Definition: Das Konfidenzintervall (KI; englisch: Confidence Interval; CI) ist ein statistischer Wertebereich der mit einer definierten Wahrscheinlichkeit (typisch: 95%) den wahren Populationsparameter enthält. Im A/B-Test-Kontext beschreibt das 95%-KI den Bereich in dem der tatsächliche CVR-Uplift der getesteten Variante liegt: z. B. bedeutet ein KI von [+0,3%; +1,8%] dass der echte Uplift mit 95% Wahrscheinlichkeit zwischen 0,3 und 1,8 Prozentpunkten liegt. Signifikanzregel: wenn das KI die Null nicht einschließt (also vollständig positiv oder vollständig negativ ist) entspricht dies statistischer Signifikanz bei α=0,05 (p<0,05); schließt das KI die Null ein ist das Ergebnis nicht signifikant. Praktische Signifikanz: das KI liefert neben dem p-Wert die wichtigere Information für CRO-Entscheidungen – nicht nur «ist der Effekt signifikant?» sondern «wie groß könnte der Effekt minimal/maximal sein?»; ein KI [+0,01%; +0,8%] ist statistisch signifikant aber praktisch möglicherweise irrelevant wenn der Minimum Detectable Effect (MDE) +0,5 Prozentpunkte war.
Erläuterung
Das Konzept des Konfidenzintervalls wurde von dem polnisch-amerikanischen Statistiker Jerzy Neyman (1894–1981; University of California, Berkeley) 1937 in seinem Paper «Outline of a Theory of Statistical Estimation Based on the Classical Theory of Probability» (Philosophical Transactions of the Royal Society A) formalisiert. Neyman entwickelte das KI als Alternative zu punktbasierten Schätzungen und stellte klar dass ein KI keine Wahrscheinlichkeitsaussage über den wahren Parameter macht sondern über das Verfahren: «95% der nach dieser Methode berechneten Intervalle werden den wahren Parameter enthalten.» Diese subtile aber wichtige Unterscheidung ist die häufigste Fehlinterpretation des Konfidenzintervalls auch unter CRO-Praktikern. Im A/B-Testing-Kontext popularisierten Ron Kohavi (Microsoft; Amazon; «Trustworthy Online Controlled Experiments», 2020) und Lukas Vermeer (Booking.com) die Verwendung von Konfidenzintervallen als primäre Kommunikationsmetrik statt p-Werte: Konfidenzintervalle kommunizieren die praktische Bedeutung eines Test-Ergebnisses («Der Uplift liegt wahrscheinlich zwischen X% und Y%») verständlicher als p-Werte («p=0,04») die für nicht-statistische Stakeholder wenig intuitiv sind. George W. Cobb (Mount Holyoke College; «The Basic Practice of Statistics», 1997, Freeman) und Evan Miller («How Not To Run An A/B Test», Blog-Post 2010) trugen zur Aufklärung über häufige Konfidenzintervall-Fehlinterpretationen in Marketing-Teams bei.
KI-Berechnung und Interpretation im A/B-Test
- 95%-KI für CVR-Unterschied (Zwei-Proportionen-Test): Gegeben: Kontrolle: n_c = 5.000 Besucher; Conversions_c = 100; CVR_c = 2,00%; Behandlung: n_t = 5.000 Besucher; Conversions_t = 130; CVR_t = 2,60%; CVR-Differenz (Uplift): 2,60% – 2,00% = +0,60 Prozentpunkte; Standardfehler der Differenz: SE = √(CVR_c×(1-CVR_c)/n_c + CVR_t×(1-CVR_t)/n_t) = √(0,02×0,98/5000 + 0,026×0,974/5000) ≈ 0,00298; 95%-KI: Uplift ± 1,96 × SE = 0,60% ± 1,96 × 0,298% = [+0,02%; +1,18%]; Interpretation: das KI schließt die Null nicht ein (0,02% > 0) → statistisch signifikant; der wahre Uplift liegt mit 95% Wahrscheinlichkeit zwischen +0,02 und +1,18 Prozentpunkten; Unsicherheit: breites KI zeigt dass der tatsächliche Effekt von sehr klein (+0,02%) bis moderat (+1,18%) reichen kann; bei dieser Unsicherheit: weitere Traffic-Sammlung könnte das KI verengen
- KI-Breite und Stichprobengröße: Fundamentale Beziehung: KI-Breite ∝ 1/√n (umgekehrt proportional zur Wurzel der Stichprobengröße); Beispiel: bei n=1.000/Variante: KI ≈ ±2,0 Prozentpunkte; bei n=4.000/Variante: KI ≈ ±1,0 Prozentpunkte (halb so breit bei 4× Stichprobe); bei n=16.000/Variante: KI ≈ ±0,5 Prozentpunkte (viertel so breit bei 16× Stichprobe); Praktische Implikation: Traffic-arme Websites haben zwangsläufig breite KIs; breite KIs bedeuten hohe Unsicherheit über Effektgröße; bei sehr breiten KIs: auch ein statistisch signifikantes Ergebnis sollte mit Vorsicht implementiert werden; Power-Analyse vor Test-Start: berechnen wie viel Traffic für eine KI-Breite von ±X% bei gegebener Baseline-CVR notwendig ist
- KI vs. p-Wert: Kommunikation an Stakeholder: p-Wert: gibt Wahrscheinlichkeit an das beobachtete Ergebnis unter der Nullhypothese zu erhalten; wenig intuitiv für nicht-statistische Stakeholder; häufige Fehlinterpretation: «p=0,03 bedeutet 97% Wahrscheinlichkeit dass Variante besser ist» (falsch!); KI als Kommunikationsinstrument: «Der Uplift liegt wahrscheinlich zwischen +0,3 und +1,5 Prozentpunkten»; für Management verständlicher; kommuniziert Bandbreite möglicher Effekte; ermöglicht Business-Entscheidung: «Lohnt sich die Implementierung wenn der Effekt vielleicht nur +0,3 Prozentpunkte beträgt?»; Kombination: p-Wert (Signifikanz-Entscheidung) + KI (Effektgröße-Schätzung) + Punktschätzer (beste Schätzung des Uplifts) = vollständige Test-Ergebnis-Kommunikation
Häufige KI-Fehlinterpretationen und CRO-Implikationen
- Die 5 häufigsten KI-Fehlinterpretationen: Fehler 1: «Das 95%-KI enthält den wahren Wert mit 95% Wahrscheinlichkeit» (falsch: das berechnete Intervall enthält den wahren Wert entweder oder nicht; die 95% beziehen sich auf das Verfahren; korrekt: 95% aller nach dieser Methode berechneten Intervalle enthalten den wahren Wert); Fehler 2: «Breites KI bedeutet schwacher Effekt» (falsch: breites KI bedeutet hohe Unsicherheit; der Effekt kann trotzdem groß sein); Fehler 3: «Überlappende KIs bedeuten kein signifikanter Unterschied» (falsch: zwei überlappende KIs schließen statistische Signifikanz nicht aus; der Zwei-Stichproben-Test muss direkt berechnet werden); Fehler 4: «Schmales KI um Null herum bedeutet definitiv kein Effekt» (falsch: schmales KI bedeutet präzise Schätzung; wenn beide Grenzen sehr nahe an Null liegen ist der Effekt sehr klein aber nicht null); Fehler 5: «95%-KI = 95% Wahrscheinlichkeit dass nächste Test gleich ausfällt» (replication confusion)
- Praktische Signifikanz und KI: Praktische Signifikanz-Test: vor jedem A/B-Test Minimum Detectable Effect (MDE) definieren; z. B. MDE = +0,5 Prozentpunkte CVR (darunter lohnt sich die Implementierung nicht); nach Test: wenn KI [+0,01%; +0,8%] dann: statistisch signifikant (KI schließt Null nicht ein); aber: untere KI-Grenze (0,01%) deutlich unter MDE (0,5%); Entscheidung: Implementierung mit Unsicherheit; follow-up Test mit mehr Traffic empfohlen; wenn KI [+0,6%; +2,1%] dann: KI-Untergrenze > MDE → sowohl statistisch als auch praktisch signifikant; Implementierung empfohlen; EUR-Impact-Berechnung: statt Punkt-Uplift den konservativen KI-Rand für konservative Umsatz-Prognose nutzen; Beispiel: KI [+0,3%; +1,5%] → konservative Prognose basierend auf +0,3% Uplift berechnen
- KI in A/B-Test-Tools und Reporting: A/B-Test-Tool-Ausgaben: Optimizely, VWO, AB Tasty zeigen 95%-KIs standardmäßig in Test-Ergebnis-Berichten; Empfehlung: KI immer gemeinsam mit p-Wert und Stichprobengröße dokumentieren; Test-Dokumentationsformat: «Variante B: CVR = 2,6% (+0,6 PP; +30% relativ); 95%-KI: [+0,02%; +1,18%]; p = 0,048; n = 10.000 gesamt»; GA4-Limitation: GA4 Funnel-Berichte zeigen keine Konfidenzintervalle; für KI-Berechnung: eigene Berechnungen in Google Sheets (Evan Miller's Significance Calculator oder eigene Formel) oder dediziertes A/B-Test-Tool verwenden; Bayesianisches Äquivalent: Credible Interval (Glaubwürdigkeitsintervall) hat ähnliche intuitive Interpretation («der wahre Effekt liegt mit 95% Wahrscheinlichkeit in diesem Bereich») ist aber mathematisch verschieden; Bayesianische A/B-Test-Tools (VWO, AB Tasty optional) zeigen Credible Intervals statt Konfidenzintervalle