Marketing Glossar

2.413 Fachbegriffe aus 22 Bereichen des Online Marketings

Testdauer

Definition: Die Testdauer eines A/B-Tests oder multivariaten Tests bezeichnet den Zeitraum vom Start der Traffic-Aufteilung bis zum planmäßigen Ende der Datenerhebung und Ergebnisauswertung. Berechnung: Laufzeit (Tage) = (2 × erforderliche Stichprobengröße pro Variante) ÷ Tages-Traffic der Testseite (Unique Users); anschließend auf vollständige Kalenderwochen aufrunden. Drei kritische Mindestanforderungen an die Testdauer: (1) Stichproben-Anforderung erfüllt: genug Conversions für die erforderliche statistische Teststärke (Power ≥ 80%); (2) Wochentags-Coverage: mindestens 2 vollständige Kalenderwochen um Montag-bis-Freitag-Verhalten und Wochenend-Verhalten in beiden Varianten gleich zu gewichten; (3) Novelty-Effect-Abklingen: bei starken Design-Änderungen mindestens 3–4 Wochen damit der anfängliche Neuheitseffekt (bessere Performance der Variante allein durch Neuheit) abklingt und das reale langfristige Verhalten messbar wird. Maximale Testdauer: über 8 Wochen ist keine sinnvolle Untergrenze; wenn 8 Wochen für die Stichprobe nicht ausreichen, ist der Test aufgrund zu kleinen MDE oder zu geringen Traffics nicht valide durchführbar.

Erläuterung

Die Testdauer-Problematik ist eines der am meisten unterschätzten Qualitätsprobleme in der CRO-Praxis. Ron Kohavi, Diane Tang und Ya Xu («Trustworthy Online Controlled Experiments», Cambridge University Press, 2020) identifizierten in einer Auswertung von Tausenden Experimenten bei Microsoft, Amazon und Airbnb drei systematische Fehlerquellen bei der Testdauer-Planung: erstens vorzeitiger Test-Stop (Peeking), der Typ-I-Fehler-Raten von bis zu 30% erzeugt; zweitens zu kurze Tests ohne vollständige Wochentags-Abdeckung, die Wochentag-Bias erzeugen (CVR unterscheidet sich bei vielen E-Commerce-Sites Montag bis Freitag um 15–40% vom Wochenend-Wert); drittens der Novelty Effect der von Robert Calder und Brian Sternthal (Journal of Marketing Research, 1980) im Kontext von Werbemitteleffekten beschrieben wurde und im CRO zu systematischer Überschätzung von Varianten-Uplifts in kurzen Tests führt: wenn Nutzer eine neue Seiten-Version sehen, erzeugt die Neuheit selbst kurzfristig erhöhtes Engagement das innerhalb von 2–4 Wochen auf das reale Niveau zurückfällt. Evan Miller («How Not To Run An A/B Test», 2010) quantifizierte den Wochentags-Effekt durch Simulation: ein Test der nur Montag bis Mittwoch läuft kann allein durch Wochentags-Bias einen scheinbaren CVR-Unterschied von 8% erzeugen ohne jede echte Varianten-Wirkung. Craig Sullivan (CRO-Experte, «The Web Analytics Bible»; Gründer Optimal Visit, UK) prägte die Praxis-Regel «Mindestens zwei Business-Cycles» – wobei ein Business-Cycle für B2C E-Commerce eine Woche, für B2B SaaS ein Monat (inklusive Monatsend-Buchungs-Peak) und für saisonale Geschäfte eine volle Saisonperiode bedeutet.

Wochentags-Effekt, Saisonalität und Test-Timing

Testdauer-Kalkulator, Verlängerung und Abbruch

Praxistipp: Erstellen Sie einen CRO-Testkalender für das gesamte Quartal bevor Sie auch nur einen Test starten: Tragen Sie alle bekannten Marketing-Aktionen, Feiertage und saisonalen Peaks ein und markieren Sie die Perioden in denen kein Test starten oder enden darf. Berechnen Sie dann für jeden geplanten Test die Laufzeit und planen Sie Start und Ende so dass saisonale Perioden vollständig innerhalb oder außerhalb der Laufzeit liegen, nie aber mittendrin. Diese Kalender-Disziplin verhindert die häufigste Fehlerquelle in CRO-Programmen: Tests die zufällig über Black Friday oder Weihnachten laufen und Ergebnisse liefern die außerhalb dieser Periode nicht reproduzierbar sind.