Incrementality Testing
Definition: Incrementality Testing (deutsch: Inkrementalitätstest oder Wirkungszusatztest) ist ein kausalanalytisches Verfahren im Performance Marketing, das präzise misst, welcher Anteil der erzielten Conversions, des Umsatzes oder anderer Zielgrössen tatsächlich durch eine bestimmte Marketingmaßnahme ausgelöst wurde und ohne diese Maßnahme nicht entstanden wäre. Es beantwortet damit die fundamental wichtige Frage: “Was wäre passiert, wenn wir diese Werbung nicht geschaltet hätten?” – den sogenannten kontrafaktischen Zustand. Incrementality Testing basiert auf dem Prinzip kontrollierter Experimente (Randomized Controlled Trials, RCTs): Eine zufällig ausgewählte Testgruppe wird der Marketingmaßnahme ausgesetzt, während eine vergleichbare Kontrollgruppe sie nicht sieht. Die Differenz in den Konversionsraten beider Gruppen entspricht dem tatsächlichen inkrementellen Beitrag der Maßnahme. Damit gilt Incrementality Testing als Goldstandard der Marketing-Wirkungsmessung und überwindet die fundamentalen Schwächen klassischer Attribution-Modelle, die oft Conversions zählen, die ohnehin stattgefunden hätten.
Erläuterung
Das grundlegende Problem klassischer Marketing-Attribution liegt im sogenannten Selection Bias: Retargeting-Kampagnen beispielsweise sprechen bevorzugt Nutzer an, die bereits starke Kaufabsicht gezeigt haben. Diese Nutzer würden in vielen Fällen auch ohne die zusätzliche Werbeanzeige konvertieren. Last-Click-Attribution oder Multi-Touch-Attribution schreibt diesen Conversions jedoch vollständig oder teilweise dem Retargeting-Kanal zu und überschätzt so dessen Wirkung erheblich. Incrementality Testing löst dieses Problem, indem es einen echten kausalen Effekt identifiziert: den Uplift, den die Maßnahme über das Baseline-Verhalten der Kontrollgruppe hinaus erzeugt. In der Praxis werden drei Hauptansätze unterschieden: Erstens Ghost-Ad-Tests (oder Holdout-Tests auf Nutzerbasis), bei denen einer zufälligen Untergruppe der Zielgruppe keine Anzeige gezeigt wird (oder eine Platzhalteranzeige zu einem anderen Thema), während die restliche Gruppe die echte Anzeige sieht. Diese Methode funktioniert gut für digitale Kanäle, bei denen individuelle Nutzer zuverlässig identifiziert werden können. Zweitens Geo-Experimente, bei denen vergleichbare Regionen randomisiert in Test- und Kontrollgruppen eingeteilt werden – ideal für Kanäle wie TV, Out-of-Home oder Radiowerbung, bei denen nutzerindividuelles Targeting nicht möglich ist. Google bietet dafür das Tool “Geographic Experiment” in Google Ads an. Drittens Switchback-Tests (Time-based Experiments), bei denen die Maßnahme in alternierenden Zeitperioden an- und abgeschaltet wird, was besonders bei Marktplätzen oder kontextabhängigen Umgebungen (z. B. Lieferdienste) eingesetzt wird. Die Stärke des Incrementality Testings liegt in seiner kausalen Validität; die Schwäche in der Notwendigkeit, einer Kontrollgruppe die potenzielle Werbewirkung vorzuenthalten, was kurzfristig zu Umsatzverzicht führt. Zudem erfordern valide Tests ausreichend große Stichproben und eine korrekte statistische Auswertung, einschließlich Poweranalyse vor dem Test. Plattformen wie Meta (Conversion Lift), Google Ads (Campaign Experiments) und Amazon (AMC Audiences) bieten native Tools für Incrementality Tests an. Im wissenschaftlichen Marketing-Kontext werden Incrementality Tests von Autoren wie Causal Impact-Entwickler Brodersen et al. (2015) und Gordon et al. (2019) als unverzichtbare Ergänzung zu attributionsbasierter Messung beschrieben.
Testdesigns im Überblick
- Ghost-Ad-Test / Holdout-Test: Einer zufällig ausgewählten Kontrollgruppe wird anstelle der echten Werbeanzeige entweder keine oder eine Platzhalteranzeige (für ein anderes, nicht konkurrierendes Angebot) ausgespielt. Der Conversion-Uplift der Testgruppe gegenüber der Kontrollgruppe entspricht dem inkrementellen Effekt. Primär geeignet für Display-, Social- und Video-Advertising.
- Geo-Experiment: Vergleichbare geografische Einheiten (z. B. Bundesländer, Städte oder Postleitzahlgebiete) werden randomisiert in eine Test- und eine Kontrollregion eingeteilt. Die Maßnahme wird nur in der Testregion durchgeführt; die Ergebnisdifferenz misst den kausalen Effekt. Geeignet für Offline-Medien, aber auch für digitale Kanäle ohne Nutzer-Targeting.
- Intent-to-Treat-Analyse: Variante des Holdout-Tests, bei der auch Kontrollgruppenmitglieder, die der Anzeige trotzdem begegnen (z. B. durch organische Suche), in der Kontrollgruppe verbleiben. Misst den Effekt des Kampagnen-Einsatzes, nicht der Anzeigen-Auslieferung, und ist damit konservativ, aber robust.
- Switchback-Test: Die Maßnahme wird in alternierenden Zeitfenstern (z. B. stündlich oder täglich) aktiviert und deaktiviert. Besonders geeignet, wenn eine nutzer- oder regionenbezogene Trennung nicht möglich ist, z. B. bei Surge-Pricing-Experimenten.
Anwendungsfälle in der Praxis
- Retargeting-Validierung: Prüfung, ob Retargeting-Kampagnen tatsächlich Conversions erzeugen oder lediglich bereits kaufbereite Nutzer ansprechen, die ohnehin konvertiert hätten (Picking-the-low-hanging-fruit-Problem).
- Kanaloptimierung: Vergleich des inkrementellen ROAS (iROAS) verschiedener Marketingkanäle, um das Budget in die Kanäle mit dem höchsten echten Uplift zu verlagern.
- Branding-Wirkungsmessung: Messung des inkrementellen Effekts von Brand-Awareness-Kampagnen auf Online-Conversions in definierten Test-Regionen.
Ausgewählte Referenzen
- Gordon, B. R., Zettelmeyer, F., Bhargava, N. & Chapsky, D. (2019). A comparison of approaches to advertising measurement: Evidence from big field experiments at Facebook. Marketing Science, 38(2), 193–225.
- Brodersen, K. H., Gallusser, F., Koehler, J., Remy, N. & Scott, S. L. (2015). Inferring causal impact using Bayesian structural time-series models. Annals of Applied Statistics, 9(1), 247–274.
- Johnson, G. A., Lewis, R. A. & Nubbemeyer, E. I. (2017). Ghost ads: Improving the economics of measuring online ad effectiveness. Journal of Marketing Research, 54(6), 867–884.
- Meta (2022). Conversion Lift: Measuring the true impact of your ads. Meta for Business.
- Vaver, J. & Koehler, J. (2012). Measuring ad effectiveness using geo experiments. Google Technical Report.