A/B-Testing: Warum 57 % deiner Testsieger falsch sind
Ein Test, der zu früh gestoppt wird, fühlt sich trotzdem nach einem klaren Ergebnis an. Das macht diesen Fehler so gefährlich: Er sieht aus wie Wissenschaft, ist aber meist Wunschdenken mit einer Farbe.
Der häufigste und teuerste Fehler im CRO
Einen Testsieger zu früh zu erklären ist der mit Abstand häufigste Fehler im A/B-Testing. Die Zahl dahinter ist deutlicher, als man erwarten würde: 57 Prozent der als Sieger erklärten A/B-Tests hätten bei korrekter, vollständiger Stichprobengröße nie statistische Signifikanz erreicht. Das bedeutet, dass mehr als jede zweite Entscheidung, die auf einem verfrühten Testergebnis basiert, in Wahrheit auf Zufall statt auf einem echten Unterschied beruht.
Wie dieser Fehler in der Praxis entsteht
Die beiden größten Übeltäter sind P-Hacking und das Problem multipler Vergleiche. Beide lassen schwache Ideen stärker aussehen, als sie sind, und beide führen dazu, dass Teams auf falsch-positive Ergebnisse skalieren. Typisch dafür: Ergebnisse werden zu häufig kontrolliert, der Test wird gestoppt, sobald eine Variante zufällig die Schwelle überschreitet, Daten werden so lange aufgeteilt, bis irgendetwas positiv aussieht, oder Varianten werden so lange neu laufen gelassen, bis ein Sieger erscheint. Jede dieser Praktiken erhöht die Wahrscheinlichkeit eines falschen Ergebnisses erheblich, ganz ohne dass es sich für das Team wie Manipulation anfühlt.
Frequentistisch oder Bayesianisch: die Wahl ist keine Formsache
Der frequentistische Ansatz arbeitet mit einer fest vorab berechneten Stichprobengröße und p-Werten und passt gut, wenn eine große Stichprobe verfügbar ist und eine klare, binäre Entscheidung getroffen werden muss. Der Bayesianische Ansatz liefert dagegen Wahrscheinlichkeitsaussagen wie "es besteht eine 85-prozentige Chance, dass diese Variante besser ist" und eignet sich besonders bei kleineren Stichproben oder wenn Vorwissen in die Auswertung einfließen soll. Nur beim frequentistischen Vorgehen muss die Stichprobengröße vorab berechnet werden, beim Bayesianischen Ansatz entfällt dieser Schritt, was ihn in schnelllebigen Testumgebungen praktikabler macht.
Die Mindestanforderungen, an denen sich niemand vorbeimogeln sollte
Als praktikable Faustregel gilt eine Mindeststichprobe von rund 1.000 Nutzer:innen pro Variante für belastbare Ergebnisse bei Conversion-Rate-Tests. Ein Test sollte außerdem lang genug laufen, um mindestens einen vollen Geschäftszyklus abzudecken, meist mindestens sieben Tage, viele Organisationen fahren mit vierzehn Tagen deutlich sicherer, weil sich dadurch tägliche Schwankungen ausgleichen und unterschiedliches Nutzerverhalten über die Woche hinweg sichtbar wird.
Uplift und tatsächliche Umsatzsteigerung sind nicht dasselbe
Ein verbreiteter Interpretationsfehler ist, die prozentuale Uplift-Zahl eines Tests mit der tatsächlichen Umsatzsteigerung zu verwechseln. Ein Uplift von 15 Prozent in der Conversion-Rate eines Testsegments bedeutet nicht automatisch 15 Prozent mehr Gesamtumsatz, wenn dieses Segment nur einen Teil des gesamten Traffics ausmacht oder saisonale Effekte mit hineinspielen. Wer Testergebnisse eins zu eins auf den Jahresumsatz hochrechnet, überschätzt den tatsächlichen Effekt fast immer deutlich.
Wie man sich diszipliniert vor den eigenen Fehlern schützt
Der wirksamste Schutz gegen verfrühte Entscheidungen ist simpel, aber unbequem: Stichprobengröße und Testdauer vorab festlegen und sich verpflichten, das Ergebnis erst nach Erreichen dieser Schwelle anzusehen, statt täglich mitzufiebern. Jede zwischenzeitliche Kontrolle erhöht die Versuchung, bei einem zufällig guten Zwischenstand vorzeitig zu stoppen. Ein zweiter wirksamer Schutz ist, nicht gleichzeitig viele Varianten gegeneinander zu testen und dann die scheinbar beste auszuwählen, denn je mehr Vergleiche gleichzeitig laufen, desto höher die Wahrscheinlichkeit, dass allein durch Zufall eine Variante gut aussieht, ohne es wirklich zu sein.
Wie wir Tests bei Kunden auswerten
Wir legen Stichprobengröße und Mindestlaufzeit vor dem Start eines Tests fest, nicht danach, und entscheiden nichts, bevor die Signifikanzschwelle erreicht ist. Das ist Teil unseres Growth- & CRO-Angebots und ergänzt unsere CRO-Checkliste, denn die besten Hebel nützen wenig, wenn die Testauswertung methodisch wackelt.
Sind deine letzten Testergebnisse wirklich belastbar?
Im kostenlosen Erstgespräch schauen wir uns deine Testmethodik konkret an.
- Kostenlos und unverbindlich
- Antwort in der Regel innerhalb von 24 Stunden