CRO 7 Min. Lesezeit
Blog

A/B-Testing: Warum 57 % deiner Testsieger falsch sind

Ein Test, der zu früh gestoppt wird, fühlt sich trotzdem nach einem klaren Ergebnis an. Das macht diesen Fehler so gefährlich: Er sieht aus wie Wissenschaft, ist aber meist Wunschdenken mit einer Farbe.

Daniel FuchsVon , Performance Marketing Freelancer · Aktualisiert am 17.09.2026
Zwei Spielwürfel auf dunklem Untergrund, Symbolbild für Wahrscheinlichkeit

Der häufigste und teuerste Fehler im CRO

Einen Testsieger zu früh zu erklären ist der mit Abstand häufigste Fehler im A/B-Testing. Die Zahl dahinter ist deutlicher, als man erwarten würde: 57 Prozent der als Sieger erklärten A/B-Tests hätten bei korrekter, vollständiger Stichprobengröße nie statistische Signifikanz erreicht. Das bedeutet, dass mehr als jede zweite Entscheidung, die auf einem verfrühten Testergebnis basiert, in Wahrheit auf Zufall statt auf einem echten Unterschied beruht.

Wie dieser Fehler in der Praxis entsteht

Die beiden größten Übeltäter sind P-Hacking und das Problem multipler Vergleiche. Beide lassen schwache Ideen stärker aussehen, als sie sind, und beide führen dazu, dass Teams auf falsch-positive Ergebnisse skalieren. Typisch dafür: Ergebnisse werden zu häufig kontrolliert, der Test wird gestoppt, sobald eine Variante zufällig die Schwelle überschreitet, Daten werden so lange aufgeteilt, bis irgendetwas positiv aussieht, oder Varianten werden so lange neu laufen gelassen, bis ein Sieger erscheint. Jede dieser Praktiken erhöht die Wahrscheinlichkeit eines falschen Ergebnisses erheblich, ganz ohne dass es sich für das Team wie Manipulation anfühlt.

57%
der Testsieger wären bei korrekter Stichprobe nicht signifikant
1.000+
Nutzer:innen pro Variante als gängiger Mindestwert
≥14 Tage
empfohlene Mindestlaufzeit für einen vollen Geschäftszyklus
Verfrühter Stopp Volle Stichprobe Ergebnis schwankt, bevor es sich stabilisiert

Frequentistisch oder Bayesianisch: die Wahl ist keine Formsache

Der frequentistische Ansatz arbeitet mit einer fest vorab berechneten Stichprobengröße und p-Werten und passt gut, wenn eine große Stichprobe verfügbar ist und eine klare, binäre Entscheidung getroffen werden muss. Der Bayesianische Ansatz liefert dagegen Wahrscheinlichkeitsaussagen wie "es besteht eine 85-prozentige Chance, dass diese Variante besser ist" und eignet sich besonders bei kleineren Stichproben oder wenn Vorwissen in die Auswertung einfließen soll. Nur beim frequentistischen Vorgehen muss die Stichprobengröße vorab berechnet werden, beim Bayesianischen Ansatz entfällt dieser Schritt, was ihn in schnelllebigen Testumgebungen praktikabler macht.

Die Mindestanforderungen, an denen sich niemand vorbeimogeln sollte

Als praktikable Faustregel gilt eine Mindeststichprobe von rund 1.000 Nutzer:innen pro Variante für belastbare Ergebnisse bei Conversion-Rate-Tests. Ein Test sollte außerdem lang genug laufen, um mindestens einen vollen Geschäftszyklus abzudecken, meist mindestens sieben Tage, viele Organisationen fahren mit vierzehn Tagen deutlich sicherer, weil sich dadurch tägliche Schwankungen ausgleichen und unterschiedliches Nutzerverhalten über die Woche hinweg sichtbar wird.

Uplift und tatsächliche Umsatzsteigerung sind nicht dasselbe

Ein verbreiteter Interpretationsfehler ist, die prozentuale Uplift-Zahl eines Tests mit der tatsächlichen Umsatzsteigerung zu verwechseln. Ein Uplift von 15 Prozent in der Conversion-Rate eines Testsegments bedeutet nicht automatisch 15 Prozent mehr Gesamtumsatz, wenn dieses Segment nur einen Teil des gesamten Traffics ausmacht oder saisonale Effekte mit hineinspielen. Wer Testergebnisse eins zu eins auf den Jahresumsatz hochrechnet, überschätzt den tatsächlichen Effekt fast immer deutlich.

Statistische Signifikanz zu ignorieren ist einer der Hauptgründe, warum viele A/B-Testergebnisse in der Praxis irreführend oder schlicht nicht reproduzierbar sind. Ein Test, der sich richtig anfühlt, ist kein Ersatz für einen Test, der die eigene Mindeststichprobe tatsächlich erreicht hat.

Wie man sich diszipliniert vor den eigenen Fehlern schützt

Der wirksamste Schutz gegen verfrühte Entscheidungen ist simpel, aber unbequem: Stichprobengröße und Testdauer vorab festlegen und sich verpflichten, das Ergebnis erst nach Erreichen dieser Schwelle anzusehen, statt täglich mitzufiebern. Jede zwischenzeitliche Kontrolle erhöht die Versuchung, bei einem zufällig guten Zwischenstand vorzeitig zu stoppen. Ein zweiter wirksamer Schutz ist, nicht gleichzeitig viele Varianten gegeneinander zu testen und dann die scheinbar beste auszuwählen, denn je mehr Vergleiche gleichzeitig laufen, desto höher die Wahrscheinlichkeit, dass allein durch Zufall eine Variante gut aussieht, ohne es wirklich zu sein.

Wie wir Tests bei Kunden auswerten

Wir legen Stichprobengröße und Mindestlaufzeit vor dem Start eines Tests fest, nicht danach, und entscheiden nichts, bevor die Signifikanzschwelle erreicht ist. Das ist Teil unseres Growth- & CRO-Angebots und ergänzt unsere CRO-Checkliste, denn die besten Hebel nützen wenig, wenn die Testauswertung methodisch wackelt.

Test-Check

Sind deine letzten Testergebnisse wirklich belastbar?

Im kostenlosen Erstgespräch schauen wir uns deine Testmethodik konkret an.

Kostenlosen Außenblick anfragen
  • Kostenlos und unverbindlich
  • Antwort in der Regel innerhalb von 24 Stunden
DanielDein fester Ansprechpartner