Statistische Tests: Stichprobengrösse, Lift und vollfaktorielle Designs

Die meisten A/B Tests, die man mir zeigt, waren entschieden, bevor gerechnet wurde: ein Tool hat den Traffic geteilt, am neunten Tag wurde das Dashboard grün, und das Team hat ausgerollt. Dann ist der Lift leise verschwunden. Dieses Kapitel handelt von der Disziplin, die das verhindert. Ich gehe vom Lift aus, den eine Änderung bringen muss, damit sie sich lohnt, und leite daraus die Stichprobengrösse ab, mit einer Tabelle für deine eigenen Ausgangsraten. Dann fahre ich ein vollfaktorielles zwei mal zwei mal zwei Design auf der Werkbank Preisseite, sechstausend Besucher über Headline, Preisanker und Beweis, und zeige, wie der Anker allein schadet und neben dem Beweis stark hilft, eine Interaktion, die kein Test einer einzelnen Sache je sehen könnte. Unterwegs: der z Test für zwei Anteile, warum das Konfidenzintervall des Lifts mehr zählt als der p Wert, wie Spicken am Dashboard deine falsch positiven Ergebnisse aufbläht, und wann ein Test sich schlicht nicht lohnt. Das ist Teil 20 von 21 der Marketing Analytics Serie.

Alle wollen testen, wenige testen gut

Ein Gründer von Werkbank, dem Rails SaaS für Handwerksbetriebe aus dieser Serie, hat mir im Frühjahr eine Folie gezeigt. "Neue Headline auf der Preisseite: plus 31 Prozent Trial Anmeldungen." Der Test lief neun Tage: 41 Trials aus rund 1.050 Besuchern auf der alten Seite, 54 aus etwa gleich vielen auf der neuen. Das Team hatte bereits jede Headline der Website umgeschrieben. Zwei Monate später lag die Trial Rate genau dort, wo sie vorher gewesen war, und niemand konnte sagen, warum.

Unehrlich war daran nichts. Das Team hatte ein Tool, das Traffic aufteilt, und ein Dashboard, das grün wird, und es hat aufgehört, als es grün wurde. Was fehlte, war eine Zahl, die vor dem Start aufgeschrieben war: wie gross der Lift sein muss, wie viele Besucher es braucht, um ihn zu sehen, und was man tut, wenn die Antwort "nichts" lautet. Das ist der ganze Inhalt dieses Kapitels. Die Mathematik ist nicht schwer. Die Disziplin ist es.

Wo das in der Serie steht

Das ist Kapitel 20 von 21 und das erste von Teil fünf, Testen und Big Data. Teil vier hat mit Die Customer Loyalty Journey: von Segmenten zu Erlebnissen geschlossen, wo ich argumentiert habe, dass ein Treueprogramm eine Reihe von Hypothesen darüber ist, was ein Segment als Nächstes tut. Testen ist die Methode, mit der du herausfindest, ob diese Hypothesen gestimmt haben, und sie macht aus jedem früheren Kapitel, von der Elastizität bis zum Mediamix, aus einem Modell eine Entscheidung. Die Serie endet als Nächstes mit Big Data für Marketer: was sich wirklich ändert und was nicht.

Zuerst der Lift, dann die Stichprobengrösse

Fang mit dem an, was dich wirklich interessiert. Nicht "ist B anders als A", sondern "ist B genug besser als A, damit es zählt". Die Grösse dafür ist der Lift:

Lift=pB−pApA\text{Lift} = \frac{p_B - p_A}{p_A}

Dabei ist pAp_A die Conversion Rate der Kontrolle (die heutige Seite) und pBp_B die der Variante. Lift ist relativ: von 4,0 auf 4,6 Prozent sind 15 Prozent Lift, obwohl der absolute Abstand nur 0,6 Prozentpunkte beträgt. Behalte beides im Kopf, denn die Stichprobengrösse hängt vom absoluten Abstand ab, der Business Case wird relativ argumentiert.

Der Lift, den du erkennen musst, ist eine Geschäftszahl, keine statistische. Für Werkbank: rund 2.000 Besucher im Monat erreichen die Preisseite, 4 Prozent starten einen Trial, etwa ein Viertel der Trials wird zahlender Kunde bei 79 Euro im Monat über rund 22 Monate. Ein Lift von 15 Prozent bei den Trials sind drei zusätzliche Trials im Monat, weniger als ein zusätzlicher Kunde, etwa 1.400 Euro Lifetime Umsatz pro Monat, in dem die verbesserte Seite läuft. Das ist der kleinste Effekt, der ein Redesign und einen Test wert ist; darunter ist mir egal, ob etwas "signifikant" ist. Das ist der minimal erkennbare Effekt, und ihn zu wählen ist die wichtigste Entscheidung im Design eines Tests. Ich habe früher schon darüber geschrieben, warum statistische Signifikanz und Fehlermargen im Growth Marketing zählen; hier will ich einen Schritt früher ansetzen, im Moment bevor der Test existiert.

Die Formel für die Stichprobengrösse

Beim Lesen eines Tests sind zwei Fehler möglich. Du kannst einen Gewinner ausrufen, wo keiner ist (falsch positiv, Wahrscheinlichkeit α\alpha), und du kannst einen echten Gewinner übersehen (falsch negativ, Wahrscheinlichkeit β\beta). Die Konventionen sind α=0,05\alpha = 0{,}05 zweiseitig und β=0,20\beta = 0{,}20, also eine Power von 80 Prozent. Das sind Konventionen, keine Gesetze.

Für zwei Conversion Rates ist die Stichprobengrösse pro Variante:

n=(z1−α/2 2 pˉ (1−pˉ)  +  z1−β pA(1−pA)+pB(1−pB))2(pB−pA)2n = \frac{\left( z_{1-\alpha/2}\,\sqrt{2\,\bar p\,(1-\bar p)} \;+\; z_{1-\beta}\,\sqrt{p_A(1-p_A) + p_B(1-p_B)} \right)^2}{(p_B - p_A)^2}

Die Symbole: nn ist die Zahl der Besucher je Arm. pAp_A ist die Ausgangsrate, pBp_B die Rate, die du erkennen willst, also pB=pA(1+Lift)p_B = p_A (1 + \text{Lift}), und pˉ\bar p ihr Mittelwert. z1−α/2z_{1-\alpha/2} ist das Quantil der Standardnormalverteilung für deine Toleranz gegenüber falsch positiven Ergebnissen, 1,96 für einen zweiseitigen Test auf 5 Prozent. z1−βz_{1-\beta} ist das Quantil für deine Power, 0,84 für 80 Prozent. Der Nenner ist der quadrierte absolute Abstand, und dieses Quadrat macht kleine Lifts auf kleinen Ausgangsraten so brutal teuer: halbiere den Abstand, und du brauchst viermal so viele Besucher.

Setzen wir den Werkbank Fall ein. Ausgangsrate 4 Prozent, Ziel 4,6 Prozent, Abstand 0,006. Die erste Wurzel ergibt 1,96×0,287=0,5621{,}96 \times 0{,}287 = 0{,}562, die zweite 0,84×0,287=0,2410{,}84 \times 0{,}287 = 0{,}241, die Summe zum Quadrat ist 0,646, geteilt durch 0,0062=0,0000360{,}006^2 = 0{,}000036 ergibt rund 17.900 Besucher pro Arm. Sagen wir 18.000 je Arm, 36.000 insgesamt, eineinhalb Jahre bei 2.000 Besuchern der Preisseite im Monat. Der Neun Tage Test mit 1.050 pro Arm hätte verlässlich nur einen Lift von etwa 84 Prozent erkennen können. Das war nie ein Test einer Headline. Das war ein Münzwurf mit Dashboard.

Eine Tabelle der Stichprobengrössen, die du wirklich verwenden kannst

Hier ist die Formel ausgewertet für die Ausgangsraten und Lifts, die mir am häufigsten begegnen. Besucher pro Variante, zweiseitig 5 Prozent, 80 Prozent Power. Die Zahlen folgen exakt aus der Formel, die Szenarien rundherum sind illustrativ.

Ausgangsrate5% Lift10% Lift15% Lift25% Lift50% Lift
1%637.000163.10074.20027.9007.750
2%315.20080.70036.70013.8003.830
4%154.30039.50017.9006.7501.860
8%73.90018.9008.5703.210880
15%36.3009.2604.1901.570420

Zeile für Zeile. Eine Ausgangsrate von 1 Prozent ist ein Checkout auf einer Landing Page mit kaltem Traffic; ein Lift von 5 Prozent braucht dort über 600.000 Besucher pro Arm, für ein kleines Unternehmen also nie. Bei 4 Prozent, einer typischen Trial oder Lead Formular Rate, ist die 15 Prozent Zelle die Werkbank Antwort, 17.900 je Arm. Bei 15 Prozent, einer Warenkorbrate oder der Klickrate einer warmen Liste, ist ein Lift von 25 Prozent mit 1.570 pro Arm erkennbar, zwei Wochen für die meisten Shops. Die Lehre: teste, wo die Ausgangsrate hoch und der Hebel gross ist, weiter oben im Funnel und mit mutigeren Änderungen. Mikroänderungen an Schritten mit niedriger Rate sind für KMU nicht testbar, und kein Tool ändert das.

Nötige Stichprobengrösse pro Variante nach dem Lift, den du erkennen willst, 4 Prozent Ausgangsrate, zweiseitig 5 Prozent, 80 Prozent Power.

A/B Tests versus vollfaktorielle Designs

Ein A/B Test ändert eine Sache. Das ist sauber und langsam, und das tiefere Problem ist, dass eine Preisseite nicht eine Sache ist. Headline, Preisanker und Beweis ziehen gleichzeitig am selben Besucher. Sie nacheinander zu testen dauert dreimal so lang und sagt dir nichts darüber, wie sie zusammenwirken. Das Argument habe ich in warum immer nur eine Sache zu testen dich Geld kostet ausführlich gemacht, hier zeige ich nur die Alternative.

Ein vollfaktorielles Design testet jede Kombination jedes Faktors. Drei Faktoren mit je zwei Stufen sind ein zwei mal zwei mal zwei Design, acht Zellen, und jeder Besucher wird zufällig einer davon zugeteilt. Der Trick, der das bezahlbar macht: jeder Haupteffekt wird aus der gesamten Stichprobe geschätzt. Um die Headline zu messen, vergleichst du die vier Zellen mit Headline eins gegen die vier mit Headline zwei, 3.000 gegen 3.000 in einem Test mit 6.000 Besuchern, genau wie in einem einfachen A/B Test nur der Headline. Drei Tests zum Preis von einem, und die Interaktionen gibt es gratis dazu.

Der Haupteffekt eines Faktors ist die mittlere Differenz über alle Stufen der anderen Faktoren:

HEBeweis=pˉBeweis−pˉkein Beweis\text{HE}_{\text{Beweis}} = \bar p_{\text{Beweis}} - \bar p_{\text{kein Beweis}}

wobei jedes pˉ\bar p die Conversion Rate ist, gepoolt über die vier Zellen, die diese Stufe teilen. Eine Interaktion ist die Differenz von Differenzen: hilft der Anker mehr, wenn Beweis da ist, als wenn er fehlt?

INTAnker×Beweis=(pˉA,P−pˉN,P)−(pˉA,N−pˉN,N)\text{INT}_{\text{Anker} \times \text{Beweis}} = \left(\bar p_{\text{A,P}} - \bar p_{\text{N,P}}\right) - \left(\bar p_{\text{A,N}} - \bar p_{\text{N,N}}\right)

mit A und N für Anker und kein Anker, P und N an zweiter Stelle für Beweis und kein Beweis, jeder Mittelwert gepoolt über beide Headlines.

Das Werkbank Faktorial: acht Zellen, 6.000 Besucher

Werkbank hat die Preisseite ein Quartal lang als zwei mal zwei mal zwei laufen lassen. Headline: die bestehende Feature Headline ("Termine, Angebote und Rechnungen an einem Ort") gegen eine Ergebnis Headline ("Hol dir deine Abende zurück"). Preisanker: der Monatspreis allein gegen den Preis neben den durchgestrichenen Kosten der drei Tools, die er ersetzt. Beweis: nichts gegen eine Leiste mit Kundenlogos und einem namentlichen Zitat eines Tischlers aus Wels. Die Zahlen unten sind illustrativ, 750 Besucher pro Zelle.

ZelleHeadlineAnkerBeweisBesucherTrialsRate
FNNFeatureKeinerKeiner750304,00%
FNPFeatureKeinerLogos750364,80%
FANFeatureAnkerKeiner750253,33%
FAPFeatureAnkerLogos750506,67%
ONNErgebnisKeinerKeiner750344,53%
ONPErgebnisKeinerLogos750405,33%
OANErgebnisAnkerKeiner750293,87%
OAPErgebnisAnkerLogos750547,20%

Zeile für Zeile. FNN ist die Seite, wie sie war, 4,0 Prozent, die Ausgangsrate aus der Stichprobenrechnung. FNP fügt Beweis hinzu und geht auf 4,8. FAN fügt den Anker ohne Beweis hinzu und fällt auf 3,33: ein durchgestrichener Konkurrenzpreis ohne etwas dahinter liest sich wie ein Verkaufstrick. FAP, Anker plus Beweis, springt auf 6,67, weit mehr als die Summe der beiden Einzeländerungen. Die Zeilen mit der Ergebnis Headline wiederholen das Muster etwa einen halben Punkt höher und enden mit der besten Zelle, OAP, bei 7,20 Prozent.

Trial Startrate für jede der acht Zellen. F und O sind Feature und Ergebnis Headline, N und A kein Anker und Anker, N und P kein Beweis und Beweis.

Jetzt die Haupteffekte, jeder aus 3.000 gegen 3.000 Besuchern:

FaktorRate Stufe 1Rate Stufe 2Differenzzp Wert95% KI der Differenz
Headline (Feature vs Ergebnis)4,70%5,23%+0,53 Pkt0,950,34minus 0,57 bis +1,63 Pkt
Anker (keiner vs Anker)4,67%5,27%+0,60 Pkt1,070,28minus 0,50 bis +1,70 Pkt
Beweis (keiner vs Logos)3,93%6,00%+2,07 Pkt3,680,0002+0,97 bis +3,16 Pkt

Beweis ist der einzige klare Haupteffekt: 2,07 Punkte Gewinn, ein relativer Lift von 52 Prozent, und das Intervall bleibt weit weg von null. Die Headline, über die das Team so aufgeregt war, zeigt einen halben Punkt mit einem Intervall von minus 0,57 bis plus 1,63. Das heisst nicht "die Headline tut nichts". Es heisst "6.000 Besucher können dir nicht sagen, was die Headline tut", eine ganz andere und ehrlichere Lesart. Der Haupteffekt des Ankers ist ebenso ein Schulterzucken bei plus 0,6 Punkten, und genau dort verdient sich das Faktorial sein Geld.

Die Interaktion lesen

Schau dir den Anker für sich an. Ohne Beweis bewegt er die Rate von 4,27 auf 3,60 Prozent, minus 0,67 Punkte. Mit Beweis bewegt er sie von 5,07 auf 6,93, plus 1,87 Punkte. Die Differenz dieser Differenzen ist 2,53 Punkte mit einem Standardfehler von etwa 1,12, also z=2,26z = 2{,}26 und p=0,024p = 0{,}024. Der Anker ist kein schwacher Hebel. Er zeigt in entgegengesetzte Richtungen, je nachdem ob die Seite sich das Recht auf einen Preisvergleich verdient hat, und gemittelt über beide Bedingungen heben sich die Hälften zu einem bedeutungslosen plus 0,6 auf.

Hätte Werkbank den Anker allein auf der bestehenden Seite getestet, hätten sie einen Rückgang gemessen, geschlossen, dass Anker bei Handwerkern nicht funktionieren, und es nie wieder versucht. Hätten sie nur den Beweis getestet, hätten sie ihn ausgerollt und den Beitrag des Ankers liegen gelassen. Die Interaktion ist der Befund, und nur ein Design, das beide Faktoren gleichzeitig variiert, kann sie sehen. Mein Vorbehalt: Interaktionen werden mit halber Präzision geschätzt, weil jede Seite der Differenz ein Vergleich von 1.500 gegen 1.500 ist. Bei p=0,024p = 0{,}024 ist diese echt genug, um zu handeln, und nicht so sicher, dass ich eine Preisphilosophie darauf bauen würde. Ich würde OAP ausrollen und Anker gegen kein Anker auf der neuen Seite mit Beweis zur Bestätigung wiederholen.

Ergebnisse lesen: das Intervall, nicht das Urteil

Der z Test für zwei Anteile ist der Standardweg, zwei Raten zu vergleichen:

z=p^B−p^Ap^ (1−p^)(1nA+1nB),p^=xA+xBnA+nBz = \frac{\hat p_B - \hat p_A}{\sqrt{\hat p\,(1-\hat p)\left(\dfrac{1}{n_A} + \dfrac{1}{n_B}\right)}}, \qquad \hat p = \frac{x_A + x_B}{n_A + n_B}

Dabei sind p^A\hat p_A und p^B\hat p_B die beobachteten Raten, xAx_A und xBx_B die Zahl der Conversions, nAn_A und nBn_B die Besucher je Arm und p^\hat p die gepoolte Rate unter der Annahme, dass sich nichts unterscheidet. Ein zz jenseits von 1,96 in eine der beiden Richtungen ist "signifikant auf 5 Prozent", das Uninteressanteste, was der Test dir sagen kann.

Interessant ist das Konfidenzintervall der Differenz:

(p^B−p^A)  ±  z1−α/2 p^A(1−p^A)nA+p^B(1−p^B)nB(\hat p_B - \hat p_A) \;\pm\; z_{1-\alpha/2}\,\sqrt{\frac{\hat p_A(1-\hat p_A)}{n_A} + \frac{\hat p_B(1-\hat p_B)}{n_B}}

Für den Beweis sind das 2,07 Punkte plus oder minus 1,10, also 0,97 bis 3,16 Punkte, relativ ein Lift irgendwo zwischen 25 und 81 Prozent. Diese Breite ist der wahre Stand deines Wissens. Melde "plus 52 Prozent", und die Finanzchefin plant damit; melde "zwischen 25 und 81 Prozent", und sie plant mit dem unteren Ende, was richtig ist. Jedes Entscheidungsmemo, das ich schreibe, trägt das Intervall, und wo es die Null einschliesst, sage ich das in der ersten Zeile.

Einen Test richtig durchführen

Das Protokoll ist kurz, und ich habe noch kein Team gesehen, das es bereut hat, sich daran zu halten.

Das Testprotokoll, das ich verwende. Die Entscheidung, ob überhaupt getestet wird, fällt, bevor ein einziger Besucher aufgeteilt ist.

Drei Details zählen mehr, als das Diagramm vermuten lässt. Randomisiere nach Besucher, nicht nach Tag oder Woche, denn Dienstage konvertieren anders als Samstage. Prüfe den Split am ersten Tag: wenn 750 pro Zelle geplant waren und eine Zelle 640 hat, ist die Zuteilung kaputt und jede nachfolgende Zahl verdächtig. Und wähle eine primäre Metrik, bevor du startest: gestartete Trials, nicht Trials plus Klicks auf Preise plus Scrolltiefe. Sekundäre Metriken erklären das Warum; einen Gewinner küren sie nie.

Sequenzielles Spicken

Der häufigste Weg, auf dem ehrliche Teams sich selbst täuschen, ist der Blick aufs Dashboard. Die Teststatistik wandert, während Daten hereinkommen, und wenn du einen Monat lang jeden Tag hinschaust und am ersten Tag stoppst, an dem sie 1,96 überschreitet, führst du nicht einen Test auf 5 Prozent durch, sondern dreissig, und nimmst den besten. Die Rate falsch positiver Ergebnisse liegt dann ein Mehrfaches über den nominellen 5 Prozent, was du in zehn Minuten mit einem simulierten A/A Test bestätigen kannst, bei dem beide Arme dieselbe wahre Rate haben:

import numpy as np
rng = np.random.default_rng(1)
p, n_day, days, hits = 0.04, 200, 30, 0
for _ in range(2000):
    a = rng.binomial(1, p, n_day * days).cumsum()
    b = rng.binomial(1, p, n_day * days).cumsum()
    for d in range(1, days + 1):
        n = d * n_day
        pa, pb = a[n-1] / n, b[n-1] / n
        pp = (pa + pb) / 2
        se = np.sqrt(pp * (1 - pp) * 2 / n)
        if se > 0 and abs(pb - pa) / se > 1.96:
            hits += 1
            break
print(hits / 2000)   # Anteil der A/A Tests, die einen "Gewinner" fanden

Lass es laufen und du siehst eine Zahl weit über 0,05. Das Heilmittel ist entweder, die Stichprobengrösse vorab festzulegen und einmal am Ende zu lesen, was ich bei den meisten KMU Tests tue, oder eine echte sequenzielle Methode, die das Fehlerbudget über die Blicke verteilt. Letzteres ist in Ordnung, wenn dein Tool eine implementiert und du weisst, welche. Das Tool, das am neunten Tag grün wird, tut das nicht.

Wann ein Test sich nicht lohnt

Ich lehne Tests öfter ab, als ich sie durchführe. Ein Test lohnt sich nicht, wenn die nötige Stichprobe grösser ist als das, was die Seite in etwa einem Quartal sieht, denn bis dahin haben sich Saison, Anzeigenmix und Produkt darunter verändert. Nicht, wenn die Änderung offensichtlich richtig und umkehrbar ist: ein kaputtes Formularfeld braucht keinen Kontrollarm. Nicht, wenn der Wert der Information kleiner ist als die Kosten der Verzögerung, wie bei kleinen Textänderungen auf Seiten mit wenig Traffic. Und nicht, wenn die Organisation ohnehin schon entschieden hat, egal wie das Ergebnis ausfällt. Dann sage ich das, und wir stecken den Aufwand in etwas, das eine Entscheidung noch ändern kann.

Die Alternative zu einem Test ist nicht Raten. Es sind die früheren Kapitel dieser Serie: eine Regression auf historischen Daten, eine Umfrage, ein gut gelesener Funnel. Tests sind der Goldstandard für Kausalität und zugleich das teuerste Instrument im Kasten. Mein Leitfaden zu digitalen Marketing Testmethoden geht die günstigeren Instrumente durch und zeigt, wann welches genügt.

Selbst durchführen

Du brauchst drei Dinge: eine Randomisierung, die einen Besucher einmal zuteilt und sich das merkt (ein Cookie oder eine gehashte Nutzer ID), ein Event, das die primäre Conversion gegen diese Zuteilung festhält, und eine Möglichkeit zu zählen. Jedes Tool funktioniert, für die Auswertung reicht eine Tabelle.

Die Stichprobengrösse in wenigen Zeilen; der z Test ist die Formel oben, je eine Zeile für p^\hat p und zz:

from math import sqrt
from statistics import NormalDist
N = NormalDist()

def sample_size(p_a, lift, alpha=0.05, power=0.8):
    p_b = p_a * (1 + lift); p_bar = (p_a + p_b) / 2
    z_a, z_b = N.inv_cdf(1 - alpha / 2), N.inv_cdf(power)
    num = z_a * sqrt(2 * p_bar * (1 - p_bar)) + z_b * sqrt(p_a * (1 - p_a) + p_b * (1 - p_b))
    return round(num ** 2 / (p_b - p_a) ** 2)

print(sample_size(0.04, 0.15))   # 17943

Bevor du einem Ergebnis vertraust, mach vier Prüfungen. Der Split: liegen die Zellgrössen innerhalb weniger Prozent von dem, was die Randomisierung liefern sollte? Die A/A Prüfung: unterscheiden sich zwei Arme der Kontrolle um weniger, als das Rauschen vorhersagt? Die Segmente: hält der Effekt auf Mobil und Desktop, bei neuen und wiederkehrenden Besuchern, oder treibt ihn ein einziger Schub Bot Traffic an einem Tag? Der Kalender: hat ein Newsletter, eine Preisänderung oder ein Feiertag in Österreich, aber nicht in Grossbritannien, die Arme ungleich getroffen? Erst danach schaue ich auf das Intervall.

Wie lang dauert das? Einen faktoriellen Test mit einem Kunden zu entwerfen ist ein Nachmittag. Ihn laufen zu lassen ist die Stichprobengrösse geteilt durch den täglichen Traffic, und die ehrliche Zahl ist oft länger, als irgendwem gefällt. Ihn zu lesen ist eine Stunde und ein Memo.

Stolperfallen

Auf die Vanity Präzision testen. Teams fragen "wie viele Besucher brauche ich, damit das Ergebnis genau ist", und jemand antwortet mit einer Fehlermarge für eine einzelne Rate. Falsche Frage. Präzision einer Rate ist nicht Power, eine Differenz zu erkennen, und die Differenz, die du brauchst, ist eine Geschäftszahl, die du wählen musst. Hast du sie nicht gewählt, hast du keinen Test entworfen.

Bei Grün stoppen. Oben behandelt und immer noch der häufigste Fehler. Wenn dein Tool frühes Stoppen ohne sequenzielle Korrektur zulässt, leg das Enddatum fest und versteck das Dashboard.

Zu viele Zellen. Vier Faktoren mit drei Stufen sind 81 Zellen, und 6.000 Besucher ergeben 74 pro Zelle. Haupteffekte poolen weiterhin, aber die Interaktionen werden zu Rauschen. Zwei oder drei Faktoren mit zwei Stufen sind der Sweet Spot für KMU Traffic. Teilfaktorielle Designs opfern Interaktionen höherer Ordnung, um Zellen zu sparen, ein fairer Tausch, wenn diese Interaktionen unwahrscheinlich sind.

Der Neuheitseffekt. Eine neue Headline läuft in Woche eins besser, weil wiederkehrende Besucher die Änderung bemerken. Lass den Test lang genug laufen, um ganze Wochenzyklen abzudecken, und schau dir neue Besucher getrennt an. Schrumpft der Effekt Woche um Woche, hast du Neugier gemessen, nicht Präferenz.

Die falsche Metrik. Trial Starts sind um 52 Prozent gestiegen; sind es die zahlenden Kunden auch? Beweis zieht vielleicht Trials von Leuten an, die nie kaufen wollten. Verfolge die primäre Metrik bis zum Geld, wo der Zeitversatz es erlaubt, und prüfe sonst wenigstens, dass die nachgelagerten Raten nicht in die andere Richtung gelaufen sind.

Einen verlorenen Test für einen verschwendeten halten. FAN, Anker ohne Beweis, hat verloren. Das ist eines der nützlichsten Dinge, die Werkbank das ganze Jahr gelernt hat, weil es ein gescheitertes Experiment von vor zwei Jahren erklärt und jeden künftigen Designer warnt. Ein gut entworfener Test, der "schlechter" zurückgibt, hat sich bezahlt gemacht.

So mache ich das für Kunden

Das Ergebnis ist ein Testprogramm, kein einzelner Test. Es beginnt mit dem kostenlosen Workshop, in dem wir jede Änderung auflisten, die irgendjemand an der Schlüsselseite machen wollte, jeder einen Lift und eine Stichprobengrösse gegenüberstellen und die streichen, die der Traffic nicht tragen kann. Die meisten Listen schrumpfen in dieser Stunde um zwei Drittel, und genau das ist der Sinn.

Dann zwei Wochen echte Arbeit auf meine Rechnung, vor jeder Verpflichtung. Ich brauche Zugang zu Analytics und zur Seite, die historische Ausgangsrate der primären Metrik nach Tag und Segment, und wer immer das Design der Varianten verantwortet. In diesen zwei Wochen schreibe ich den Testplan als einseitiges Dokument: Hypothese mit Zahl, primäre Metrik, Faktoren und Stufen, Stichprobengrösse, Enddatum, Stoppregel und was wir mit jedem möglichen Ergebnis tun. Ich richte Randomisierung und Event ein, fahre eine A/A Prüfung und starte das erste Faktorial.

Am Ende eines Tests bekommst du ein Entscheidungsmemo mit dem Lift, seinem Intervall und einer Risikoaussage im ersten Absatz, der vollen Zelltabelle dahinter und einer Empfehlung, nach der du noch in derselben Woche handeln kannst. Über ein Programm hinweg entsteht ein laufendes Register, was getestet wurde, was es gebracht und gelehrt hat, bald das wertvollste Dokument in deinem Marketing Ordner. Alles gehört dir, Code, Daten und Register.

Das sitzt in meiner Data Science Arbeit und, wo die Tests auf Anzeigen Landing Pages laufen, im Performance Marketing. Bezahlt wird als fixe monatliche Pauschale oder, bei Wachstumsarbeit, als Provision auf den Lift, den wir tatsächlich messen; die Preisseite zeigt die Form davon. Was ich nicht tue: einen Gewinner ohne Intervall melden.

Fragen vor deinem nächsten Test

  • Welchen Lift haben wir vor dem Test als den kleinsten lohnenden festgelegt, und wo steht das geschrieben?
  • Wie viele Besucher pro Arm braucht dieser Lift bei unserer Ausgangsrate, und wann erreichen wir sie?
  • Welche eine Metrik entscheidet den Test, und wer hat ihr vorab zugestimmt?
  • Ist die Zuteilung zufällig nach Besucher, und haben wir den Split am ersten Tag geprüft?
  • Lesen wir das Ergebnis einmal am geplanten Ende, oder hat jemand das Dashboard beobachtet?
  • Wie breit ist das Konfidenzintervall des Lifts, und hält die Entscheidung auch an seinem unteren Ende?
  • Könnten die Faktoren, die wir testen, interagieren, und wenn ja, warum testen wir sie nacheinander?
  • Was tun wir, wenn das Ergebnis "kein Unterschied" lautet?

Diese Serie ist inspiriert von Mike Grigsbys Marketing Analytics (Kogan Page). Erklärungen, Beispiele und Zahlen hier sind meine eigenen.

Wenn gerade ein Test bei dir läuft oder einer kurz vor dem Start steht, schick mir die Ausgangsrate, den monatlichen Traffic auf dieser Seite und die Änderung, die du machen willst. Ich sage dir ehrlich, ob der Traffic das trägt, wie lang es dauern würde und welchen Lift der Test tatsächlich erkennen kann. Genau dafür ist der kostenlose Workshop da, und er kostet dich nichts. Danach folgen zwei Wochen echte Arbeit auf meine Rechnung, bevor du dich zu irgendetwas verpflichtest. Bring deine Daten oder deine Frage mit, und wir entwerfen einen Test, der sich lohnt.

1%jeder Rechnung geht an eine Charity, die du wählst.

Eine Spende, nie Sponsoring. Du wählst das Anliegen beim Onboarding.

Die Geschichte hinter dem Versprechen →

Bleib deiner Konkurrenz voraus.

Die neuesten innovativen Produkte und Services, direkt in dein Postfach, bevor deine Mitbewerber davon hören.

Sichere dir bis zu 5% auf deine ersten sechs Monate: 1% pro gewähltem Thema, die vollen 5% wenn du alles nimmst. Limitiertes Angebot · endet am 31. Dezember 2026.

Nur für Neukunden. Es gelten die AGB.

* Bis zu 5% auf deine ersten sechs Monatsrechnungen, nur für Neukunden. Alle Bedingungen.

Fragen zu Preisen, Verträgen oder zur Zusammenarbeit?

Zu den FAQ