Warum immer nur eine Sache zu testen dich Geld kostet
Du machst einen sauberen Test. Du änderst die Überschrift, hältst alles andere still, und die neue Überschrift gewinnt. Nächste Woche änderst du den Preis, hältst alles andere still, und der niedrigere Preis gewinnt. Also schickst du die Siegerüberschrift und den Siegerpreis gemeinsam raus, weil du sie ja ordentlich getestet hast, eine Sache nach der anderen, so wie es jeder Artikel im Internet gesagt hat. Und deine Konversionsrate sinkt. Das ist kein Pech, das ist Mathematik, und es passiert weit öfter als es irgendjemand der diese Tests fährt zugeben mag. Immer nur einen Faktor zu testen hat einen blinden Fleck der in der Methode selbst steckt, und dieser blinde Fleck ist genau dort wo viel vom Geld sich versteckt. Ich will dir zeigen was er ist, warum er passiert und was du stattdessen tust, mit einem durchgerechneten Beispiel das du vor dem Mittagessen in einer Tabelle nachbauen kannst.
Der Test der den falschen Sieger wählt
Du machst einen sauberen A/B Test. Du änderst die Überschrift, lässt alles andere in Ruhe, und die neue Überschrift gewinnt. Super. Nächste Woche machst du noch einen sauberen Test. Du änderst den Preis, alles andere bleibt still, und der niedrigere Preis gewinnt. Wieder super. Also schickst du die Siegerüberschrift und den Siegerpreis gemeinsam raus, weil du sie ja ordentlich getestet hast, eine Sache nach der anderen, so wie es jeder Artikel im Internet gesagt hat. Und deine Konversionsrate sinkt.
Das ist kein Pech. Das ist Mathematik. Und es passiert öfter als es irgendjemand der diese Tests fährt zugeben mag, denn immer nur einen Faktor zu testen hat einen blinden Fleck der in der Methode selbst steckt, und dieser blinde Fleck ist genau dort wo viel vom Geld sich versteckt. Ich will dir zeigen was er ist, warum er passiert und was du stattdessen tust, mit einem durchgerechneten Beispiel das du vor dem Mittagessen in einer Tabelle nachbauen kannst.
Einen nach dem anderen fühlt sich streng an, und das ist die Falle
Der Grund warum alle einen Faktor nach dem anderen testen ist dass es sich nach der sorgfältigen, wissenschaftlichen Sache anfühlt. Ändere eine Variable, halte den Rest fest, und du kannst auf das Ergebnis zeigen und sagen die Überschrift hat den Anstieg verursacht. Saubere Ursache, saubere Wirkung. Es ist die erste Regel über Experimente die du je lernst, und für viele Fragen ist es wirklich guter Rat.
Aber halt dieses Rest festhalten mal gegen das Licht. Wenn du die Überschrift testest während der Preis auf seinem alten Wert festgehalten wird, misst du immer nur was die neue Überschrift bei diesem einen Preis tut. Du lernst nichts darüber wie sie sich bei einem anderen Preis verhält. Du nimmst an, ohne es je zu prüfen, dass der Effekt der Überschrift derselbe ist egal was der Preis daneben gerade macht. Immer nur einen Faktor zu testen versäumt es nicht bloß diese Annahme zu messen. Es kann sie nicht messen. Die Methode ist darauf gebaut genau das perfekt still zu halten was das Problem verraten würde.
Diese Annahme hat einen Namen. Es ist die Annahme dass deine Änderungen sich aufaddieren, dass der Effekt der Überschrift plus der Effekt des Preises einfach die Summe der beiden ist. Und wenn sie falsch ist, ist sie auf eine Weise falsch die ein Test nach dem anderen strukturell nicht fangen kann.
Wenn zwei Änderungen sich weigern zusammenzupassen
Lass es mich am kleinsten Beispiel konkret machen das das Problem zeigt. Zwei Faktoren, je zwei Stufen. Die Überschrift ist entweder die schlichte Wert Botschaft oder die Premium Handwerk Botschaft. Der Preis ist entweder der volle Preis oder ein Rabatt. Das gibt vier mögliche Kampagnen, und ein voller Faktorplan fährt schlicht alle vier.
Hier ist was zurückkommt, als Konversionsrate pro hundert Besuchern.
| Kombination | Voller Preis | Rabatt |
|---|---|---|
| Wert Überschrift | 2,0 | 2,5 |
| Premium Überschrift | 2,6 | 2,4 |
Jetzt schau was ein Test nach dem anderen damit anstellt. Starte von der Ausgangslage oben links, Wert Überschrift beim vollen Preis, 2,0.
Teste die Überschrift für sich, Preis auf voll gehalten. Premium schlägt Wert, 2,6 gegen 2,0. Die Premium Überschrift gewinnt, klar.
Teste den Preis für sich, Überschrift auf Wert gehalten. Rabatt schlägt vollen Preis, 2,5 gegen 2,0. Der Rabatt gewinnt, klar.
Also reicht dir ein Test nach dem anderen zwei selbstbewusste Sieger, die Premium Überschrift und den Rabatt, und sagt dir schick sie gemeinsam raus. Diese Kombination ist die Zelle unten rechts. Sie konvertiert mit 2,4. Sie ist schlechter als drei der vier Optionen die du hattest, die Ausgangslage von der du gestartet bist eingeschlossen. Du hast zwei saubere, strenge Tests gefahren und sie haben dich schnurstracks auf fast das schlechteste Feld auf dem Brett marschiert.
Die wirklich beste Kampagne ist die Premium Überschrift beim vollen Preis, 2,6, unten links. Ein Test nach dem anderen kann sie in einem seiner zwei Tests erreichen und wirft sie dann weg sobald er die Sieger kombiniert, weil er nie geahnt hat dass die Sieger sich vielleicht nicht vertragen.
Der Grund warum sie sich bekämpft haben, und die Zahl die es beweist
Die Geschichte hinter den Zahlen ist nicht exotisch. Eine Premium Handwerk Botschaft und ein Rabattschild senden gegensätzliche Signale. Die Botschaft sagt das ist es wert bezahlt zu werden, der Preis sagt wir nehmen Geld runter, und der Besucher spürt den Widerspruch auch wenn er ihn nicht benennen könnte. Die Premium Botschaft wirkt mit einem vollen Preis weil die zwei übereinstimmen. Der Rabatt wirkt mit der Wert Botschaft weil auch diese zwei übereinstimmen. Kreuze sie und jede untergräbt die andere.
Dieses Kreuzen hat ein genaues Maß, die Wechselwirkung. Für ein zwei mal zwei Raster ist sie die Differenz der Differenzen. Nimm wie viel die Premium Überschrift beim Rabattpreis hilft, und ziehe ab wie viel sie beim vollen Preis hilft.
Setz die vier Zellen ein, wobei P und W Premium und Wert sind, V und R voll und Rabatt.
Diese minus 0,7 sind die ganze Geschichte in einer Zahl. Wären die Effekte additiv, wäre die Welt so ordentlich wie ein Test nach dem anderen annimmt, käme hier Null heraus, und die zwei Sieger zu stapeln würde genau wie versprochen wirken. Je weiter der Wert von Null weg liegt, desto stärker biegen die zwei Faktoren einander, und desto gefährlicher ist es sie getrennt zu testen. Und jetzt kommt der Teil über den es sich nachzudenken lohnt. Die Wechselwirkung ist genau die Größe die ein Test nach dem anderen so gebaut ist dir nie zu zeigen. Du siehst sie nur wenn du die Kombinationen zusammen fährst. Die Methode die sich am strengsten anfühlt ist blind für die eine Zahl die entscheidet ob ihre eigene Schlussfolgerung hält.
Drei Raster, drei Arten von Wechselwirkung
Diese minus 0,7 war negativ, und negativ ist die gefährliche. Aber eine Wechselwirkung kann überall landen, und das Vorzeichen ist die ganze Handlung. Lass mich drei Raster nebeneinander legen, dasselbe Layout, dieselbe Ausgangslage von 2,0 oben links, und lies die Wechselwirkung von jedem ab.
Beginn mit der ordentlichen Welt, der in der ein Test nach dem anderen die Wahrheit sagt.
| Additive Welt | Voller Preis | Rabatt |
|---|---|---|
| Wert Überschrift | 2,0 | 2,4 |
| Premium Überschrift | 2,6 | 3,0 |
Die Wechselwirkung ist hier (3,0 minus 2,4) minus (2,6 minus 2,0), also 0,6 minus 0,6, also Null. Die Premium Überschrift legt 0,6 drauf egal ob der Preis voll oder rabattiert ist, und der Rabatt legt 0,4 drauf welche Überschrift auch darüber steht. Alles addiert sich. Stapel die zwei Sieger, Premium und Rabatt, und du landest auf 3,0, was wirklich die beste Zelle ist. In einer Welt wie dieser ist ein Test nach dem anderen in Ordnung und du solltest ihn nutzen, weil er schneller ist.
Jetzt die freundliche Überraschung, eine positive Wechselwirkung.
| Synergie Welt | Voller Preis | Rabatt |
|---|---|---|
| Wert Überschrift | 2,0 | 2,2 |
| Premium Überschrift | 2,3 | 3,2 |
Die Wechselwirkung ist hier (3,2 minus 2,2) minus (2,3 minus 2,0), also 1,0 minus 0,3, also plus 0,7. Die zwei Sieger addieren sich nicht bloß, sie verstärken sich. Premium und Rabatt zusammen treffen 3,2, was mehr ist als die Teile vorhersagen würden. Ein Test nach dem anderen landet auch hier auf der richtigen Zelle, aber er unterschätzt böse wie gut sie ist, du würdest also zu wenig in den Sieger stecken. Da ist das Nächste worüber es sich nachzudenken lohnt. Selbst wenn ein aufeinanderfolgender Test die richtige Kombination wählt, heißt eine positive Wechselwirkung dass er die Größe des Preises falsch liest, und Budgets werden auf der falschen Zahl festgelegt.
Und die die wir schon getroffen haben, die Falle, eine negative Wechselwirkung.
| Konflikt Welt | Voller Preis | Rabatt |
|---|---|---|
| Wert Überschrift | 2,0 | 2,5 |
| Premium Überschrift | 2,6 | 2,4 |
Die Wechselwirkung ist hier (2,4 minus 2,5) minus (2,6 minus 2,0), also minus 0,1 minus 0,6, also minus 0,7. Die Sieger bekämpfen sich, und sie zu stapeln landet dich auf 2,4, schlechter als dort wo du begonnen hast. Dieselbe Methode, drei völlig verschiedene Urteile, und das Einzige was sich geändert hat war eine Zahl die du ohne die Kombinationen zu fahren nicht sehen kannst. Das ist der Punkt. Ein Test nach dem anderen weiß nicht in welcher dieser drei Welten er steht, und er verhält sich in allen drei gleich.
Ein ganzes Raster lesen statt zwei Zeilen
Zwei Faktoren mit je zwei Stufen sind die Spielzeugversion. Die eigentliche Lehre landet wenn du es verbreiterst, also borge ich mir die Form des Botschaft mal Preis Experiments aus Cutting Edge Marketing Analytics von Venkatesan, Farris und Wilcox. Drei Botschaften, drei Preise, jede Kombination auf einmal gefahren. Neun Kampagnen, ein Raster.
Sagen wir die drei Botschaften sind eine Wert Botschaft, eine Premium Botschaft und eine Dringlichkeit Botschaft, und die drei Preise sind niedrig, mittel und hoch. Hier ist die Konversionsrate für alle neun Zellen, mit den Zeilen und Spaltenmittelwerten an den Rändern ausgerechnet.
| Botschaft | Niedriger Preis | Mittlerer Preis | Hoher Preis | Mittel je Botschaft |
|---|---|---|---|---|
| Wert | 3,2 | 2,8 | 2,1 | 2,70 |
| Premium | 2,4 | 3,0 | 3,4 | 2,93 |
| Dringlichkeit | 3,1 | 2,9 | 2,5 | 2,83 |
| Mittel je Preis | 2,90 | 2,90 | 2,67 |
Jetzt mach was ein Denker im Modus einer nach dem anderen mit Mittelwerten macht. Die beste Botschaft nach ihrem Zeilenmittel ist Premium, mit 2,93. Der beste Preis nach seinem Spaltenmittel ist ein Gleichstand zwischen niedrig und mittel, mit 2,90. Also sagen dir die Mittelwerte paar die Premium Botschaft mit dem niedrigen Preis. Geh zu dieser Zelle, Premium Botschaft beim niedrigen Preis. Sie konvertiert mit 2,4, dem zweitschlechtesten Feld im ganzen Raster.
Die wirklich beste Kampagne ist die Premium Botschaft beim hohen Preis, die mit 3,4 konvertiert, und die Mittelwerte zeigen aktiv von ihr weg. Das ist das Zweite worüber es sich nachzudenken lohnt. Wenn Wechselwirkungen im Spiel sind, kann die beste Zeile gekreuzt mit der besten Spalte dich fast überall hin bringen, weil ein Randmittel Zellen verschmiert die sich völlig unterschiedlich verhalten. Die Premium Botschaft ist nicht bloß im Schnitt gut, sie ist speziell dann gut wenn der Preis hoch ist, und diese Paarung ist für jeden unsichtbar der die Ränder liest statt die Mitte. Nur das volle Raster zu fahren zeigt dir die Zelle die sich tatsächlich auszahlt.
Das Raster in Haupteffekte und den lügenden Rest zerlegen
Es gibt einen sauberen Weg zu sehen warum die Ränder dich in die Irre führen, und er ist zwei Minuten wert, denn genau so liest ein ordentliches Modell deinen Test. Jede Zelle in einem Faktorplan lässt sich in drei Teile auseinanderziehen, das Gesamtmittel, die Haupteffekte und die Wechselwirkung.
Nimm noch einmal unser drei mal drei Raster. Das Gesamtmittel, der Durchschnitt aller neun Zellen, ist 2,82. Das ist die Ausgangsschätzung für eine Zelle wenn du nichts darüber weißt welche Botschaft oder welchen Preis sie hält.
Jetzt addiere was jeder Faktor für sich tut, seinen Haupteffekt, gemessen als wie weit sein Mittel vom Gesamtmittel entfernt liegt. Die Premium Botschaft mittelt 2,93, ihr Haupteffekt ist also 2,93 minus 2,82, etwa plus 0,11. Der hohe Preis mittelt 2,67, sein Haupteffekt ist also 2,67 minus 2,82, etwa minus 0,16.
Ein additives Modell, das die Welt ist an die ein Test nach dem anderen still glaubt, sagt jede Zelle vorher indem es diese Teile stapelt.
Für Premium beim hohen Preis gibt das
Das additive Modell sagt das Beste was du von Premium bei einem hohen Preis erhoffen kannst ist etwa 2,77, einen Hauch unter dem Schnitt, was genau der Grund ist warum die Ränder dich von ihr wegsteuern. Aber die echte Zelle konvertiert mit 3,4. Die Lücke zwischen den beiden ist die Wechselwirkung.
Bleib bei diesen zwei Zahlen. Die additive Vorhersage ist 2,77. Die Wirklichkeit ist 3,4. Diese plus 0,63 sind kein Rauschen, sie sind ein echter, wiederholbarer Anstieg der nur in der Paarung lebt, und sie sind die einzelne reichste Zelle im Raster. Ein Test nach dem anderen kann bestenfalls die additive Vorhersage finden. Der Wechselwirkungsrest ist Geld das er von Natur aus nicht erreichen kann, denn ihn zu erreichen heißt die zwei Faktoren zusammen zu messen, was das Eine ist das die Methode verweigert.
Einen dritten Faktor dazu, der Würfel den du von den Rändern nicht siehst
Zwei Faktoren geben dir ein Raster das du drucken kannst. Drei Faktoren geben dir einen Würfel, und ein Würfel hat eine üble Angewohnheit die das Raster nur angedeutet hat. Lass mich das Heldenbild zu Botschaft und Preis dazunehmen, diesmal zwei Bilder damit es lesbar bleibt, und den Würfel als zwei Raster auslegen, eins je Bild.
Erstes Bild, ein Lifestyle Foto.
| Lifestyle Bild | Voller Preis | Rabatt |
|---|---|---|
| Wert Überschrift | 2,0 | 2,5 |
| Premium Überschrift | 2,6 | 2,4 |
Zweites Bild, eine schlichte Produktaufnahme.
| Produkt Bild | Voller Preis | Rabatt |
|---|---|---|
| Wert Überschrift | 2,2 | 2,3 |
| Premium Überschrift | 3,1 | 2,7 |
Die beste Zelle im ganzen Würfel ist die Premium Überschrift, voller Preis, Produkt Bild, mit 3,1, und beachte sie gab es auf dem ersten Raster gar nicht. Aber hier ist der Teil der dich leicht nervös machen sollte. Erinnere dich die Botschaft mal Preis Wechselwirkung auf dem Lifestyle Bild war minus 0,7, die Sieger im Kampf. Rechne sie auf dem Produkt Bild noch einmal aus.
Immer noch negativ, aber nicht so heftig. Die Wechselwirkung selbst hat sich geändert als wir das Bild getauscht haben, von minus 0,7 auf minus 0,5. Diese Verschiebung ist eine Dreifachwechselwirkung, eine Wechselwirkung zwischen Wechselwirkungen, und sie heißt das Bild schreibt still um wie Botschaft und Preis miteinander auskommen. Also hier ist das Nächste worüber es sich nachzudenken lohnt. Wechselwirkungen sind keine einmalige Korrektur die du einmal misst und einbuchst. Sie können von einem dritten Ding abhängen, und einem vierten. Das ist kein Grund in Panik zwölf Faktoren auf einmal zu variieren, es ist das Gegenteil. Es ist der Grund die zwei oder drei Faktoren zu wählen von denen du am meisten vermutest dass sie verflochten sind und sie tatsächlich zusammen zu fahren, denn die Verflechtung kann tiefer reichen als ein einzelnes Raster zeigt.
Wie schnell das Raster wächst, und warum das in Ordnung ist
Der offensichtliche Einwand sind die Kosten. Sicher explodiert jede Kombination zu fahren in eine unbezahlbare Zahl von Tests. Es wächst schnell, ja, aber nicht so beängstigend wie die Furcht nahelegt, und die Form des Wachstums ist es wert genau gekannt zu werden.
Für einen vollen Faktorplan mit Faktoren, jeder mit Stufen, ist die Zahl der Kombinationen
Zwei Faktoren mit zwei Stufen sind . Unser drei mal drei ist . Nimm einen dritten Faktor mit drei Stufen dazu, etwa das Bild, und es ist . Ein vierter und du bist bei . Der Exponent ist die Zahl der Faktoren, Kombinationen wachsen also schnell in der Zahl der Dinge die du variierst und sanfter in der Zahl der Stufen die jedes annimmt.
Vergleich das damit wie viele Kampagnen ein Test nach dem anderen tatsächlich anschaut. Er fährt die Ausgangslage, dann ändert er jeden Faktor über seine übrigen Stufen einen nach dem anderen, das sind Kombinationen. Hier die zwei nebeneinander.
| Faktoren | Stufen je | Voller Faktorplan | Einer nach dem anderen |
|---|---|---|---|
| 2 | 2 | 4 | 3 |
| 2 | 3 | 9 | 5 |
| 3 | 3 | 27 | 7 |
| 4 | 3 | 81 | 9 |
Der Abstand ist echt und er wächst. Aber jetzt kommt das das verändert wie du einen Test planst. Ein voller Faktorplan braucht meist nicht mehr Traffic als ein Durchlauf einer nach dem anderen. Er braucht dieselben Besucher auf mehr Zellen verteilt. Wenn du das Volumen hast um vier saubere aufeinanderfolgende Tests zu fahren, hast du sehr oft das Volumen um einen Faktorplan über dieselben Wochen zu fahren, denn du hättest diese Besucher ohnehin ausgegeben. Was du in Wahrheit entscheidest ist ob du sie ausgibst um über Faktoren in Isolation zu lernen, was dich anlügen kann, oder über Kombinationen, was es nicht kann. Und wenn das Volumen wirklich knapp ist, brauchst du nicht das volle Raster. Teilpläne und vernünftige Vorannahmen lassen dich die wichtigen Wechselwirkungen abdecken ohne alle einundachtzig Zellen zu fahren, was genau die Art Abwägung ist die man bewusst plant statt hineinzurutschen.
Einer nach dem anderen gegen vollen Faktorplan, in einem Bild
Hier sind die zwei Ansätze als die Pfade die sie tatsächlich gehen.
Der linke Pfad geht eine Linie. Er fixiert einen Sieger, dann den nächsten, schraubt sie zusammen und hofft dass sie sich vertragen. Der rechte Pfad füllt ein Raster. Er nimmt nie an dass die Sieger Freunde sind, er misst schlicht jede Paarung und liest die beste ab. Die Linie ist schneller gezeichnet und einem Entscheider leichter erklärt. Das Raster ist das das dir keine Verliererkampagne mit selbstbewusstem Gesicht reicht.
Ein durchgerechneter Mini Fall, eine Woche auf einer Landingpage
Lass mich die ganze Idee auf eine Seite bringen, wortwörtlich, mit einer Landingpage die du dir diese Woche laufend vorstellen könntest. Alle Zahlen hier sind erfunden damit die Rechnung sauber bleibt, tausch also deine eigenen ein, aber die Form ist die Sache.
Sagen wir du testest eine Angebotsanfrage Seite. Zwei Faktoren. Der Handlungsaufruf, entweder Angebot holen oder Jetzt starten. Und die Formularlänge, drei Stufen, drei Felder, fünf Felder oder acht Felder. Das ist ein zwei mal drei Faktorplan, sechs Zellen, und du fährst alle sechs auf einmal.
Hier ist was zurückkommt, Konversionen pro hundert Besuchern.
| Aufruf / Formular | 3 Felder | 5 Felder | 8 Felder |
|---|---|---|---|
| Angebot holen | 4,1 | 3,8 | 2,9 |
| Jetzt starten | 4,6 | 3,5 | 2,2 |
Jetzt geh es die alte Art. Deine Live Seite heute ist Angebot holen mit dem üblichen fünf Felder Formular, konvertiert mit 3,8, das ist deine Ausgangslage. Du testest zuerst den Aufruf, Formular auf fünf Feldern gehalten. Angebot holen mit 3,8 schlägt Jetzt starten mit 3,5, also behältst du Angebot holen. Dann testest du die Formularlänge mit dem Aufruf auf Angebot holen gehalten, und drei Felder gewinnt mit 4,1. Du schickst Angebot holen mit drei Feldern, 4,1, und du bist zufrieden, weil es deine Ausgangslage geschlagen hat.
Aber schau ins Raster. Die beste Zelle ist Jetzt starten mit drei Feldern, mit 4,6. Du hast einen halben Punkt liegen lassen, und ein halber Punkt auf einer Seite die zählt sind über ein Jahr viele Angebote. Warum hat der aufeinanderfolgende Test sie verpasst? Weil er den Aufruf bei fünf Feldern getestet hat, und bei fünf Feldern ist Jetzt starten wirklich schlechter. Jetzt starten glänzt nur wenn das Formular kurz ist, denn ein knackiger, dringlicher Knopf der eine schnelle Sache verspricht und dann acht Felder verlangt schreibt einen Scheck den das Formular nicht decken kann, während derselbe Knopf über einem drei Felder Formular die Wahrheit sagt. Der Sieger des Aufruf Tests hing völlig von der Formularlänge ab bei der du ihn zufällig gehalten hast, und du hast ihn bei der falschen gehalten.
Die Wechselwirkung sagt es klar. Vergleiche den Aufruf Effekt beim kurzen Formular und beim langen Formular.
Ein Ausschlag von 1,2 zwischen den zwei Enden des Formulars ist riesig, weit größer als jeder Faktor für sich, und er sitzt völlig darin wie die zwei zusammenspielen. Fahr sie getrennt und er ist unsichtbar. Fahr sie zusammen und er ist das Hauptergebnis.
Die häufigen Fehler die einen Faktorplan still ruinieren
Sobald die Leute davon überzeugt sind Kombinationen zu fahren, stolpern sie meist über dieselbe Handvoll Dinge. Hier sind die die ich am meisten sehe, und wie du an ihnen vorbeikommst.
Alles auf einmal variieren
Der Exponent in verzeiht nichts. Sechs Faktoren mit drei Stufen sind siebenhundertneunundzwanzig Zellen, und dein Traffic wird so dünn geschnitten dass jede Zelle Rauschen ist. Ein Faktorplan ist ein Skalpell, kein Fischernetz. Wähl die zwei oder drei Faktoren von denen du wirklich glaubst dass sie verflochten sind und lass den Rest für später.
Stufen die nicht wirklich verschieden sind
Einen Preis von 99 gegen 98 zu testen sind nicht zwei Stufen, es ist eine Stufe mit einem Rundungsfehler. Wenn die Stufen sich nicht genug unterscheiden um das Verhalten plausibel zu ändern, gibst du Traffic aus um Rauschen zu messen. Mach jede Stufe zu einer echten, eigenen Wahl.
Die Ränder lesen statt die Zellen
Das ist die Ursünde, die um die es in diesem ganzen Stück geht. Die Zeilen und Spaltenmittel sind tröstlich und sie lügen sobald Wechselwirkungen da sind. Finde immer die beste Zelle, nicht die beste Zeile gekreuzt mit der besten Spalte.
Zu früh reinschauen und aufhören
Ein Raster braucht genug Besucher je Zelle um den Zahlen zu trauen, und Zellen sind kleiner als die zwei Eimer eines einzelnen A/B Tests, sie brauchen also Geduld. Den Sieger in dem Moment zu bestimmen in dem eine Zelle knapp vorne liegt ist wie du ein zufälliges Wackeln krönst. Setz die Stichprobe je Zelle vorab und halt die Nerven.
Das Tracking nicht selbst besitzen
Du kannst ein neun Zellen Raster nicht lesen wenn du nicht verlässlich sagen kannst welcher Besucher welche Zelle gesehen hat und was er danach tat. Ein gemietetes Dashboard das die Zuordnung vergisst macht aus deinem sorgfältigen Faktorplan Matsch. Besitze das Tracking von Anfang bis Ende.
Annehmen eine flache Zeile heißt der Faktor zählt nicht
Dieser ist hinterhältig und es ist eine echte Überraschung. Ein Faktor kann fast keinen Haupteffekt haben, sein Zeilenmittel tot auf Höhe des Gesamtmittels, und trotzdem eines der wichtigsten Dinge auf der Seite sein, weil er nur durch Wechselwirkung wirkt. Wenn das Bild im Schnitt nichts tut aber umdreht welcher Preis gewinnt, zählt das Bild enorm, und ein Denken nur in Haupteffekten wirft es in den Müll. Lies nie einen Haupteffekt für sich und schließe daraus dass ein Faktor tot ist.
Was das dafür bedeutet wie du tatsächlich testest
Du musst nicht umwerfen wie du arbeitest. Du brauchst drei Gewohnheiten.
Erstens, wenn zwei Änderungen plausibel miteinander reden könnten, teste sie zusammen, nicht nacheinander. Botschaft und Preis reden miteinander. Überschrift und Heldenbild reden miteinander. Angebot und Zielgruppe reden laut miteinander. Alles wo eine Änderung die Bedeutung einer anderen verändert ist ein Kandidat für einen Faktorplan, denn genau dort führt dich ein aufeinanderfolgender Test in die Irre. Wenn zwei Änderungen wirklich unabhängig sind, ist ein schlichter aufeinanderfolgender Test in Ordnung, und schneller.
Zweitens, sei bewusst wie viele Faktoren und Stufen du auf einmal in Angriff nimmst, denn verzeiht nichts wenn du unachtsam bist. Drei Faktoren mit drei Stufen sind ein reiches, lesbares Experiment. Sieben Faktoren mit vier Stufen sind ein Forschungsprojekt. Wähl die zwei oder drei Variablen von denen du wirklich vermutest dass sie sich beeinflussen, gib jeder eine kleine Zahl bedeutungsvoller Stufen, und widersteh dem Drang alles zu variieren.
Drittens, verdrahte dein Testen mit deinen eigenen Daten damit du ein Raster überhaupt lesen kannst. Ein Experiment mit neun Zellen zu fahren und Ergebnisse korrekt zuzuordnen braucht Tracking das dir gehört und das du kontrollierst, kein gemietetes Dashboard das vergisst welcher Besucher welche Kombination gesehen hat. Es ist dasselbe Argument das ich immer wieder dazu mache die Plattform zu besitzen auf der dein Wachstum läuft. Wenn du Hilfe dabei willst einen Faktorplan zu entwerfen der zu deinem Traffic passt, oder einen Stapel vergangener A/B Ergebnisse in ein Modell zu verwandeln das Wechselwirkungen respektiert, ist das genau die Art Arbeit die ich mache, und die Form davon siehst du quer durch meine Growth und Analytics Arbeit. Bring deine letzten drei Tests mit und wir finden heraus ob deine Sieger sich tatsächlich vertragen.
Wie du das am Montagmorgen anwendest
Nichts davon zahlt sich aus wenn es nicht den Kontakt mit einem echten Montag übersteht. Also hier ist der Ablauf, von Anfang bis Ende.
- Schreib die Liste der Änderungen auf die du gerade eine nach der anderen testen wolltest. Überschrift, Preis, Bild, Aufruf, Formular, was auch immer in der Schlange steht.
- Zieh eine Linie zwischen je zwei die plausibel die Bedeutung der anderen ändern könnten. Botschaft und Preis. Aufruf und Formular. Angebot und Zielgruppe. Diese Linien sind deine Kandidaten für einen Faktorplan.
- Wähl die zwei oder drei am stärksten verflochtenen Faktoren und gib jedem eine kleine Zahl wirklich verschiedener Stufen. Zwei oder drei Stufen je Faktor sind reichlich.
- Rechne aus und teile deinen erwarteten Traffic dadurch. Wenn eine Zelle zu wenige Besucher bekäme um ihr zu trauen, lass einen Faktor oder eine Stufe fallen bis es passt.
- Fahr alle Zellen zur selben Zeit, auf Tracking das dir gehört, damit jeder Besucher sauber zugeordnet und jedes Ergebnis sauber zugerechnet ist.
- Wenn die Zahlen da sind, lies das ganze Raster. Finde die beste Zelle. Dann rechne die Wechselwirkungen aus damit du verstehst warum sie gewonnen hat, nicht bloß dass sie es tat.
- Bestätige die Siegerzelle mit einem schnellen Nachtest gegen deinen alten Champion, damit du weißt dass der Anstieg echt ist bevor du das Budget darauf setzt.
Hier ist derselbe Ablauf als Entscheidung die du an die Wand hängen kannst.
Die ganze Methode passt auf diese eine Karte. Wenn zwei Änderungen Fremde sind, teste sie nacheinander und spar dir die Mühe. Wenn sie reden könnten, steck sie in denselben Raum und schau ihnen zusammen zu. Wenn du ein zweites Paar Augen dazu willst welche deiner Änderungen Fremde und welche verflochten sind, ist das genau die Art Sache die einen kurzen Termin zum Skizzieren wert ist bevor du einen Monat Traffic am falschen Test verbrennst.
Die eine Idee die du mitnehmen sollst
Wenn du eine einzige Sache hiervon mitnimmst, mach es diese. Immer nur einen Faktor zu testen nimmt still an dass deine Änderungen sich aufaddieren, und der ganze Grund warum Wechselwirkungen dich Geld kosten ist dass sie es nicht tun. Deine beste Überschrift und dein bester Preis, jeder für sich ein klarer Sieger, können zu einer Kampagne werden die gegen eine Paarung verliert die du nie probiert hättest. Der einzige Weg das zu sehen ist die Kombinationen zusammen zu fahren und das ganze Raster zu lesen, nicht die Ränder. Teste die Dinge die miteinander reden im selben Experiment, und du hörst auf selbstbewusste Verlierer rauszuschicken und fängst an die Zelle zu finden an der alle anderen schnurstracks vorbeigegangen sind.