Fünf Wege um zu beweisen dass eine Kampagne wirklich gewirkt hat

Jeder Inhaber hat es schon gesagt, und ich habe es auch gesagt. Wir haben die Kampagne gefahren, und der Umsatz ist gestiegen, also hat die Kampagne gewirkt. Es fühlt sich wasserdicht an. Es ist eine der schwächsten Behauptungen im ganzen Marketing, und sobald du siehst warum, kannst du nicht mehr aufhören es zu sehen. In den Wochen in denen du diese Kampagne gefahren hast, haben sich zur gleichen Zeit ein Dutzend andere Dinge bewegt. Das Wetter hat sich geändert. Ein Wettbewerber hat die Preise erhöht oder war ausverkauft. Der Zahltag kam. Du hast ein bisschen Presse bekommen. Die Saison hat gewechselt. Deine eigene E Mail Liste ist gewachsen. Jedes einzelne davon hätte den Umsatz ganz allein heben können, und du stündest trotzdem da und nähmst den Ruhm für die Anzeige. Zu beweisen dass eine Kampagne gewirkt hat heißt nicht auf eine Zahl zu zeigen die gestiegen ist. Es heißt die anderen Gründe auszuschließen warum sie gestiegen sein könnte. Das ist ein lösbares Problem, und du brauchst kein Data Science Team dafür. Du brauchst eines von fünf Versuchsdesigns, passend zu der Lage in der du wirklich steckst. Hier sind sie, vom schwächsten zum stärksten, in einfachen Worten, mit dem einen das die meisten Inhaber schon fahren könnten und nie tun.

Der Satz der alle täuscht

Jeder Inhaber hat es schon gesagt, und ich habe es auch gesagt. Wir haben die Kampagne gefahren, und der Umsatz ist gestiegen, also hat die Kampagne gewirkt. Es fühlt sich wasserdicht an. Es ist eine der schwächsten Behauptungen im ganzen Marketing, und sobald du siehst warum, kannst du es nicht mehr übersehen.

Hier ist das Problem in einem Atemzug. In den Wochen in denen du diese Kampagne gefahren hast, haben sich zur gleichen Zeit ein Dutzend andere Dinge bewegt. Das Wetter hat sich geändert. Ein Wettbewerber hat die Preise erhöht oder war ausverkauft. Der Zahltag kam. Du hast ein bisschen Presse bekommen. Die Saison hat gewechselt. Deine eigene E Mail Liste ist gewachsen. Jedes einzelne davon hätte den Umsatz ganz allein heben können, und du stündest trotzdem da und nähmst den Ruhm für die Anzeige.

Zu beweisen dass eine Kampagne gewirkt hat heißt nicht auf eine Zahl zu zeigen die gestiegen ist. Es heißt die anderen Gründe auszuschließen warum sie gestiegen sein könnte. Die ganze Disziplin der kausalen Schlussfolgerung, und der Grund warum es diesen Artikel gibt, ist ein Satz von Tricks um genau das ohne Labor zu tun. Die Taxonomie die ich dir gleich zeige ist die aus Cutting Edge Marketing Analytics von Venkatesan, Farris und Wilcox, und sie sortiert die Arten wie du ein Marketing Experiment fahren kannst vom windigsten zum kugelsichersten. Sobald du die fünf kennst, kannst du dir jede Kampagne ansehen und eine viel bessere Frage stellen als ist der Umsatz gestiegen. Du kannst fragen welches dieser fünf habe ich eigentlich gefahren, und wie sehr sollte ich der Antwort trauen.

Und sei ehrlich darüber für wen das ist. Du brauchst kein Statistikstudium und kein Datenteam. Jedes Design unten kannst du als Inhaber mit einer Tabelle, einem E Mail Tool und ein bisschen Disziplin fahren. Der schwere Teil ist nie die Mathematik. Er ist die Entscheidung, bevor du das Geld ausgibst, wie du wissen wirst ob es gewirkt hat. Diese Entscheidung dauert fünf Minuten und fast niemand trifft sie.

Warum du dem Vorher und Nachher nicht einfach trauen kannst

Der Grund warum das alles schwer ist hat einen Namen. Er heißt das Kontrafaktische, und es ist das was du nie zu sehen bekommst. Um mit Sicherheit zu wissen dass deine Kampagne gewirkt hat, müsstest du beobachten was dein Umsatz über genau dieselben Wochen getan hätte wenn du sie nicht gefahren hättest. Gleiches Wetter, gleiche Wettbewerber, alles gleich, nur ohne die Kampagne. Diese Welt gibt es nicht. Du lebst immer nur in einer Version der Ereignisse, in der in der du die Kampagne gefahren hast.

Alles was unten kommt ist eine andere Art einen Ersatz für diese fehlende Welt zu bauen. Eine glaubwürdige Schätzung dessen was ohnehin passiert wäre. Die fünf Designs unterscheiden sich nur darin wie gut diese Schätzung ist, und wie schwer sie zu bekommen ist. Behalte diese eine Idee im Kopf und der Rest fügt sich zusammen.

Es hilft den Übeltäter zu benennen. Statistiker nennen ihn einen Störfaktor, ein Ding das deinen Umsatz bewegt und zufällig mit deiner Kampagne zusammenfällt, sodass du die beiden nicht auseinanderhalten kannst. Die Saison ist ein Störfaktor. Ein Ausverkauf beim Wettbewerber ist ein Störfaktor. Der Zahltag ist ein Störfaktor. Jedes Design hier ist eine andere Taktik um Störfaktoren wegzukürzen. Vergleich einen Kampagnenzeitraum mit der Vergangenheit und die Störfaktoren laufen frei herum. Vergleich zwei zufällig geteilte Gruppen die dieselben Wochen durchleben und die meisten Störfaktoren stecken in beiden Gruppen gleich fest und kürzen sich still weg. Das ist der ganze Trick, einmal gesagt, bevor wir zu den fünf Arten kommen ihn zu machen.

Design eins, nur danach

Das schwächste von allen. Du fährst die Kampagne, du schaust dir den Umsatz während und danach an, und du beurteilst sie am Niveau. Der Umsatz ist stark, also hat die Kampagne gewirkt. Hier gibt es überhaupt keinen Vergleich, kein Vorher, keine zurückgehaltene Gruppe. Du vergleichst das Ergebnis mit einem Gefühl dafür wie gut aussieht.

Wann nur danach deine einzige Option ist

Hier lebt das meiste bauchgetriebene Marketing, und es ist kaum ein Beleg. Es verdient sich sein Geld nur dann wenn du wirklich nichts anderes hast. Ein brandneues Geschäft ohne Handelshistorie. Ein einmaliger Start eines Produkts ohne Vorgänger. Ein Kanal den du nie berührt hast, in einem Markt in dem du nie verkauft hast, wo du nicht einmal eine Grundlinie hast an die du dich lehnen kannst. In diesen Fällen ist nur danach keine Wahl, es ist der Boden. Du nimmst es weil nichts darunter ist.

Wie du es fährst ohne dich zu belügen

Wenn nur danach alles ist was du hast, dann fahr es wenigstens ehrlich. Schreib auf, bevor du startest, welche Zahl als gut zählen würde und welche als Flop. Schätz den Bereich den du erwartest, schriftlich, vorher. Das macht aus einem Gefühl keinen Beweis, aber es hält dich davon ab die Torpfosten im Nachhinein zu verschieben, was die klassische Sünde von nur danach ist. Jeder ruft den Sieg aus wenn die Zielscheibe um den Pfeil gemalt wird der schon gelandet ist. Steck die Scheibe zuerst ab.

Ein durchgerechnetes Beispiel

Du eröffnest ein neues Kaffeehaus. Keine Historie, keine Liste, kein vergleichbarer Standort. Du fährst eine Eröffnungswochen Aktion und machst viertausend Euro über die Theke. Hat die Aktion gewirkt? Du kannst es ehrlich nicht sagen, denn du hast keine Ahnung was eine Eröffnungswoche ohne Aktion einnimmt. Das Ehrlichste das du aufschreiben kannst ist Eröffnungswoche machte viertausend, was zur Grundlinie für das nächste wird das du probierst. Nur danach ist kein Beweis. Es ist der erste Ziegel einer Grundlinie die du noch nicht hast.

Design zwei, vorher und nachher

Ein echter Sprung nach oben, und das das die meisten Inhaber tatsächlich nutzen ohne seinen Namen zu kennen. Du misst den Umsatz für eine Strecke vor der Kampagne, du fährst die Kampagne, du misst wieder, und du nimmst den Unterschied. Der Umsatz lag vorher im Schnitt bei hundert pro Woche und während bei hundertachtzehn pro Woche, also hat die Kampagne achtzehn dazugelegt.

Wann vorher und nachher seinen Platz verdient

Das ist besser als nur danach weil du zumindest eine Grundlinie hast. Es ist wirklich nützlich in zwei Situationen. Erstens, wenn der Effekt den du suchst groß und schnell ist, ein großer offensichtlicher Sprung der das Hintergrundrauschen in den Schatten stellt, sodass sogar eine grobe Methode ihn erwischt. Zweitens, wenn die Außenwelt über deine Vorher und Nachher Fenster ruhig und stabil ist, kein Saisonwechsel, keine Wettbewerberbewegung, kein Trend. Je langweiliger der Zeitraum, desto mehr kannst du vorher und nachher trauen. In dem Moment in dem sich die Welt unter dir zu bewegen beginnt, fängt dieses Design an zu lügen.

Warum die Grundlinie dich verrät

Der Haken ist dass die Grundlinie deine eigene Vergangenheit ist, und die Vergangenheit ist kein fairer Ersatz für die Gegenwart. Alles was sich zwischen dem Vorher Zeitraum und dem Nachher Zeitraum von allein geändert hätte, die Saison, der Trend, der Wettbewerber, steckt jetzt still in deinem Ergebnis und trägt das Namensschild deiner Kampagne. Wenn du deine Gartenmöbel Aktion im April startest und der Umsatz klettert, ist ein Teil davon die Kampagne und ein Teil davon einfach dass es aufgehört hat Februar zu sein. Vorher und nachher kann diese zwei nicht auseinanderhalten.

Es gibt ein günstiges Upgrade das viel hilft, und dich nichts kostet außer einem längeren Blick zurück. Statt mit dem letzten Monat zu vergleichen, vergleich mit demselben Zeitraum im Vorjahr, und mit dem zugrunde liegenden Trend. Wenn das Geschäft schon vor dem Start um fünf Prozent im Monat gewachsen ist, dann ist ein Sprung von fünf Prozent während der Kampagne gar kein Kampagneneffekt, es ist einfach Dienstag. Zieh den Trend auf dem du schon warst ab, bevor du der Kampagne irgendetwas gutschreibst.

Kampagneneffekt≈(Umsatz wa¨hrend)−(Grundlinie×erwartetes Wachstum)\text{Kampagneneffekt} \approx (\text{Umsatz während}) - (\text{Grundlinie} \times \text{erwartetes Wachstum})

Ein durchgerechnetes Beispiel

Du verkaufst Gartenmöbel. Der März lag im Schnitt bei hunderttausend Euro pro Woche. Du startest eine Aktion im April und der April liegt im Schnitt bei hundertachtzehntausend. Das naive vorher und nachher sagt die Kampagne hat achtzehntausend pro Woche dazugelegt. Aber du schaust ins Vorjahr, und der April liegt immer etwa zwölf Prozent über dem März egal was du tust, weil es aufhört Winter zu sein. Also ist deine saisonale Grundlinie für April nicht hunderttausend, sondern etwa hundertzwölftausend. Der ehrliche Kampagneneffekt liegt näher bei sechstausend pro Woche, nicht achtzehn. Dieselben Zahlen, ein Drittel der Geschichte, und die zwei Drittel die du beinahe beansprucht hättest waren nur der Frühling der pünktlich eingetroffen ist.

Design drei, Test und Kontrolle, das das du nicht fährst

Hier ist das erste das ich dir wirklich mitgeben will, denn es ist der günstigste Goldstandard im Marketing und fast niemand mit einem kleinen Geschäft macht sich die Mühe.

Statt das Jetzt mit der Vergangenheit zu vergleichen, vergleichst du zwei Gruppen die dasselbe Jetzt durchleben. Du nimmst deine Zielgruppe, du teilst sie zufällig in zwei, und du zeigst die Kampagne der einen Hälfte, der Treatment Gruppe, und der anderen Hälfte nichts, der Kontrollgruppe, dem zurückgehaltenen Teil. Dann vergleichst du die zwei über dieselben Wochen. Weil die Aufteilung zufällig war, saßen beide Hälften durch dasselbe Wetter, dieselbe Saison, denselben Wettbewerber, dieselbe Presse. Das alles hebt sich auf. Was immer an Unterschied zwischen Treatment und Kontrolle übrig bleibt ist die Kampagne, und fast nichts sonst. Das ist ein randomisiertes kontrolliertes Experiment, dieselbe Logik mit der die Medizin ein Medikament testet, und du kannst es an einem Dienstag aus einem E Mail Tool heraus fahren.

Warum zufällig das Zauberwort ist

Das Wort das hier die ganze Arbeit macht ist zufällig. Es ist verlockend deine Kontrollgruppe von Hand zu bauen, die Kunden die letztes Mal nicht geöffnet haben, die in der ruhigen Region, die kleineren Konten. Tu es nicht. In dem Moment in dem du die zwei Gruppen nach irgendeiner Regel wählst, wird diese Regel zum Störfaktor und du bist wieder am Anfang. Wenn deine Kontrollgruppe die Leute sind die deine E Mails nie öffnen, kaufen sie natürlich weniger, sie waren weniger engagiert bevor du angefangen hast. Zufällige Zuteilung ist das eine was die zwei Gruppen wirklich vergleichbar macht, weil sich im Schnitt alles andere, engagiert und nicht engagiert, groß und klein, Nord und Süd, gleichmäßig auf sie verteilt. Lass eine Münze entscheiden, nicht dein Urteil.

Der Teil der ein bisschen wehtun sollte

Wenn du eine E Mail Liste hast, eine Kundendatenbank, ein Treueprogramm, eine App, eine Retargeting Zielgruppe, hast du schon alles was du dafür brauchst. Die Daten liegen da. Der einzige Grund warum du Test und Kontrolle nicht fährst ist dass dir nie jemand gesagt hat einen Teil deiner eigenen Zielgruppe absichtlich zurückzuhalten und ihm nichts zu schicken. Es fühlt sich falsch an manchen deiner Kunden bewusst nicht zu vermarkten. Es ist das Wertvollste das du tun kannst, denn diese nicht angeschriebenen Kunden sind die fehlende Welt real gemacht. Sie sind das Kontrafaktische, das herumläuft, Geld ausgibt und dir genau zeigt was ohne die Kampagne passiert wäre.

Du musst nicht die ganze Liste zurückhalten. Zehn Prozent reichen für die meisten KMU. Halte es zufällig, halte es unberührt, und sieh es nie als verlorenen Umsatz. Sieh es als das einzige ehrliche Maß das dir gehört.

Wie du eines fährst, Schritt für Schritt

Hier ist das Ganze, von Anfang bis Ende, in einer Reihenfolge der du bei deiner nächsten Kampagne folgen kannst.

  1. Wähle das Ergebnis das dich wirklich interessiert bevor du startest. Umsatz pro Person ist meist das richtige, nicht Öffnungen oder Klicks. Öffnungen zahlen keine Löhne.
  2. Nimm deine infrage kommende Zielgruppe und teile sie zufällig. Ein zurückgehaltener Teil von zehn bis zwanzig Prozent reicht. Markiere die zwei Gruppen damit du sie später auseinanderhalten kannst.
  3. Schick die Kampagne nur an die Treatment Gruppe. Rühr in der Kontrollgruppe das ganze Testfenster über nichts an, keine E Mail, kein Retargeting, keine heimliche SMS.
  4. Warte lange genug um den echten Kaufzyklus einzufangen. Wenn Leute drei Wochen zum Entscheiden brauchen, sagt dir das Messen nach drei Tagen nichts.
  5. Vergleich den Umsatz pro Person über die zwei Gruppen, dann rechne den Uplift aus und prüf ihn gegen das Rauschen, was der nächste Abschnitt ist.
  6. Schreib das Ergebnis auf, Kampagne und Kontrolle und Uplift, damit es zu einer Aufzeichnung wird gegen die du die nächste Kampagne vergleichen kannst.

Die Disziplin an der Leute scheitern ist Schritt drei. Jemand sagt immer es sei schade den zurückgehaltenen Teil nicht auch anzuschreiben, und in der Sekunde in der du nachgibst, ist dein Maßstab weg.

Eine Zahl draufsetzen, und das Rauschen wegräumen

Sobald du eine Treatment Gruppe und eine Kontrollgruppe hast, ist die Rechnung erfrischend einfach. Uplift ist wie viel mehr die Treatment Gruppe gemacht hat als die Kontrollgruppe, als Anteil der Kontrolle.

Uplift=Treatment−KontrolleKontrolle\text{Uplift} = \frac{\text{Treatment} - \text{Kontrolle}}{\text{Kontrolle}}

Ein durchgerechnetes Beispiel. Über deine Testwochen kauft die Treatment Gruppe, die Hälfte die du angeschrieben hast, für hundertachtzehntausend Euro. Die Kontrollgruppe, die passende Hälfte die du zurückgehalten und in Ruhe gelassen hast, kauft für hunderttausend Euro. Gleich große Gruppen, gleiche Wochen.

Uplift=118.000−100.000100.000=18.000100.000=0,18\text{Uplift} = \frac{118{.}000 - 100{.}000}{100{.}000} = \frac{18{.}000}{100{.}000} = 0{,}18

Achtzehn Prozent Uplift, sauber der Kampagne zurechenbar, weil alles andere beide Gruppen gleich getroffen hat. Diese achtzehntausend sind Geld das die Kampagne gemacht hat und das sonst nicht existiert hätte, und jetzt kannst du es gegen das setzen was die Kampagne gekostet hat und wissen, tatsächlich wissen, ob sie sich gerechnet hat.

Vom Uplift zur Entscheidung, nicht nur zur Zahl

Ein Uplift für sich ist eine Angeberzahl. Die Zahl die dein Geschäft steuert ist was er verdient hat gegen was er gekostet hat. Wenn die Kampagne zweitausend Euro zu fahren gekostet und achtzehntausend an zusätzlichem Umsatz bei, sagen wir, vierzig Prozent Marge gebracht hat, dann hat sie etwa siebentausendzweihundert Rohertrag gegen zweitausend Kosten gemacht.

Rendite=(Zusatzumsatz×Marge)−KostenKosten\text{Rendite} = \frac{(\text{Zusatzumsatz} \times \text{Marge}) - \text{Kosten}}{\text{Kosten}}

Rendite=(18.000×0,40)−2.0002.000=5.2002.000=2,6\text{Rendite} = \frac{(18{.}000 \times 0{,}40) - 2{.}000}{2{.}000} = \frac{5{.}200}{2{.}000} = 2{,}6

Zweihundertsechzig Prozent auf das Geld das du reingesteckt hast, und diesmal ist es keine Geschichte, es ist gegen einen echten zurückgehaltenen Teil gemessen. Das Wort zusätzlich ist der ganze Punkt. Test und Kontrolle ist das einzige Design hier das dir wirklich zusätzlichen Umsatz gibt, die Verkäufe die ohnehin nicht passiert wären. Jedes andere Maß, besonders die Last Click Zahl in deinem Anzeigen Dashboard, zählt still Verkäufe mit die du gratis bekommen hättest.

Das Rauschen wegräumen

Eine Warnung die mehr zählt als die Formel. Ein Unterschied ist kein Ergebnis bevor er das Rauschen übersteigt. Der Umsatz zittert von Woche zu Woche ganz ohne Grund. Wenn deine Treatment Gruppe die Kontrolle um zwei Prozent geschlagen hat, und dein Umsatz ohnehin von einer Woche zur nächsten natürlich um fünf oder sechs Prozent hüpft, hast du gar nichts bewiesen. Du hast ein Zittern erwischt und es als Sieg verkleidet.

Bevor du einem Uplift traust, willst du dass der Abstand zwischen den Gruppen klar größer ist als das alltägliche Zappeln in den Zahlen, und genug Leute in jeder Gruppe dass ein paar Großausgeber es nicht allein kippen. Eine grobe Regel die ich nutze: wenn der Uplift kleiner ist als das Schwanken von Woche zu Woche das du normal siehst, behandle ihn als unbewiesen und fahr weiter. Wenn der Abstand klein ist und die Gruppen klein sind, fahr länger oder halt mit dem Applaus zurück.

Design vier, Feldexperimente

Test und Kontrolle auf einer Liste ist die einfache Variante weil alle im selben Postfach sind. Ein Feldexperiment ist dieselbe Idee losgelassen in der echten Welt, über Orte und Dinge die du physisch trennen kannst. Du fährst die Kampagne in Linz und Graz und absichtlich nicht in Salzburg und Innsbruck, passende Städte, dann vergleichst du. Du legst die neue Verpackung in die Hälfte deiner Händler und die alte in die andere Hälfte. Du schaltest ein Plakat in einer Region ein und lässt die Nachbarregion dunkel.

Wann ein Feldexperiment das richtige Werkzeug ist

Greif dazu wenn das was du testen willst nicht in einem Postfach lebt. Offline Kampagnen, Radio, Außenwerbung, lokales Sponsoring, Verpackung, Aufsteller im Geschäft, Markenwerbung. Nichts davon taucht sauber in einem Klickbericht auf, und die Last Click Zurechnung ist dafür schlimmer als nutzlos. Ein Feldexperiment ist die Art wie du eine echte Zahl auf die Ausgaben legst für die dein Dashboard blind ist. Das ist das zweite worüber es sich nachzudenken lohnt. Die Kanäle die am schwersten mit Tracking zu messen sind, sind genau die die ein Feldexperiment retten kann, weil es Ergebnisse in der Welt misst statt Klicks in einem Dashboard.

Wie du eines fährst

Die Logik ist identisch zu Design drei, eine behandelte Gruppe und eine zurückgehaltene Kontrolle die denselben Zeitraum durchleben, also ist die Stärke fast genauso hoch. Die Kunst steckt im Zuordnen und im Trennen.

  1. Ordne deine Einheiten zu bevor du startest. Wähle Test und Kontrollregionen die in den Monaten vor der Kampagne gleich aussahen, ähnliche Größe, ähnlicher Trend, ähnliche Saisonalität. Zwei Städte die sich schon zusammen bewegen sind ein faires Paar.
  2. Nimm genug Einheiten. Zwei Städte gegen zwei Städte ist dünn, weil ein seltsames Ereignis in einer Stadt das ganze Ergebnis kippt. Mehr, kleinere Einheiten schlagen zwei große.
  3. Achte auf Überschwappen. Wenn deine Kontrollstadt neben deiner Teststadt liegt und Leute hin und her pendeln, leckt die Anzeige in deine Kontrolle und schrumpft den Abstand den du zu messen versuchst. Trenn sie über Geografie oder über Zeit.
  4. Miss dasselbe Ergebnis in beiden, über dasselbe Fenster, und rechne den Uplift genau wie vorher.

Ein durchgerechnetes Beispiel

Du willst wissen ob eine regionale Radiokampagne etwas bewegt. Du bedienst acht Städte. Du ordnest sie nach dem Umsatz vom Vorjahr in vier Paare, dann wirfst du innerhalb jedes Paares eine Münze um zu entscheiden welche Stadt Radio bekommt und welche ruhig bleibt. Nach sechs Wochen liegen die vier Radiostädte neun Prozent über den vier ruhigen Städten, und die ruhigen Städte bestätigen dass die Saison für keine anders war. Neun Prozent Uplift auf einem Kanal den dein Klick Dashboard als null gewertet hätte, weil Radio nicht geklickt wird. Das ist der ganze Fall für Feldexperimente in einem Ergebnis.

Design fünf, natürliche Experimente

Das cleverste der fünf, und das einzige das du nicht absichtlich fährst. Ein natürliches Experiment ist wenn dir die Welt eine Aufteilung in Test und Kontrolle gratis reicht, durch ein Ereignis das du nicht verursacht hast. Ein Zustellerstreik legt die Lieferung an die Hälfte deiner Regionen lahm und an die andere nicht. Eine Regeländerung gilt für einen Kundentyp und für einen anderen nicht. Ein Ausverkauf nimmt ein Produkt für vierzehn Tage in manchen Filialen aus dem Regal. Ein Preisfehler geht über Nacht in einem Land live.

Wann du eines ergreifst

Wann immer etwas deine Kunden durch reinen Zufall in betroffen und nicht betroffen teilt, hast du ein gratis Experiment geschenkt bekommen, und wenn du saubere Aufzeichnungen geführt hast kannst du den Effekt im Nachhinein messen. So lernst du aus Dingen die du nie absichtlich testen dürftest, große Preisbewegungen, Ausfälle, politische Änderungen, ein Lieferantenausfall. Niemand winkt einen absichtlichen Test durch der einen Preis verdoppelt oder die Lieferung an das halbe Land abschneidet. Die Welt fährt diese Tests für dich, gratis, und alles was du tun musst ist bemerken und das Ergebnis lesen.

Wie du eines liest

Der Trick ist den Zufall genau wie einen geplanten Test und Kontrolle zu behandeln, und dann ehrlich zu sein wo er zu kurz greift.

  1. Definiere die betroffene Gruppe und die nicht betroffene Gruppe über das Ereignis, nicht über etwas das du gewählt hast. Das Ereignis hat randomisiert, oder etwas nahe dran.
  2. Schnapp dir ein sauberes Vorher Bild für beide Gruppen, damit du prüfen kannst ob sie sich vor dem Ereignis zusammen bewegt haben. Wenn sie vorher nicht gleich waren, war die Aufteilung nicht so zufällig wie sie aussah.
  3. Vergleich die Veränderung in der betroffenen Gruppe mit der Veränderung in der nicht betroffenen Gruppe über dasselbe Fenster. Der Unterschied dieser zwei Unterschiede ist dein Effekt.

Effekt=(Betroffen nachher−Betroffen vorher)−(Unbetroffen nachher−Unbetroffen vorher)\text{Effekt} = (\text{Betroffen nachher} - \text{Betroffen vorher}) - (\text{Unbetroffen nachher} - \text{Unbetroffen vorher})

Diese letzte Formel hat einen Namen, Differenz von Differenzen, und sie ist das Arbeitspferd der natürlichen Experimente. Sie rechnet alles heraus was beide Gruppen getroffen hat, sodass übrig bleibt was nur die betroffene Seite getroffen hat.

Ein durchgerechnetes Beispiel

Ein Zustellerstreik stoppt die Zustellung am nächsten Tag an deine östlichen Regionen für zwei Wochen während der Westen normal läuft. Der Umsatz im Osten fällt vierzehn Prozent gegen die vierzehn Tage davor. Aber der Westen fiel auch vier Prozent, weil es überall eine ruhige Zeit war. Also hat dich der Streik nicht vierzehn Prozent gekostet, er hat dich den Abstand von zehn Prozent zwischen Ost und West gekostet, die vier Prozent waren die allgemeine Flaute die beide getroffen hat. Jetzt weißt du was die Zustellung am nächsten Tag diesen Regionen wert ist, eine Zahl die du absichtlich nie bekommen hättest. Der Haken ist dass du es bemerken musst und die Daten haben musst um zurückzuschauen, was eigentlich ein Argument dafür ist die ganze Zeit ordentliche Aufzeichnungen zu führen wer was wann gesehen hat, damit du, wenn die Welt ein Experiment für dich fährt, bereit bist es zu lesen.

Die fünf im Ranking

Hier das ganze Menü auf einem Bildschirm, sortiert danach wie stark jedes Design Ursache und Wirkung beweist gegen wie schwer es tatsächlich zu fahren ist. Stärke ist das was du willst. Aufwand ist das was du zahlst.

DesignWie stark der KausalbeweisWie schwer zu fahrenNimm es wenn
Nur danachSehr schwachSehr leichtDu keine Historie und nichts zum Vergleichen hast
Vorher und nachherSchwachLeichtDu eine grobe Lesung brauchst und die Effekte groß sind
Test und KontrolleStarkLeicht bis mittelDu eine Liste oder Datenbank hast die du zufällig teilen kannst
FeldexperimentStarkMittel bis schwerDer Kanal offline oder Marke ist und in der echten Welt lebt
Natürliches ExperimentStarkGelegenheitsabhängigDie Welt deine Kunden zufällig für dich geteilt hat

Lies die Stärkespalte hinunter und eine Sache springt heraus. Der Sprung im Beweis passiert zwischen vorher und nachher und Test und Kontrolle, und der Preis dieses Sprungs ist fast nichts. Eine Liste zufällig zu teilen ist kaum mehr Arbeit als sie ganz anzuschreiben. Das ist das ganze Argument dieses Artikels gepresst in eine Zeile einer Tabelle. Das leistbarste verlässliche Design ist das das fast jeder überspringt.

Es gibt eine zweite Art dieselbe Tabelle zu lesen, danach welche Störfaktoren jedes Design im Griff hat. Sie erklärt die Stärkespalte statt sie nur zu behaupten.

DesignSaison und Trend im GriffWettbewerber und Weltereignisse im GriffWie es das macht
Nur danachNeinNeinNichts, es ist ein Niveau
Vorher und nachherTeilweiseNeinDeine eigene Vergangenheit als Grundlinie
Test und KontrolleJaJaZufällige Teilung, gleiche Wochen
FeldexperimentJaMeistensPassende Orte, gleiche Wochen
Natürliches ExperimentJaMeistensEin Zufall teilt die Gruppen

Welches kannst du gerade jetzt fahren

Du darfst dir nicht dein Lieblingsdesign aussuchen. Du nimmst das stärkste Design das deine Lage zulässt. Dieser Baum ist wie ich in der Praxis entscheide.

Arbeite dich von oben hinunter und halt beim ersten Ja. Die meisten KMU mit irgendeiner Kundenliste landen im allerersten Zweig und sollten Test und Kontrolle fahren, also genau das Design nach dem sie nie greifen. Wenn du keine Liste teilen kannst, fällst du auf ein Feldexperiment. Wenn du gar nichts inszenieren kannst, hältst du die Augen offen für ein natürliches Experiment das dir die Welt reicht. Und nur wenn nichts davon auf dem Tisch liegt fällst du zurück auf vorher und nachher, und nur danach ist der Notsitz.

Ein durchgerechneter Mini Fall, alle fünf in einem Geschäft

Lass es mich mit einem Geschäft zusammensetzen, denn die Leiter in einem einzigen Geschäft hochklettern zu sehen macht es haltbar. Stell dir einen mittelgroßen Online und Straßenhändler vor, ein paar tausend Namen auf der Liste, acht Filialen im Land. Sie wollen wissen ob ihre Frühlingskampagne es wert ist wiederholt zu werden.

Jahr eins tun sie was jeder tut. Sie fahren die Kampagne überall, der Umsatz steigt, sie nennen es einen Sieg. Das beweist nichts, weil der Frühling sie ohnehin jedes Jahr hebt.

Jahr zwei rede ich sie zu einem zurückgehaltenen Teil. Neunzig Prozent der Liste bekommen die Frühlingsmails, zehn Prozent, zufällig gewählt, bekommen nichts. Die angeschriebene Gruppe gibt neun Prozent mehr pro Kopf aus als der zurückgehaltene Teil über dieselben sechs Wochen. Diese neun Prozent sind echt, zusätzlich und verteidigbar, weil die Saison beide Gruppen gleich getroffen hat. Zum ersten Mal wissen sie dass die E Mail Hälfte der Kampagne sich rechnet.

Dasselbe Jahr fahren sie auch Radio in vier ihrer acht Städte, nach dem Umsatz vom Vorjahr passend gemacht gegen die vier die sie ruhig lassen. Die Radiostädte kommen sieben Prozent über den ruhigen herein. Jetzt hat die Offline Hälfte auch eine Zahl, eine die ihr Klick Dashboard ihnen nie hätte geben können.

Dann steuert die Welt etwas bei. Ein Lieferant fällt aus und eine Produktlinie ist in drei Filialen für vierzehn Tage ausverkauft. Sie führten saubere Aufzeichnungen, also fahren sie danach die Differenz von Differenzen gegen die fünf Filialen die auf Lager blieben, und lernen was diese Linie im Regal wert ist.

Bis Jahr zwei rät dieses Geschäft nicht mehr. Jeder Teil der Frühlingsaktion hat eine verteidigbare Zahl dran, gebaut aus Designs die jeweils fast nichts kosten gegenüber dem bloßen Ausgeben des Geldes. Das ist der ganze Punkt der Leiter. Du kletterst so hoch wie deine Lage es zulässt, und du weigerst dich vorzugeben du wärst höher geklettert als du es bist.

Häufige Fehler die die Antwort still ruinieren

Sogar Leute die einen zurückgehaltenen Teil fahren schaffen es ihn zu vergiften. Das sind die die ich am meisten sehe.

  1. Die Kontrollgruppe von Hand bauen statt zufällig. In dem Moment in dem du die zwei Gruppen nach irgendeiner Regel wählst, wird die Regel zum Störfaktor und der Vergleich ist tot.
  2. Den zurückgehaltenen Teil trotzdem anschreiben, weil es schade schien es nicht zu tun. Ein schwacher Moment und dein Maßstab ist weg.
  3. Das falsche Ergebnis messen. Öffnungen und Klicks sind kein Umsatz. Eine Kampagne kann Öffnungen heben und kein Geld bewegen.
  4. Ein Zittern einen Sieg nennen. Wenn der Uplift kleiner ist als dein normales Schwanken von Woche zu Woche, hast du noch nichts bewiesen, so sehr du es auch willst.
  5. Früh spähen und in dem Moment aufhören in dem es gut aussieht. Stopp die Uhr wann du es geplant hast, nicht wenn die Zahl dir schmeichelt.
  6. Die Kostenseite ignorieren. Ein Uplift von zwanzig Prozent der mehr gekostet als verdient hat ist ein Fehlschlag mit guter PR.

Keines davon braucht einen Statistiker um es zu vermeiden. Sie brauchen dass du die Regeln festlegst bevor du auf die Zahlen schaust, und dann die Nerven behältst.

Was das am Montag tatsächlich ändert

Nichts davon ist Theorie die du weglegst. Es ändert eine Gewohnheit. Vor deiner nächsten Kampagne stell eine einzige Frage. Was ist meine Kontrollgruppe. Wenn du sie beantworten kannst, ein zurückgehaltener Teil der Liste, ein passendes Set an Städten, eine echte Grundlinie, bist du dabei etwas Echtes zu lernen. Wenn du sie nicht beantworten kannst, bist du dabei Geld auszugeben und dir dann eine Geschichte darüber zu erzählen was es getan hat.

Hier ist der ganze Artikel als Routine die du jedes Mal fahren kannst.

  1. Bevor du startest, schreib auf was du erwartest und was als Sieg zählen würde.
  2. Entscheide deine Kontrollgruppe. Wenn du eine Liste hast, halt zehn Prozent zufällig zurück und lass sie in Ruhe.
  3. Wähle ein Ergebnis das Löhne zahlt, meist Umsatz pro Person, und ignorier Eitelkeitszahlen.
  4. Fahr die Kampagne, wart den echten Kaufzyklus ab, rechne den Uplift und prüf ob er dein normales Rauschen übersteigt.
  5. Mach aus dem Uplift eine Rendite indem du den zusätzlichen Gewinn gegen die Kosten setzt, dann schreib alles auf damit die nächste Kampagne etwas Ehrliches zu schlagen hat.

Die Inhaber die über die Jahre aufsummieren sind nicht die mit den cleversten Anzeigen. Es sind die die, still und ständig, ein bisschen zurückhalten damit sie sagen können was funktioniert. Es ist die unglamouröseste Gewohnheit im Marketing und die die sich am schnellsten selbst bezahlt.

Wenn du Hilfe dabei willst das in die Art einzubauen wie du Kampagnen fährst, eine echte zurückgehaltene Gruppe in deine E Mails und Anzeigen zu verdrahten und die Messung so aufzusetzen dass dir jede Aktion die Wahrheit sagt, ist das genau die Art von Arbeit die ich mache. Schau dir an wie ich an Performance Marketing herangehe, oder buch einen Termin und bring die letzte Kampagne mit bei der du dir nicht ganz sicher warst. Wir finden heraus ob sie tatsächlich gewirkt hat.

Wenn deine Kampagnen mit der Umsatz ist gestiegen also hat es gewirkt enden und du nie einmal eine Kontrollgruppe zurückgehalten hast um es zu prüfen, lass uns das gemeinsam beheben. Buch einen Termin und wir entwerfen ein einfaches Test und Kontrolle für deine nächste Aktion, damit du zum ersten Mal weißt was dein Marketing wirklich tut statt zu raten.

1%jeder Rechnung geht an eine Charity, die du wählst.

Eine Spende, nie Sponsoring. Du wählst das Anliegen beim Onboarding.

Die Geschichte hinter dem Versprechen →

Bleib deiner Konkurrenz voraus.

Die neuesten innovativen Produkte und Services, direkt in dein Postfach, bevor deine Mitbewerber davon hören.

Sichere dir bis zu 5% auf deine ersten sechs Monate: 1% pro gewähltem Thema, die vollen 5% wenn du alles nimmst. Limitiertes Angebot · endet am 31. Dezember 2026.

Nur für Neukunden. Es gelten die AGB.

* Bis zu 5% auf deine ersten sechs Monatsrechnungen, nur für Neukunden. Alle Bedingungen.

Fragen zu Preisen, Verträgen oder zur Zusammenarbeit?

Zu den FAQ