Die Statistik, die jeder Marketer wirklich braucht
Jeder Marketingbericht steht auf einer Handvoll statistischer Ideen, und die meisten davon werden stillschweigend falsch benutzt. "Durchschnittlicher Bestellwert" ist fast immer der Mittelwert, aufgeblasen von ein paar Firmenwalen. Zwei Kampagnen werden verglichen, ohne dass jemand fragt, wie viele Bestellungen hinter jeder Zahl stecken. Eine Korrelation zwischen Newsletteröffnungen und Wiederbestellungen wird bis zum Mittagessen zu "E Mail treibt Loyalität". In diesem Auftaktkapitel gehe ich die Statistik durch, die du wirklich brauchst, anhand der Bestellungen aus The Gift Bow, meinem Solidus Demoshop für Geschenkkörbe: die drei Durchschnitte und warum der Median dich vor den Walen rettet, Varianz und Standardabweichung, die Normalkurve und die 68/95/99,7 Regel, der Standardfehler und warum grössere Stichproben ihn schrumpfen lassen, Konfidenzintervalle und was sie wirklich versprechen, eine schlichte Lesart des p Werts, und Pearsons Korrelation mit ihrer Kausalitätsfalle. Jede Formel ist ausgeschrieben, jedes Symbol erklärt, mit Tabellen, die du für deinen eigenen Shop übernehmen kannst. Das ist Teil 1 von 21 der Marketing Analytics Serie.
Der Wal im Geschenkkorb
Jeden Dezember läuft im Gift Bow, meinem Solidus Demoshop für Geschenkkörbe auf hampers.keferboeck.com, dasselbe Gespräch ab. Jemand öffnet das Admin Dashboard, sieht "durchschnittlicher Bestellwert £102" und plant das Werbebudget fürs nächste Jahr um einen Warenkorb von £100 herum. Dann ziehe ich die echten Bestellungen. Von den 1.000 Bestellungen vor Weihnachten liegen rund 900 zwischen £30 und £150. Eine Handvoll nicht: eine Linzer Anwaltskanzlei bestellt 40 Körbe für ihre Klienten, eine Wiener Steuerberatungskanzlei 25, und zwei britische Firmen schicken Geschenkboxen an die ganze Belegschaft. Zwanzig Bestellungen über £500 tragen rund ein Fünftel des Umsatzes. Nimm sie raus, und der "durchschnittliche" Kunde gibt plötzlich £83 aus statt £102. Die Zahlen in diesem Artikel sind illustrativ, die Form aber ist echt. Ich habe sie in jedem Shop gesehen, den ich je angeschaut habe.
Die Lücke zwischen £102 und £83 ist kein Rundungsfehler. Sie entscheidet, wie viel du für einen Klick zahlen kannst, ob die Schwelle für kostenlosen Versand bei £60 oder £90 liegt, und ob das Firmenkundensegment eine eigene Landingpage oder gleich einen eigenen Vertrieb verdient. Statistik, die langweilige Sorte, bei der du vielleicht geschlafen hast, ist der Werkzeugkasten, der dich davor bewahrt, eine Strategie auf eine Zahl zu bauen, die nur in einer Tabellenzelle existiert.
Wo dieses Kapitel in der Serie steht
Das ist das erste von 21 Kapiteln und der Auftakt von Teil eins, der erklärt, wie Analytics überhaupt hilft (Kapitel 1 bis 3). Es legt das Fundament, auf dem jedes spätere Kapitel steht: Mittelwerte, Streuung, die Normalverteilung, Konfidenzintervalle und Korrelation. Das nächste Kapitel, Konsumentenverhalten ist die Basis der Marketingstrategie, nicht der Nachgedanke, geht von den Zahlen zu den Menschen, die sie erzeugen. Wenn du vorher eine sanftere Auffahrt willst: mit Die Mathematik hinter allem habe ich eine breitere Tour durch das Rechnen geschrieben, das Growth Marketing wirklich braucht.
Drei Durchschnitte, und nur einer ist ehrlich
"Durchschnitt" ist nicht eine Sache. Es gibt drei gängige Masse für die Mitte einer Verteilung, und sie beantworten verschiedene Fragen.
Der Mittelwert, das arithmetische Mittel, ist der, den alle rechnen: alles zusammenzählen, durch die Anzahl teilen.
Dabei ist (gesprochen "x quer") der Mittelwert, die Anzahl der Bestellungen und der Wert der ten Bestellung. Der Mittelwert hat eine schöne und eine gemeine Eigenschaft. Die schöne: mal ergibt er den Gesamtumsatz, deshalb liebt ihn die Buchhaltung. Die gemeine: jede einzelne Bestellung zieht mit ihrem vollen Gewicht an ihm, eine Firmenbestellung von £2.400 also so stark wie 48 Bestellungen zu £50. In einem Shop mit langem rechten Schwanz wandert der Mittelwert zu den Walen.
Der Median ist der mittlere Wert, wenn du alle Bestellungen von der kleinsten zur grössten sortierst. Für die 1.000 Dezemberbestellungen des Gift Bow liegt er bei £68. Die Hälfte der Kunden hat weniger ausgegeben, die Hälfte mehr. Die Kanzlei hätte statt £2.400 auch £24.000 bestellen können, der Median hätte sich keinen Penny bewegt. Genau diese Robustheit ist der Grund, warum ich den Median für "was gibt ein typischer Kunde aus" verwende.
Der Modus ist der häufigste Wert. In einem Geschenkkorbshop mit Fixpreisen ist das meist einfach der Preis des Bestsellers, hier der Classic Korb um £49. Der Modus sagt dir, was dein Shop in den Augen der meisten Käufer ist: ein £49 Shop, der gelegentlich eine £2.400 Bestellung verkauft.
Mittelwert £102, Median £68, Modus £49. Wenn die drei in dieser Reihenfolge liegen, Mittelwert ganz oben, hast du eine rechtsschiefe Verteilung, und fast jede Verteilung von Bestellwerten im E Commerce ist rechtsschief. Wenn dir jemand einen einzelnen "durchschnittlichen Warenkorb" nennt, frag, welchen. Wenn er es nicht weiss, war es der Mittelwert, und er ist zu hoch. Ich habe über diese Falle einen eigenen Artikel geschrieben, Statistisches Denken für Growth Hacker: warum Durchschnitte dich anlügen, weil sie KMU jedes Jahr echtes Geld kostet.
Wie breit ist es: Varianz, Standardabweichung und Variationskoeffizient
Zwei Shops können denselben Mittelwert von £102 haben und völlig verschiedene Unternehmen sein. Der eine verkauft alles zwischen £95 und £110. Der andere verkauft £49 Körbe und £2.400 Firmenbestellungen. Du brauchst eine Zahl für die Streuung.
Die Varianz ist der durchschnittliche quadrierte Abstand vom Mittelwert:
ist die Stichprobenvarianz, ist der Abstand jeder Bestellung vom Mittelwert, das Quadrieren macht jeden Abstand positiv und bestraft grosse Abstände stärker als kleine, und die Division durch statt ist eine kleine Korrektur, weil wir den Mittelwert aus derselben Stichprobe schätzen. Die Varianz ist in Pfund zum Quadrat gemessen, was sich niemand vorstellen kann, also ziehen wir die Wurzel:
ist die Standardabweichung, wieder in Pfund. Für unsere 1.000 Bestellungen liegt sie bei etwa £158. Ja, grösser als der Mittelwert. Das macht ein langer Schwanz. Hier die ganze Verteilung als Histogramm:
Illustratives Histogramm der Bestellwerte. Beachte die ungleichen Klassenbreiten: die letzten drei Klassen sind breit und trotzdem fast leer, und halten doch ein Fünftel des Umsatzes.
Der Variationskoeffizient setzt die Streuung ins Verhältnis zum Mittelwert:
Für den Gift Bow ist . Alles über 1 sagt mir, dass der Mittelwert keine brauchbare Beschreibung einer typischen Bestellung ist. Ein SaaS wie Werkbank mit Tarifen um €29, €59 und €119 hat einen CV um 0,5, und dort ist der mittlere Umsatz pro Account eine völlig brauchbare Zahl.
Hier die Zusammenfassung, die ich auf die erste Seite jedes E Commerce Berichts setzen würde:
| Kennzahl | Wert | Was sie dir sagt |
|---|---|---|
| Bestellungen | 1.000 | Die Stichprobengrösse, immer zuerst |
| Mittelwert | £102 | Umsatz pro Bestellung; treibt die Summe |
| Median | £68 | Was ein typischer Kunde ausgibt |
| Modus | £49 | Der Preis des Bestsellers |
| Standardabweichung | £158 | Streuung; hier grösser als der Mittelwert |
| Variationskoeffizient | 1,55 | Streuung relativ zum Mittelwert; über 1 heisst "trau dem Mittelwert nicht allein" |
| Minimum | £18 | Ein einzelnes Glas Chutney |
| Maximum | £2.400 | Die Linzer Kanzlei |
| Bestellungen über £500 | 20 (2 %) | Rund 20 % des Umsatzes |
Lies sie von oben nach unten. Mittelwert und Median unterscheiden sich um ein Drittel, also ist die Verteilung schief. Die Standardabweichung übersteigt den Mittelwert, also ist die Schiefe heftig. Die letzte Zeile nennt den Schuldigen: 2 % der Bestellungen, 20 % des Geldes. Diese eine Tabelle sagt dir schon, dass im Gift Bow zwei Geschäfte stecken, ein £68 Geschenkshop und ein Firmengeschenkservice, und dass die beiden wahrscheinlich kein gemeinsames Werbebudget teilen sollten. Kapitel 13 zur Segmentierung macht diese Trennung formal.
Die Glockenkurve und die 68/95/99,7 Regel
Die Normalverteilung ist die symmetrische Glockenform aus der Schule. Zwei Zahlen beschreiben sie vollständig, ihr Mittelwert und ihre Standardabweichung , und es gibt eine Daumenregel, die es wert ist, auswendig gelernt zu werden: rund 68 % der Werte liegen innerhalb einer Standardabweichung um den Mittelwert, rund 95 % innerhalb von zwei, rund 99,7 % innerhalb von drei.
Die Normalkurve mit ihren drei Bändern. In einer normalverteilten Welt ist ein Wert, der mehr als zwei Standardabweichungen vom Mittelwert entfernt liegt, ein Ereignis von eins zu zwanzig.
Um einen einzelnen Wert auf dieser Kurve zu platzieren, standardisierst du ihn zu einem z Wert:
ist der Wert, den du anschaust, der Mittelwert und die Standardabweichung der Grundgesamtheit, aus der er stammt. Ein z Wert von 2 heisst "zwei Standardabweichungen über dem Mittelwert", egal in welcher Einheit. Eine Gift Bow Kundin, die in einem Jahr 15 Newsletter geöffnet hat, bei einem Mittelwert von 6 und einer Standardabweichung von 4, hat : ungewöhnlich engagiert, die obersten paar Prozent, wenn Öffnungen normalverteilt wären.
Jetzt der unbequeme Teil. Sind Bestellwerte normalverteilt? Nicht im Geringsten. Wären sie es, würde die 68 % Regel bei Mittelwert £102 und Standardabweichung £158 sagen, dass ein Sechstel der Bestellungen unter minus £56 liegt. Niemand bezahlt mich dafür, einen Korb wieder abzuholen. Das Histogramm oben ist schief, bei null begrenzt und rechts schwer, und kein Wunsch der Welt macht daraus eine Glocke. Warum also bringt man Marketern trotzdem die Normalverteilung bei?
Wegen des nächsten Abschnitts.
Der Standardfehler: warum der Mittelwert eines schiefen Shops trotzdem brav ist
Stell dir vor, du ziehst 1.000 zufällige Dezemberbestellungen, rechnest den Mittelwert, machst es mit frischen 1.000 noch einmal, und noch einmal, tausende Male. Jeder Stichprobenmittelwert wäre ein bisschen anders. Die Streuung dieser Stichprobenmittelwerte heisst Standardfehler, und sie ist bemerkenswert brav:
ist die Standardabweichung der einzelnen Bestellungen, die Stichprobengrösse. Für den Gift Bow: . Obwohl also einzelne Bestellungen um £158 streuen, streut der Mittelwert von 1.000 davon nur um etwa £5.
Und hier kommt der Punkt, der die ganze Glockenkurvenlektion rechtfertigt: die Verteilung dieser Stichprobenmittelwerte ist annähernd normal, obwohl die Bestellungen selbst es nicht sind. Dieses Ergebnis, der zentrale Grenzwertsatz, greift verlässlich, sobald du ein paar Dutzend Beobachtungen hast, und ist der Grund, warum Konfidenzintervalle und Signifikanztests auf hässlichen, schiefen, echten Marketingdaten funktionieren. Der einzelne Kunde ist nicht normal. Der Durchschnitt vieler Kunden schon.
Die Wurzel im Nenner hat eine geschäftliche Konsequenz, die ich Kunden jeden Monat erkläre. Um deine Unsicherheit zu halbieren, brauchst du viermal so viele Daten. Um sie auf ein Zehntel zu drücken, hundertmal so viele.
Abnehmender Ertrag. Die ersten 400 Bestellungen kaufen dir den Grossteil der Präzision, die du je bekommen wirst; die nächsten 6.000 kaufen erstaunlich wenig.
Konfidenzintervalle: was sie versprechen und was nicht
Ein Konfidenzintervall macht aus dem Standardfehler eine Spanne, die du in ein Memo schreiben kannst:
ist der Stichprobenmittelwert, der Standardfehler, und ist der Faktor für das Konfidenzniveau, das du willst: 1,96 für 95 %, 1,64 für 90 %, 2,58 für 99 %. (Bei kleinen Stichproben, unter etwa 30, ersetzt du durch den etwas grösseren Wert aus der t Verteilung; jede Statistikbibliothek macht das für dich.) Für den mittleren Bestellwert des Gift Bow: , also £92 bis £112.
Was ein 95 % Intervall verspricht: würdest du die ganze Übung viele Male wiederholen, enthielten 95 % der berechneten Intervalle den wahren Mittelwert. Was es nicht verspricht: dass der wahre Mittelwert mit 95 % Wahrscheinlichkeit in genau diesem Intervall liegt, und schon gar nicht, dass 95 % der Bestellungen hineinfallen (tun sie nicht; das Intervall handelt vom Mittelwert, nicht von einzelnen Bestellungen). Verzeih einer Agentur, die bei dieser Unterscheidung stolpert, ich tue es müde selbst. Verzeih keiner, die nie ein Intervall ausweist.
Hier verdienen die Intervalle ihr Geld. Zwei Meta Kampagnen liefen im November, "Family Christmas" für Schenkende und "Treat Yourself" für Selbstkäufer, dazu der Newsletter als eigener Kanal. Der Agenturbericht sagte, "Treat Yourself" liefere einen um £7 höheren Warenkorb und solle mehr Budget bekommen.
| Kanal | Bestellungen | Mittelwert | Median | Standardabweichung | Standardfehler | 95 % Intervall für den Mittelwert |
|---|---|---|---|---|---|---|
| Family Christmas (Meta) | 180 | £74 | £62 | £38 | £2,83 | £68,5 bis £79,5 |
| Treat Yourself (Meta) | 95 | £81 | £59 | £61 | £6,26 | £68,7 bis £93,3 |
| Newsletter (eigener Kanal) | 240 | £69 | £64 | £30 | £1,94 | £65,2 bis £72,8 |
Lies sie Zeile für Zeile. Family Christmas: 180 Bestellungen, moderate Streuung, also ein enges Intervall von etwa plus minus £5,5. Treat Yourself: weniger Bestellungen und eine grössere Streuung (ein paar Selbstkäufer haben mehrere Körbe auf einmal gekauft), also ein mehr als doppelt so breites Intervall. Die beiden Intervalle überlappen fast vollständig. Der Newsletter hat den niedrigsten Mittelwert, aber das engste Intervall, weil er die meisten Bestellungen und die ruhigsten Kunden hat.
Schau auch auf die Mediane. Treat Yourself hat den höchsten Mittelwert, aber den niedrigsten Median. Sein "höherer Warenkorb" ist eine Handvoll grosser Bestellungen, kein typischer Kunde, der mehr ausgibt.
Um den Unterschied von £7 sauber zu testen, rechnest du den Standardfehler der Differenz, , und teilst: . Das ist ein z Wert von etwa 1, was einem zweiseitigen p Wert von rund 0,31 entspricht.
Eine schlichte Lesart dieses p Werts: wenn die beiden Kampagnen in Wahrheit denselben Warenkorb erzeugen, siehst du eine Lücke von £7 oder mehr etwa jedes dritte Mal, allein durch die zufällige Mischung derer, die gerade geklickt haben. Das ist kein Beleg. Das ist ein Dienstag. Der p Wert ist nicht "die Wahrscheinlichkeit, dass die Kampagnen gleich sind" und auch nicht "die Wahrscheinlichkeit, dass die Agentur falsch liegt"; er ist die Wahrscheinlichkeit von Daten, die mindestens so extrem sind, wenn es keinen echten Unterschied gibt. Um eine echte Lücke von £7 bei diesen Streuungen mit der üblichen Power von 80 % nachzuweisen, bräuchtest du grob 800 Bestellungen pro Kampagne; die Grössenordnung ist typisch. Mehr dazu, auch warum 0,05 eine Konvention und kein Naturgesetz ist, steht in Die Bedeutung von statistischer Signifikanz und Fehlermargen.
Das ehrliche Entscheidungsmemo sagt: "Kein nachweisbarer Unterschied in der Warenkorbgrösse zwischen den beiden Kampagnen. Verteile nach Kosten pro Bestellung, wo die Lücke grösser und die Stichprobe dieselbe ist." Das ist eine echte Entscheidung, mit einer Zahl und einem Risiko, und sie schlägt jedes Budget, das wegen Rauschen verschoben wird.
Korrelation: Vorzeichen, Stärke und die Kausalitätsfalle
Bis hierher beschrieb jede Zahl eine Variable. Marketing handelt von Paaren: bewegt Spend den Umsatz, bewegen Newsletteröffnungen Wiederbestellungen, bewegen Rabatte die Warenkorbgrösse. Die Kovarianz misst, ob zwei Variablen gemeinsam schwanken, aber ihre Einheit ist sinnlos (Pfund mal Öffnungen). Pearsons Korrelationskoeffizient teilt die Einheiten weg:
und sind die beiden Messungen für Kunde , und ihre Mittelwerte. Der Zähler ist die (skalierte) Kovarianz, der Nenner das Produkt der beiden (gleich skalierten) Standardabweichungen, also landet immer zwischen minus 1 und plus 1. Zwei Dinge liest du getrennt: das Vorzeichen sagt dir die Richtung, die Grösse die Stärke. Und sagt dir, welchen Anteil der Schwankung der einen Variable eine Gerade durch die andere abdecken kann.
Für 640 Gift Bow Kunden, die über zwölf Monate den Newsletter bekommen haben:
| Variablenpaar | r | r Quadrat | Ehrliche Lesart |
|---|---|---|---|
| Newsletteröffnungen und Wiederbestellungen | 0,31 | 0,10 | Positiv, bescheiden. Öffnungen gehen mit Nachbestellungen einher, decken aber nur ein Zehntel der Schwankung ab |
| Rabatthöhe und Bestellwert | minus 0,42 | 0,18 | Negativ, moderat. Grössere Rabatte, kleinere Körbe |
| Seiten pro Sitzung und Bestellwert | 0,08 | 0,01 | Praktisch nichts, egal was das Heatmap Tool behauptet |
| Erster Bestellwert und zweiter Bestellwert | 0,56 | 0,31 | Stark für Marketingdaten; grosse Erstkäufer bleiben gross |
Die erste Zeile ist die, auf die alle sofort handeln wollen: "Öffnungen treiben Wiederbestellungen, also mehr E Mails schicken". Langsam. Kunden, die Geschenkkörbe lieben, öffnen den Newsletter und bestellen nach; die Liebe verursacht beides. Kunden, die kurz vor einer Firmenbestellung stehen, öffnen die E Mail, um die Telefonnummer zu finden. Korrelation kann "E Mail verursacht Nachbestellungen" nicht von "Nachbestellungen verursachen Öffnungen" und nicht von "etwas Drittes verursacht beides" trennen. Die einzige saubere Antwort ist ein Holdout Test, und der ist die Aufgabe von Kapitel 20 über statistisches Testen. Was dir die Korrelation sehr wohl einbringt, ist eine Hypothese, die einen Test wert ist, und eine grobe Obergrenze dafür, wie viel es ausmachen könnte.
Zwei Warnungen zur Korrelation, die ständig zubeissen. Pearsons sieht nur Geraden: ein Zusammenhang, der erst steigt und dann fällt (Werbefrequenz gegen Conversion ist der Klassiker), kann ein nahe null haben und trotzdem sehr real sein. Und ein einzelner Wal kann aus nichts eine Korrelation herstellen: eine Kundin mit 30 Öffnungen und 6 Bestellungen zieht in einem Datensatz von 640 nach oben, das ist die Schwäche des Mittelwerts mit anderem Hut. Zeichne es, bevor du es zitierst.
So führst du das wirklich durch
Du brauchst kein Data Warehouse. Du brauchst die Bestelltabelle und vierzig Minuten.
Fang mit SQL gegen deine Shopdatenbank an. In einem Solidus Shop liegen die abgeschlossenen Bestellungen in einer Tabelle:
select
count(*) as orders,
avg(total) as mean_value,
percentile_cont(0.5) within group (order by total) as median_value,
stddev_samp(total) as sd,
stddev_samp(total) / sqrt(count(*)) as standard_error,
min(total), max(total),
count(*) filter (where total > 500) as whales
from spree_orders
where state = 'complete'
and completed_at >= date '2025-11-01'
and completed_at < date '2026-01-01';
Dann teilst du nach Kanal (die UTM Quelle, die du an der Bestellung speicherst, oder das Kampagnenfeld), und du hast die Kampagnentabelle von oben. Für die Intervalle und die Korrelation ein paar Zeilen Python:
import numpy as np
from scipy import stats
def mean_ci(x, level=0.95):
x = np.asarray(x, dtype=float)
n = len(x)
se = x.std(ddof=1) / np.sqrt(n)
t = stats.t.ppf((1 + level) / 2, df=n - 1)
return x.mean(), x.mean() - t * se, x.mean() + t * se
mean_a, lo_a, hi_a = mean_ci(orders_family["total"])
mean_b, lo_b, hi_b = mean_ci(orders_treat["total"])
r, p = stats.pearsonr(customers["opens"], customers["repeat_orders"])
Welche Daten du brauchst: eine Zeile pro Bestellung mit Wert, Datum, Kanal und Kunden ID; eine Zeile pro Kunde mit den Engagement Kennzahlen, die dich interessieren. Zwölf Monate reichen für einen ersten Durchgang; unter neunzig Tagen lügt dich die Saisonalität an.
Wie lange es dauert: ein Nachmittag, um die Zahlen zu ziehen, ein Tag, um über die Definitionen zu streiten (ist eine erstattete Bestellung eine Bestellung, zählt eine Firmenrechnung als eine Bestellung oder als vierzig). Das Streiten ist der wertvolle Teil.
Prüfungen, bevor du vertraust. Zeichne das Histogramm, bevor du irgendetwas rechnest, denn deine Augen fangen einen Datenfehler (Testbestellungen, ein Währungsdurcheinander, doppelte Zeilen) schneller als jede Statistik. Vergleiche Mittelwert und Median; wenn sie um mehr als 20 % auseinanderliegen, weise beide aus. Prüfe die Stichprobengrösse in jeder Gruppe, bevor du Gruppen vergleichst. Such die Wale und entscheide schriftlich, ob sie in die Analyse gehören oder in eine eigene. Und weise nie einen Mittelwert ohne Standardfehler oder Intervall daneben aus.
Fallen, die ich immer wieder sehe
Den Mittelwert einer schiefen Variable als typisch ausweisen. Durchschnittlicher Bestellwert, durchschnittliche Sitzungsdauer, durchschnittlicher Customer Lifetime Value: alle rechtsschief, alle vom Schwanz aufgeblasen. Weise den Median daneben aus, oder modelliere den Logarithmus des Werts (Kapitel 4 tut das für Elastizitäten, wo es auch die Mathematik repariert).
Gruppen ohne ihre Stichprobengrössen vergleichen. Eine Kampagne mit 40 Bestellungen und einem Warenkorb von £95 schlägt nicht eine mit 900 Bestellungen und £80; das ist ein Münzwurf mit guter Geschichte. Die Breite des Intervalls ist das ehrliche Mass dafür, wie viel eine Zahl sagen darf.
Einen p Wert als Wahrscheinlichkeit behandeln, dass eine Behauptung stimmt. Er ist eine Aussage über die Daten unter der Annahme, dass es keinen Effekt gibt, nicht über die Behauptung. Und wer denselben Vergleich jeden Tag rechnet und stoppt, sobald er 0,05 unterschreitet, "findet" garantiert irgendwann einen Effekt, den es nicht gibt. Leg die Stichprobengrösse vorher fest.
Die Streuung einzelner Werte mit der Streuung des Mittelwerts verwechseln. "Unsere Kunden geben £102 plus minus £10 aus" ist eine Aussage über den Mittelwert. Einzelne Kunden geben £18 bis £2.400 aus. Wer einen Lagerbestand oder eine Betrugsschwelle mit dem Intervall des Mittelwerts festlegt, liegt oft falsch.
Die Wale stillschweigend weglassen. Die 20 Firmenbestellungen auszuschliessen ist legitim und oft richtig, aber es verändert den Mittelwert um ein Fünftel. Sag es im Bericht, jedes Mal, und behalte eine zweite Tabelle mit ihnen drin.
So mache ich das für Kunden
Wenn mich ein Kunde bittet, "auf die Zahlen zu schauen", ist das erste Ergebnis genau das Material aus diesem Kapitel, angewandt auf seine eigenen Daten, kein Modell. Es beginnt mit dem kostenlosen Workshop, zwei Stunden, in denen wir festlegen, welche Entscheidung die Zahlen verändern sollen: Werbebudget, Versandschwelle, ob Firmenkunden einen eigenen Funnel verdienen. Dann nehme ich mir zwei Wochen auf meine Rechnung. Ich brauche Lesezugriff auf die Bestelltabelle (Solidus, Shopify, WooCommerce oder ein CSV Export, wenn es nur den gibt), die Marketingausgaben nach Kanal und Woche, und die Engagement Daten, die schon gesammelt werden. Ich brauche kein Data Warehouse, keinen Tag Manager Umbau und kein neues Tool.
Zurück kommt ein kurzes Dokument statt eines Dashboards: die beschreibende Tabelle von oben für das ganze Geschäft und für jeden Kanal und jedes Segment, jeder Mittelwert mit seinem Intervall und dem Median daneben, eine Seite Korrelationen mit Streudiagrammen und einem klaren Vermerk, welche einen Test wert sind, und ein Entscheidungsmemo, das sagt "tu das, erwarte ungefähr jenes, hier ist das Risiko". Wo die Antwort lautet "du hast nicht genug Daten, um es zu wissen", steht das drin, mit der Anzahl Bestellungen, die du bräuchtest. Du besitzt jede Abfrage und jedes Diagramm; sie liegen in deinem Repository, nicht in meinem.
Wenn dieser erste Monat nützlich ist, wächst daraus meist laufende Data Science Arbeit, oder Performance Marketing, bei dem ich die Kampagnen gegen die Intervalle steuere statt gegen die Durchschnitte. Die kommerziellen Bedingungen stehen auf der Preisseite: eine fixe monatliche Pauschale, die zur Arbeit passt, oder eine Provision auf gemessenes Wachstum, wo das Tracking sauber genug ist, um es ehrlich zu messen.
Fragen an dein Team oder deine Agentur
- Wenn ihr "durchschnittlicher Warenkorb" sagt, ist das der Mittelwert oder der Median, und wie weit liegen die beiden auseinander?
- Wie gross ist die Standardabweichung, und wie viele Bestellungen liegen mehr als zwei davon über dem Mittelwert?
- Wie viele Bestellungen stecken in jeder Gruppe, die ihr vergleicht, und wie breit ist das Konfidenzintervall um jeden Mittelwert?
- Was müssten wir sehen, und wie viele Bestellungen bräuchte es, um sicher zu sein, dass der Unterschied echt ist?
- Habt ihr die Verteilung gezeichnet, bevor ihr etwas daraus gerechnet habt?
- Welche Korrelationen in diesem Bericht haben eine plausible kausale Geschichte, und welche würdet ihr tatsächlich mit einem Holdout testen?
- Wurden Bestellungen ausgeschlossen, und zeigt der Bericht die Zahlen mit und ohne sie?
Diese Serie ist inspiriert von Mike Grigsbys Marketing Analytics (Kogan Page). Erklärungen, Beispiele und Zahlen hier sind meine eigenen.