Big Data für Marketer: was sich wirklich ändert und was nicht

Das letzte Kapitel beginnt mit einer Anbieterfolie, die versprach, die Big Data eines Geschenkkorbshops mit 20.000 Kunden zu entfesseln, und mit einem SaaS Gründer, der glaubt, auf 40 Millionen ungenutzten Ereignissen zu sitzen. Keiner von beiden hat, was die Folie meinte, und die beiden Situationen auseinanderzuhalten ist die eigentliche Fähigkeit. Ich definiere die drei Vs ohne Umschweife, zeige mit einer Lernkurve, warum mehr Zeilen eine Antwort schärfen, aber eine verzerrte Frage nie reparieren, und erkläre Gradient Boosting, neuronale Netze, Clustering im grossen Massstab und Empfehlungssysteme in Worten, die ein Marketer weitersagen kann, mit einer Tabelle, wann jedes die Regression schlägt, die du schon kennst. Das Rechenbeispiel ist ein Mailtest mit drei Armen bei The Gift Bow: Bestseller gegen eine Regression mit zwei Variablen gegen ein Empfehlungssystem, mit einem Ergebnis, das die Frage für Shops dieser Grösse entscheidet. Dann zeichne ich den kleinen Datenstack, den ein KMU wirklich braucht, baue Datenschutz hinein statt darum herum und sage, wo Sprachmodelle 2026 wirklich hinpassen. Das ist Teil 21 von 21 der Serie Marketing Analytics.

Die Folie, die alles versprochen hat

Letzten Herbst sass ich bei einem Anbieterpitch neben der Inhaberin von The Gift Bow, meinem Solidus Demoshop für Geschenkkörbe, den ich in dieser Serie behandle, als wäre er ein echter Kunde. Auf der Folie stand "Unlock the power of your big data". Der Shop hat rund 20.000 Kunden, 61.000 Bestellzeilen und 240 Produkte. Das alles passt in eine Tabellenkalkulation. Der Anbieter wollte eine fünfstellige Jahreslizenz, um die Daten in eine Customer Data Platform zu streamen und KI gestützte Empfehlungen darauf laufen zu lassen. Danach fragte mich die Inhaberin, ein bisschen verlegen, ob sie Big Data habe. Hat sie nicht. Sie hat einen guten kleinen Datensatz und drei oder vier Fragen, die sie ihm noch nie gestellt hat.

Eine Woche später erzählte mir der Gründer von Werkbank, der Rails SaaS für Handwerksbetriebe, die ich ebenfalls als Beispiel verwende, die gegenteilige Sorge. Werkbank schreibt rund 40 Millionen Anwendungsereignisse pro Jahr: jedes geöffnete Angebot, jede verschickte Rechnung, jedes Verschieben im Terminkalender. Er hatte das Gefühl, auf einer Goldmine zu sitzen und nichts davon abzubauen. Er hat halb recht. In diesem Kapitel geht es darum, die beiden Situationen auseinanderzuhalten, darum, was sich wirklich ändert, wenn Daten gross werden, und darum, was sich überhaupt nicht ändert, und das ist das meiste. Wie überall in dieser Serie sind die Zahlen illustrativ.

Wo das in der Serie steht

Das ist Kapitel 21 von 21 und die zweite Hälfte von Teil fünf, Testen und Big Data. Das vorige Kapitel, Statistische Tests: Stichprobengrösse, Lift und vollfaktorielle Designs, handelte davon, aus einem bewusst kleinen Experiment so viel wie möglich zu lernen. Dieses handelt von der gegenteiligen Versuchung: zu glauben, dass genug Zeilen das Denken für dich übernehmen. Es stützt sich auf das allererste Kapitel, Statistik für Marketer: die Zahlen, die du nicht überspringen kannst, denn nichts daraus verliert seine Gültigkeit, wenn die Tabelle länger wird. Ein nächstes Kapitel gibt es nicht, nur eine Checkliste und eine Einladung.

Was Big Data ist und was nicht

Die Lehrbuchdefinition hat drei Vs, und sie beschreiben drei wirklich verschiedene Situationen. Volume: mehr Zeilen, als eine Maschine bequem verarbeitet, und das heisst 2026 Hunderte Millionen, nicht Hunderttausende. Variety: Daten, die nicht als saubere Spalten ankommen, etwa Freitextbewertungen, Supportchats, Produktfotos, Clickstreams und Serverlogs. Velocity: Daten, die laufend eintreffen und eine Antwort brauchen, bevor der nächste Batch kommt, etwa Betrugserkennung oder ein Hinweis in der App.

Was Big Data nicht ist: eine Strategie. Der Begriff beschreibt den Input und verspricht nichts über den Output. Eine schlechte Frage an 100 Zeilen bleibt eine schlechte Frage an 100 Millionen. "Welche Kunden sollen wir kontaktieren" ist eine schlechte Frage; "welche Kunden würden im Dezember einen zweiten Korb kaufen, wenn wir sie erinnern, und ohne Erinnerung nicht" ist eine gute, und sie braucht das inkrementelle Denken aus dem Testkapitel viel dringender als Zeilen.

An den drei Vs gemessen hat The Gift Bow keines. Werkbank hat ein bisschen von zweien. Die 40 Millionen Ereignisse sind für eine kleine Firma ein echtes Volumen, und eine Handvoll Entscheidungen braucht tatsächlich Velocity, etwa zu merken, dass ein Testkonto drei Tage nach Start noch kein einziges Angebot angelegt hat. Aber fast jede Frage, die sich zu stellen lohnt, verdichtet diese Ereignisse auf 1.400 Zeilen, eine pro zahlendem Konto, oder 9.000 Zeilen, eine pro Testphase. Die Analyseeinheit ist das Konto, und Konten gibt es nicht viele. Das sind kleine Daten in einem grossen Mantel.

Warum mehr Zeilen eine schlechte Frage selten reparieren

Ein grösserer Datensatz tut zwei Dinge für dich und verweigert ein drittes. Erstens verkleinert er den Zufallsfehler. Aus Kapitel 1:

SE(xˉ)=σnSE(\bar{x}) = \frac{\sigma}{\sqrt{n}}

SE(xˉ)SE(\bar{x}) ist der Standardfehler eines Mittelwerts, σ\sigma die Standardabweichung in der Grundgesamtheit und nn die Zahl der Beobachtungen. Geh von 1.000 auf 100.000 Zeilen und deine Schätzung wird zehnmal präziser. Das ist real. Es ist aber Präzision über das, was du zufällig gemessen hast, einschliesslich des Falschen.

Denn das Dritte, das er verweigert, ist die Beseitigung von Verzerrung. Wenn The Gift Bow die Wirkung der Weihnachtsmail misst, indem sie Wiederkäufe unter Empfängern mit Wiederkäufen unter Nichtempfängern vergleicht, dann besteht die zweite Gruppe aus Leuten, die sich abgemeldet haben, deren Adresse ungültig war oder die nie zugestimmt haben. Die waren schon vor jeder Mail weniger engagiert. Dieser Vergleich ist mit 20.000 Zeilen verzerrt und mit 20 Millionen genau gleich verzerrt. Mehr Daten machen die falsche Antwort nur selbstsicherer, und das ist schlimmer, weil jemand danach handelt.

Das Zweite, was ein grösserer Datensatz tut: Er lässt ein Modell mehr von dem Muster lernen, das tatsächlich in den Spalten steckt. Am besten denkt man das als Lernkurve:

E(n)=E∞+anbE(n) = E_{\infty} + \frac{a}{n^{b}}

E(n)E(n) ist der Vorhersagefehler eines Modells, das auf nn Zeilen trainiert wurde. E∞E_{\infty} ist der Boden: der Fehler, den du auch mit unendlich vielen Zeilen noch hättest, weil das, was den Ausgang entscheidet, gar nicht in deinen Spalten steht. aa skaliert die Kurve, und bb, typischerweise zwischen 0,3 und 1, sagt, wie schnell der Fehler fällt. Die Zeilenzahl bewegt dich entlang der Kurve. Die Spalten setzen den Boden. Ein Modell für Wiederkäufe von Geschenkkörben, das nicht weiss, ob der erste Kauf ein Geschenk oder ein Kauf für sich selbst war, wird früh abflachen, egal wie viele Kunden du hineinschüttest.

So sah das aus, als ich ein Wiederkaufmodell auf den Kunden von The Gift Bow mit wachsenden Trainingsstichproben schätzte, gemessen als AUC auf einem zurückgehaltenen Jahr (0,5 ist ein Münzwurf, 1,0 ist Hellsehen):

Abnehmender Grenznutzen: die letzten 80.000 Zeilen kaufen einen Punkt AUC. Die Balken 50k und 100k sind durch Resampling simuliert, so viele Kunden hat der Shop nicht.

Der interessante Vergleich steht nicht im Diagramm. Bei 5.000 Zeilen habe ich eine Spalte hinzugefügt, ein Kennzeichen, ob die Lieferadresse von der Rechnungsadresse abweicht, mein bester Näherungswert für einen Geschenkkauf. Die AUC ging von 0,72 auf 0,78. Eine Spalte bei 5.000 Zeilen schlug 95.000 zusätzliche Zeilen. Das ist das ganze Argument aus Zählen und Summieren schlägt maschinelles Lernen in einer einzigen Zahl, und deshalb frage ich nach den Spalten, bevor ich nach den Zeilen frage.

Was sich wirklich ändert

Manches ändert sich sehr wohl, wenn Daten gross werden, und das zu leugnen wäre so albern wie die Anbieterfolie.

Für die Analytik selbst drei Dinge. Streaming: Wenn die Entscheidung vor dem nächsten nächtlichen Batch fallen muss, bist du nicht mehr in einem Modellierungsproblem, sondern in einem Engineeringproblem. Werkbanks Hinweis "Testkonto hat nach drei Tagen kein Angebot angelegt" braucht einen Ereignisstrom, einen Schwellenwert und eine Warteschlange. Ein Modell braucht er gar nicht. Unstrukturierte Daten: Text, Bilder und Audio brauchten früher ein Spezialistenteam. 2026 verwandelt ein Sprachmodell 3.000 Supporttickets an einem Nachmittag in zwölf Beschwerdekategorien, und ab dann ist es wieder Zählen. Variety ist für kleine Firmen das nützlichste V geworden, gerade weil die Werkzeuge nachgezogen haben. Rechenleistung: Ein Gradient Boosting Modell auf einer Million Zeilen trainiert in Minuten auf einem Laptop. Die Hürde ist nicht mehr die Hardware. Es sind die Frage und die Leitungen.

Für die Strategie zwei Dinge. Lerngeschwindigkeit: Die Stichprobenmathematik aus dem vorigen Kapitel ändert sich nicht, der Kalender schon. Ein Shop, der früher einmal im Jahr zu Weihnachten gelernt hat, kann mit einer sauberen Ereignispipeline jede Woche etwas lernen. Personalisierung im grossen Massstab: Die Segmente aus der Mitte dieser Serie können im Prinzip zu Individuen werden. In der Praxis ist die Grenze nicht das Modell, sondern die Differenzierung, die du tatsächlich herstellen kannst. The Gift Bow hat 240 Produkte und eine Person, die Mails schreibt. Sie kann vielleicht sechs verschiedene Botschaften liefern. Ein Empfehlungssystem, das 20.000 verschiedene Rangfolgen erzeugt, ist beeindruckend und sinnlos, wenn die Vorlage einen Platz hat.

Die exotischen Algorithmen, in einfachen Worten

Jedes Big Data Gespräch landet irgendwann bei den Algorithmen, also hier sind sie ohne Mystik. Über den Unterschied zwischen KI und Machine Learning habe ich anderswo geschrieben; in dieser Tabelle geht es darum, wann jeder seinen Platz gegenüber der Regression verdient, die du schon kennst.

TechnikWas sie tut, in einfachen WortenSchlägt die Regression, wennBleib bei der Regression, wenn
Gradient Boosting (XGBoost, LightGBM)Hunderte kleine Entscheidungsbäume, jeder korrigiert die Fehler der vorigenViele Prädiktoren, starke Nichtlinearitäten und Interaktionen, ab 10.000 Zeilen, und Vorhersage ist das ZielDu musst einem Vorstand die Wirkung einer Variable erklären, du hast ein paar hundert Zeilen, oder die Frage ist kausal
Neuronale NetzeGestapelte Schichten gewichteter Summen mit StauchfunktionenBilder, Audio, Freitext, lange Sequenzen, Millionen BeispieleTabellarische Geschäftsdaten in jeder Grösse, die ein KMU hat
Clustering im grossen Massstab (k Means, Mini Batch Varianten, DBSCAN)Gruppiert ähnliche Zeilen ohne ZielvariableMillionen Zeilen, bei denen hierarchisches Clustering nicht mehr läuftDie Segmentierung hat noch keine Strategie dahinter; der Algorithmus liefert keine
Empfehlungssysteme (Collaborative Filtering, Matrixfaktorisierung)"Wer das gekauft hat, kaufte auch jenes", gelernt aus einer dünn besetzten Kunden mal Artikel MatrixTausende Artikel, ein Long Tail, viele Interaktionen pro KundeEin paar hundert Produkte, bei denen vier Regeln 90 Prozent des Werts abdecken
Regularisierte Regression (Lasso, Ridge)Regression mit einer Strafe, die schwache Koeffizienten schrumpft oder entferntViele Kandidatenvariablen und zu wenige Zeilen, um allen zu trauenDu hast bereits eine Handvoll theoriegeleiteter Variablen

Weil Gradient Boosting auf tabellarischen Daten dasjenige ist, das gewinnt, hier in einer Zeile:

Fm(x)=Fm−1(x)+η hm(x),hm(x)≈−∂L(y,F(x))∂F(x)∣F=Fm−1F_m(x) = F_{m-1}(x) + \eta \, h_m(x), \qquad h_m(x) \approx -\left.\frac{\partial L\big(y, F(x)\big)}{\partial F(x)}\right|_{F = F_{m-1}}

Fm(x)F_m(x) ist das Modell nach mm Runden und Fm−1(x)F_{m-1}(x) das, was du vor dieser Runde hattest. hm(x)h_m(x) ist ein kleiner Entscheidungsbaum, der nicht auf den Ausgang gefittet wird, sondern auf den negativen Gradienten der Verlustfunktion LL, was bei quadratischem Fehler einfach die Residuen sind: das, was das vorige Modell falsch hatte. η\eta ist die Lernrate, eine Zahl wie 0,05, die verhindert, dass einem einzelnen Baum zu viel getraut wird. Fitten, schauen, was du verfehlt hast, ein kleines Modell auf die Fehler fitten, einen Bruchteil davon addieren, dreihundertmal wiederholen. Es ist die sture Cousine der Regression, und auf unordentlichen tabellarischen Daten mit Interaktionen, an die du nicht gedacht hast, ist sie meist ein paar Punkte besser als eine handgebaute Regression. Ein paar Punkte, keine andere Welt.

Rechenbeispiel: der Korbshop und Werkbank, Frage für Frage

Hier die beiden Unternehmen nebeneinander, mit den Fragen, die ihre Inhaber tatsächlich gestellt haben, den Zeilen, die jede Frage berührt, und ob ein V beteiligt ist.

FrageWer fragtBerührte ZeilenBig Data?Was sie wirklich beantwortet
Wer ist eine Weihnachtserinnerung wertThe Gift Bow20.000 KundenNeinRecency, Frequency und Value plus eine logistische Regression
Was soll jede Mail empfehlenThe Gift Bow61.000 BestellzeilenKaumRegeln nach Käufertyp oder ein kleines Empfehlungssystem, gegeneinander getestet
Warum konvertieren Testphasen nichtWerkbank9.000 TestphasenNeinFunnelzählungen je Onboardingschritt, dann ein logistisches Modell auf den Schritten
Welches Testkonto braucht jetzt einen HinweisWerkbank40 Millionen EreignisseVelocity, jaEin Ereignisstrom und eine Schwellenregel, kein Modell
Worüber beschweren sich KundenBeide3.000 Tickets und 1.200 BewertungenVariety, jaEin Sprachmodell klassifiziert in zwölf Themen, dann Zählen pro Monat
Welche Konten kündigen nächstes QuartalWerkbank1.400 KontenNeinEin Survival Modell mit einer Handvoll Nutzungskovariaten

Sechs Fragen, zwei berühren ein V, und keine braucht ein exotisches Modell. Die Velocity Frage braucht eine Regel, die Variety Frage einen Klassifikator und ein Balkendiagramm. Alles andere sind kleine Daten, beantwortet mit den Methoden aus Teil zwei und drei dieser Serie.

Die zweite Zeile verdient einen richtigen Test, denn dort wohnte der Pitch des Anbieters. Im November habe ich eine Mail mit drei Armen an 18.000 Kunden von The Gift Bow geschickt, 6.000 pro Arm, gleiche Betreffzeile, gleiche Sendezeit. Arm A empfahl allen die drei Bestseller. Arm B nutzte eine logistische Regression mit zwei Variablen: Käufertyp (Geschenk oder Eigenkauf, aus dem Adresskennzeichen) und Preisband des letzten Korbs, vier Zellen und vier Regeln wie "Geschenkkäufer, Premiumband, zeige die zwei Premiumkörbe und die Firmenseite". Arm C nutzte einen Collaborative Filter nach dem Muster Item zu Item, trainiert auf der vollen Kaufmatrix von 20.000 mal 240, mit einer individuellen Rangfolge für jeden Kunden.

ArmMethodeBauaufwandBestellungen je 1.000 MailsUmsatz je MailLift gegen A
ADrei Bestseller für alleEine Stunde14,1£0,92Basis
BRegression mit zwei Variablen, vier RegelnZwei Tage19,6£1,31plus 42 Prozent
CEmpfehlungssystem Item zu Item, individuelle RangfolgeZwei Wochen plus Hosting20,4£1,38plus 50 Prozent

Zeile für Zeile gelesen: A ist die ehrliche Basis, und £0,92 pro Mail ist für einen Shop dieser Grösse nicht schlecht. B, zwei Tage Arbeit und vier Regeln, die ein Mensch vorlesen kann, hebt den Umsatz pro Mail um 42 Prozent: 118 Bestellungen gegen 85. Dieser Abstand liegt bei 6.000 pro Arm weit ausserhalb des Rauschens; rechne die Mathematik aus dem vorigen Kapitel durch und das Konfidenzintervall berührt die Null nie. C legt weitere 5 Bestellungen drauf, 122 gegen 118, bequem innerhalb des Rauschens. Ich kann dir nicht sagen, dass C B geschlagen hat. Ich kann dir sagen, dass C ungefähr zehnmal so viel Bauaufwand gekostet hat, einen Server und einen Retrainingjob braucht und Rangfolgen erzeugt, mit denen der Shop nichts anfangen kann, weil die Mailvorlage drei Plätze hat. Bei 5.000 Produkten und Millionen Warenkörben ist ein Empfehlungssystem die einzig sinnvolle Option; bei 240 Produkten und 20.000 Kunden gewinnt die Regression mit zwei Variablen, weil die Struktur des Geschäfts, Geschenk oder Eigenkauf plus Preisband, den grössten Teil des Signals trägt. Das zu wissen ist mehr wert als der Algorithmus.

Ein Datenstack, den ein KMU wirklich braucht

Der Stack, der jede Frage oben beantwortet, ist klein, und ich zeichne ihn hier, damit dir niemand einen grösseren verkaufen kann, ohne gegen ein Bild zu argumentieren.

Eine Datenbank, ein nächtlicher Job, ein Schema, ein Dashboardtool und ein Ort für Python. Nichts davon kostet pro Jahr mehr als ein Laptop der Mittelklasse.

Das Warehouse ist eine Postgres Instanz mit einem Schema pro Quelle und einem Schema bereinigter Tabellen, eine Zeile pro Kunde, eine pro Bestellung, eine pro Testphase. Der nächtliche Export ist ein geplantes Skript. Die SQL Modelle sind ein Ordner mit Views, deren Namen ein Marketer versteht. Das Dashboard ist Metabase oder etwas Ähnliches. In den Notebooks werden Modelle gebaut, und das Einzige, was sie verlässt, ist eine bewertete Liste, die ins CRM zurückgeschrieben wird. Der Consent Ledger sitzt am Eingang, nicht am Ausgang.

Was nicht im Bild ist: ein Data Lake, eine Streamingplattform, eine Customer Data Platform, ein Feature Store, eine Vektordatenbank. Jedes davon ist ein feines Werkzeug für eine Firma, deren nächtlicher Job länger dauert als eine Nacht. Bis dahin sind es Fixkosten ohne Frage dahinter. Werkbanks einziger Velocity Anwendungsfall, der Hinweis nach drei Tagen, ist ein kleiner Workerprozess, der die eigene Ereignistabelle der Anwendung liest, in der App, nicht im Stack.

Privacy by Design, oder das Appetitproblem

Big Data hat Appetit. Der Instinkt ist, alles zu behalten, weil man nie weiss, was sich als prädiktiv herausstellt. Die DSGVO sagt das Gegenteil: für einen Zweck erheben, das Minimum behalten, löschen, wenn es erledigt ist. Ich bin inzwischen der Meinung, dass das Gesetz auch ein guter analytischer Rat ist. Weniger, sauberere Spalten mit einem Zweck schlagen eine breite Tabelle voller Dinge, die du zufällig geloggt hast.

In der Praxis heisst das vier Gewohnheiten. Pseudonymisiere beim Export, damit das Warehouse einen Kundenschlüssel hält und keinen Namen oder keine E Mail Adresse. Lass den Consent Ledger entscheiden, was in ein Modell kommt: Ein Besucher, der Marketingcookies abgelehnt hat, darf in aggregierten Zählungen vorkommen, aber seine Ereignisse dürfen nie eine Retargeting Zielgruppe oder einen persönlichen Score speisen, und sie brauchen einen anderen Ereignisnamen, damit sie stromabwärts niemand aus Versehen hineinmischt. Setze die Aufbewahrung pro Tabelle und lass den nächtlichen Job sie durchsetzen. Und berichte in Aggregaten: Das Dashboard zeigt Segmente und Monate, nie eine Liste von Personen; der einzige Output auf Personenebene ist die bewertete Liste im CRM, das die Firma ohnehin kontrolliert. Nichts davon bremst die Analyse. Alles davon erspart eine ganze Kategorie von Gesprächen mit einem Anwalt.

Wo KI 2026 hineinpasst

Weil jetzt auf jedem Pitchdeck KI steht, lohnt es sich, genau zu sagen, was Sprachmodelle in diesem Stack gut können; ausführlicher habe ich das in meinem kompletten Leitfaden zu KI im Unternehmen aufgeschrieben. Sie sind hervorragend bei Variety: Freitext in Spalten verwandeln. Klassifiziere 1.200 Bewertungen in Themen, extrahiere das in einer Beschwerde genannte Produkt, markiere, ob ein Ticket die Lieferung oder das Produkt betrifft. Gib dem Modell eine feste Kategorienliste, etikettiere 200 Beispiele selbst von Hand und miss die Übereinstimmung, bevor du ihm traust. Gut sind sie auch darin, SQL gegen ein Schema zu entwerfen, das du ihnen zeigst, und eine Koeffiziententabelle einem Kollegen zu erklären.

Eine Vorhersagemaschine für Zahlen sind sie nicht. Ein Sprachmodell zu fragen, welche Kunden kündigen werden, heisst, es um eine flüssig formulierte Vermutung zu bitten. Kausale Inferenz können sie nicht, bei fehlenden Daten erfinden sie selbstsichere Zahlen, und ein Konfidenzintervall können sie dir für nichts nennen. In diesem Stack sitzt das Sprachmodell in der Box mit den Notebooks und Modellen, als ein Werkzeug neben der logistischen Regression, und die Statistik aus Kapitel 1 richtet über beide. Das ist meine Haltung, seit ich du brauchst noch keinen Data Scientist geschrieben habe, und 2026 hat sie wahrer gemacht, nicht weniger wahr: Die exotischen Werkzeuge wurden einfacher, also ist die knappe Fähigkeit, zu wissen, auf welche Frage man sie richtet.

So läuft es in der Praxis

Das ist die Reihenfolge, wenn mir jemand sagt, er habe Big Data.

Beginne bei der Entscheidung, nicht beim Datensatz. Schreib die drei Entscheidungen auf, die das Unternehmen anders treffen wird, wenn die Analyse funktioniert; kann niemand drei nennen, halt an und mach das zuerst. Dann finde für jede Entscheidung die Analyseeinheit, einen Kunden, ein Konto, eine Testphase, eine Woche, und verdichte die Rohereignisse auf eine Zeile pro Einheit. Dieser eine Schritt macht aus Werkbanks 40 Millionen Ereignissen 9.000 Zeilen:

-- Eine Zeile pro Testphase: was ist in den ersten drei Tagen passiert?
select t.account_id,
       t.started_at::date                                   as trial_day,
       min(e.created_at) filter (where e.name = 'quote_created')   as first_quote_at,
       count(*)          filter (where e.name = 'calendar_drag')   as drags_3d,
       max(case when e.name = 'invoice_sent' then 1 else 0 end)    as sent_invoice_3d,
       t.converted
from trials t
left join events e
       on e.account_id = t.account_id
      and e.created_at <  t.started_at + interval '3 days'
group by t.account_id, t.started_at, t.converted;

Ziehe intelligente Stichproben. Zum Erkunden sagt dir eine geschichtete Stichprobe von 50.000 Zeilen alles, was hundert Millionen sagen würden, und sie passt überall in den Speicher. Dann zeichne die Lernkurve, bevor du über Datenmenge streitest, denn die Kurve entscheidet den Streit:

from sklearn.model_selection import learning_curve
from sklearn.ensemble import HistGradientBoostingClassifier

sizes, train_auc, test_auc = learning_curve(
    HistGradientBoostingClassifier(max_iter=300, learning_rate=0.05),
    X, y, train_sizes=[500, 1000, 2000, 5000, 10000, 20000],
    cv=5, scoring="roc_auc", shuffle=True, random_state=7)

for n, auc in zip(sizes, test_auc.mean(axis=1)):
    print(f"{n:>6} Zeilen   Holdout AUC {auc:.3f}")

Steigt die Kurve bei deiner vollen Stichprobe noch steil, helfen mehr Zeilen. Ist sie flach geworden, geh eine Spalte suchen. Dann die Prüfungen, bevor du irgendetwas glaubst: Halte nach Zeit zurück, nicht zufällig, denn ein Modell, das den Dezember gesehen hat, kann nicht am Dezember beurteilt werden. Vergleiche jedes exotische Modell mit einer Regression auf denselben Variablen und berichte den Abstand ehrlich. Prüfe die Kalibrierung, also dass Kunden mit einem Score von 20 Prozent auch in etwa 20 Prozent der Fälle kaufen. Lies die zwanzig wichtigsten Variablen auf alles durch, was erst nach dem Ausgang bekannt sein kann. Für eine Firma wie diese beiden dauert der Zyklus vom ersten Export bis zur bewerteten Liste und zum Entscheidungsmemo zwei bis vier Wochen. Steht in einem Angebot sechs Monate, dann sind die Monate für den Stack, nicht für die Antwort.

Fallstricke

Leckage wächst mit der Breite. Je mehr Spalten du hast, desto wahrscheinlicher kennt eine davon still die Zukunft. Ein Kündigungsmodell, das ich geprüft habe, hatte "Kündigungsgrund" unter seinen Prädiktoren und eine AUC von 0,99. Big Data macht das wahrscheinlicher, nicht seltener, weil niemand alle Spalten gelesen hat.

Präzision, die für Wahrheit gehalten wird. Auf zwei Millionen Zeilen ist jeder Koeffizient signifikant und jeder p Wert eine Reihe von Nullen. Das sagt dir, dass die Effekte nicht exakt null sind, was du wusstest. Berichte Effektgrössen mit Intervallen und frag, ob der Effekt gross genug ist, eine Entscheidung zu ändern, genau wie in Kapitel 1.

Vorhersagen, mit denen niemand handeln kann. Zwanzigtausend Rangfolgen und eine Mailvorlage. Ein stündlich aktualisierter Kündigungsscore und ein Kundenbetreuer, der donnerstags anruft. Bring die Körnigkeit des Modells mit der Körnigkeit der Handlung zusammen, sonst ist das Modell Dekoration.

Training auf der falschen Saison. Ein Modell, das auf Jänner bis Oktober trainiert und im Dezember eingesetzt wird, hat nie eine Firmenbestellung gesehen. Velocity macht das schlimmer, weil das Modell automatisch nachtrainiert und selbstsicher abdriftet. Halte nach Zeit zurück und schau auf den Kalender.

Die Einwilligungsgrenze vergessen. Technisch ist es trivial, die Ereignisse jedes Besuchers in jede Zielgruppe zu speisen. Für die, die Nein gesagt haben, ist es auch illegal, und der Reputationsschaden landet beim Kunden, nicht beim Anbieter. Bau die Grenze in den Export ein, wo sie niemand vergessen kann.

So mache ich das für Kunden

Wenn eine Firma mit einer Big Data Frage zu mir kommt, ist das erste Ergebnis meist kleiner als erwartet, und besser. Es beginnt mit dem kostenlosen Workshop: ein halber Tag, in dem wir die Entscheidungen aufschreiben, für jede die Analyseeinheit benennen und uns die tatsächlichen Tabellen ansehen. Oft stellen wir schon in diesem Raum fest, dass die Daten klein sind und die Frage gut, und das ist das bestmögliche Ergebnis. Dann zwei Wochen echte Arbeit auf meine Rechnung, bevor sich irgendjemand zu etwas verpflichtet.

Die Daten, die ich brauche, sind ein Export aus der Shop oder Anwendungsdatenbank, die Ereignistabelle, falls es eine gibt, das CRM und das Mailtool sowie die Einwilligungsaufzeichnungen. Am Ende der zwei Wochen bekommt der Kunde ein zweiseitiges Entscheidungsmemo: für jede Frage die Methode, die Zahl, die Fehlermarge und das Risiko, und ein ehrliches Urteil, ob mehr Daten daran etwas ändern würden. Wo ein Modell gerechtfertigt ist, bekommt er das Modell selbst, versioniert im eigenen Repository, eine bewertete Liste im CRM und ein Dashboard, das pro Bildschirm eine Frage beantwortet. Wo ein Stack nötig ist, baue ich den kleinen aus dem Diagramm oben und übergebe die Schlüssel; er gehört dir, wie alles, was ich baue. Meine Data Science Arbeit deckt die Modellierung ab; wo Personalisierung auf die Website selbst gehört statt in eine Mail, übernimmt die Smart Websites Praxis. Was es kostet, steht klar auf der Preisseite: eine fixe monatliche Kapazität von einer verantwortlichen Person oder, für Wachstumsarbeit, eine Provision auf Ergebnisse. Niemand zahlt für einen Data Lake, den er nie füllen wird.

Fragen, bevor jemand wieder Big Data sagt

  • Welche drei Entscheidungen treffen wir anders, wenn diese Analyse funktioniert, und wer trifft sie?
  • Was ist die Analyseeinheit, und wie viele Zeilen hat die Frage wirklich, wenn wir darauf verdichten?
  • Haben wir die Lernkurve gezeichnet, und steigt sie bei den Daten, die wir schon besitzen, noch?
  • Welche Spalte, nicht welche zusätzlichen Zeilen, würde den Fehlerboden am stärksten senken?
  • Kann das Marketingteam mit der Körnigkeit des Modells handeln, mit den Vorlagen und Leuten, die es tatsächlich hat?
  • Wo sitzt der Consent Ledger in der Pipeline, und was passiert mit einem Besucher, der Nein gesagt hat?

Diese Serie ist inspiriert von Mike Grigsbys Marketing Analytics (Kogan Page). Erklärungen, Beispiele und Zahlen hier sind meine eigenen.

Wenn dir jemand gesagt hat, du hättest Big Data, oder du den Verdacht hast, auf einem Haufen Ereignisse zu sitzen, die niemand nutzt, schick mir die Form davon: wie viele Kunden oder Konten, wie viele Zeilen wovon, und die drei Entscheidungen, die du besser treffen willst. Ich sage dir ehrlich, ob es eine Frage für kleine Daten mit einer guten Antwort ist oder ein echtes Volume, Variety oder Velocity Problem, und wie die ersten zwei Wochen aussehen würden. Im kostenlosen Workshop schreiben wir die Entscheidungen auf und schauen uns gemeinsam deine tatsächlichen Tabellen an, bevor sich einer von uns zu irgendetwas verpflichtet.

1%jeder Rechnung geht an eine Charity, die du wählst.

Eine Spende, nie Sponsoring. Du wählst das Anliegen beim Onboarding.

Die Geschichte hinter dem Versprechen →

Bleib deiner Konkurrenz voraus.

Die neuesten innovativen Produkte und Services, direkt in dein Postfach, bevor deine Mitbewerber davon hören.

Sichere dir bis zu 5% auf deine ersten sechs Monate: 1% pro gewähltem Thema, die vollen 5% wenn du alles nimmst. Limitiertes Angebot · endet am 31. Dezember 2026.

Nur für Neukunden. Es gelten die AGB.

* Bis zu 5% auf deine ersten sechs Monatsrechnungen, nur für Neukunden. Alle Bedingungen.

Fragen zu Preisen, Verträgen oder zur Zusammenarbeit?

Zu den FAQ