Der erste Data Science Monat: Was wirklich passiert bevor es ein Modell gibt

Jemand hat dir Data Science verkauft und du hast ein Dashboard bekommen. Ich höre eine Version dieser Geschichte fast jeden Monat. Ein Unternehmer hat Analytics gebucht, oder KI, oder Growth Intelligence, oder wie auch immer die Agentur es in dem Quartal genannt hat, und sechs Monate später hat er einen Bildschirm voller Charts, eine monatliche Rechnung, und keine einzige Entscheidung die er deswegen anders trifft. Das Dashboard aktualisiert sich. Niemand schaut drauf. Die Person die es gebaut hat ist beim nächsten Kunden. Wenn ich also sage dass der erste Monat der Zusammenarbeit mit mir bei Daten kein Modell, kein Dashboard und keine KI produziert, ist das keine Warnung, sondern der Sinn der Sache. Der erste Monat ist der in dem die Fragen gestellt werden, die Leitungen geprüft werden, und die Zahlen die still und leise falsch sind gefunden werden, bevor irgendetwas darauf gebaut wird. Das hier ist was diese vier Wochen tatsächlich enthalten, in der Reihenfolge in der es passiert.

Jemand hat dir Data Science verkauft und du hast ein Dashboard bekommen

Ich höre eine Version dieser Geschichte fast jeden Monat. Ein Unternehmer hat Analytics gebucht, oder KI, oder Growth Intelligence, oder wie auch immer die Agentur es in dem Quartal genannt hat, und sechs Monate später hat er einen Bildschirm voller Charts, eine monatliche Rechnung, und keine einzige Entscheidung die er deswegen anders trifft. Das Dashboard aktualisiert sich. Niemand schaut drauf. Die Person die es gebaut hat ist beim nächsten Kunden.

Wenn ich also sage dass der erste Monat der Zusammenarbeit mit mir bei Daten kein Modell, kein Dashboard und keine KI produziert, ist das keine Warnung. Es ist der Sinn der Sache. Der erste Monat ist der in dem die Fragen gestellt werden, die Leitungen geprüft werden, und die Zahlen die still und leise falsch sind gefunden werden, bevor irgendetwas darauf gebaut wird. Lass ihn weg und alles was du danach baust erbt die Fehler. Ich habe genug Forecasting Modelle auf kaputten Bestelldaten neu gebaut um zu wissen dass die teuren Fehler alle in den ersten zwei Wochen passieren, meistens dadurch dass es keine ersten zwei Wochen gab.

Das hier ist was diese vier Wochen tatsächlich enthalten, in der Reihenfolge in der es passiert. Ich fahre dasselbe Schema für einen Shop mit achthunderttausend Umsatz im Jahr und für ein SaaS mit zweitausend Accounts, weil es beim Schema um Entscheidungen geht, nicht um Datenmengen. Die Data Science Seite sagt dir was du am Ende bekommst. Das hier ist der Teil davor.

Woche eins beginnt mit deinem Kalender, nicht mit deiner Datenbank

Im ersten Meeting ist kein Laptop offen. Ich stelle dem Inhaber, und wem auch immer sonst tatsächlich Dinge entscheidet, eine Frage in mehreren Formen: was entscheidest du, und wie oft?

Wöchentliche Entscheidungen in einem typischen Shop: wie viel morgen für Anzeigen ausgeben und wo, welche Produkte im Newsletter pushen, ob Ware nachbestellt wird, ob rabattiert wird was sich nicht bewegt. Monatlich: welche Kanäle bleiben, welche Produkte fliegen raus, ob eingestellt wird, ob ein neuer Markt aufgemacht wird. Quartalsweise: Budgets, Preise, die großen Wetten. Bei einem SaaS ist die Liste anders, aber die Struktur ist dieselbe. Welche Features bauen, welchen Plan pushen, wen anrufen bevor er kündigt.

Dann die Nachfrage, und da beginnt die eigentliche Arbeit: was würdest du anders machen wenn du X wüsstest? Eine Inhaberin sagt mir sie würde das Meta Budget verdoppeln wenn sie wüsste dass es profitabel ist. Gut. Was heißt profitabel, Deckungsbeitrag nach Retouren und nach Werbekosten, oder Umsatz? Über welches Fenster, die erste Bestellung oder das erste Jahr? Wie zugeordnet? Sie ist das noch nie gefragt worden. Niemand ist das, weil die Agentur die das Dashboard gebaut hat eine Kennzahl brauchte die nach oben zeigt und ROAS genommen hat, und ROAS beantwortet keine dieser Fragen.

Am Ende dieses Meetings haben wir eine Liste. Sie ist nie länger als zehn Punkte und ich lasse den Inhaber sie ordnen. Die obersten drei werden der gesamte erste Monat. Alles andere wartet, so interessant es auch ist, weil die obersten drei die sind die Geld bewegen.

Der Vollständigkeit halber: über ein paar Dutzend dieser Gespräche hinweg sind die obersten drei fast immer eine Version derselben Fragen. Welche Kunden kommen wieder und was hat es gekostet sie zu gewinnen. Welcher Kanal ist nach Retouren und nach Marge tatsächlich profitabel, nicht davor. Und was geht mir aus, an Ware oder an Geld oder an Kunden, bevor ich es merke. Deine können abweichen. Meiner Erfahrung nach weichen sie nicht sehr ab.

Das Tracking Audit, oder warum deine Zahlen einander widersprechen

Woche eins, zweite Hälfte, ich mache den Laptop auf. Die erste Aufgabe ist ein Audit von allem was behauptet etwas zu messen. GA4, die Werbeplattformen, die Berichte des Shops selbst, das Mail Tool, und alle Dashboards die jemand vor mir gebaut hat.

Ich mache das durch Abgleichen. Nimm eine Woche. Zähl die Bestellungen in der Shop Datenbank. Zähl sie in GA4. Zähl sie im Meta Werbeanzeigenmanager, in Google Ads, in Klaviyo oder was auch immer den Newsletter verschickt. Addiere die Zahlen die die Plattformen für sich beanspruchen. In jedem Audit das ich je gemacht habe beanspruchen die Plattformen zusammen mehr Bestellungen als der Shop tatsächlich hatte. Manchmal anderthalb mal so viele. Jede Plattform berichtet ehrlich was ihr eigener Pixel gesehen hat, und ihr Pixel hat eine Person gesehen die am Montag auf eine Google Anzeige geklickt, am Mittwoch einen Newsletter geöffnet und am Freitag über eine Meta Retargeting Anzeige gekommen ist, und alle drei schreiben sich das gut.

Das ist die Doppelzählung. Die fehlende Zählung ist schlimmer. Seit Consent Banner in der DACH Region ernst gemeint sind, lehnen irgendwo zwischen einem Drittel und der Hälfte der Besucher Tracking ab, und Googles Consent Mode füllt die Lücke mit modellierten Conversions die, freundlich gesagt, geraten sind. Bei einem Kunden sagte GA4 dass die Conversion Rate über achtzehn Monate um ein Drittel gefallen sei. War sie nicht. Seine Consent Rate war gefallen. Die Shop Datenbank, die keine Einwilligung braucht um eine Bestellung zu zählen, zeigte Conversions konstant. Sie hatten ihr Werbebudget auf Basis eines Charts gekürzt das Cookie Akzeptanz gemessen hat.

An diesem Punkt erkläre ich den Unterschied zwischen Client Side und Server Side Tracking, und ich halte es kurz, weil ich dazu einen ganzen Leitfaden geschrieben habe. Die Kurzfassung: der Browser ist eine feindliche Umgebung für Messung, und die einzigen Zahlen denen du voll vertrauen kannst sind die die dein eigener Server aufgezeichnet hat. Alles andere ist eine Stichprobe. Nützlich, aber eine Stichprobe, und im ersten Monat schreiben wir genau auf wie groß die Stichprobe ist, damit sie niemand mehr für die Gesamtheit hält.

Dann die Event Taxonomie. Ich liste jedes Event auf das die Seite auslöst und wie es heißt. Auf einer Seite mit ein bisschen Alter ist diese Liste archäologisch. Es gibt ein purchase Event, ein Purchase Event, ein transaction_complete Event von einem Plugin das 2023 entfernt wurde, dessen Tag aber noch im Container sitzt, und ein add_to_cart das auf der Produktseite zweimal feuert, weil zwei Leute es in verschiedenen Jahren eingebaut haben. Ich repariere davon in Woche eins nichts. Ich dokumentiere es, weil die Reparatur warten muss bis wir wissen welche Events die obersten drei Fragen tatsächlich brauchen. Oft sind das vier Events, und die anderen dreißig können weg.

Und die UTMs. Irgendjemand in jedem Unternehmen hat irgendwann eine Kampagne als "Newsletter" getaggt, jemand anderes als "newsletter", ein Dritter als "email" und ein Vierter gar nicht. Google Ads Auto Tagging überschreibt die manuellen in manchen Berichten und in anderen nicht. Ich habe einen eigenen Artikel dazu wie man UTMs richtig macht, und im ersten Monat mache ich das Unglamouröse: jeden Kampagnennamen des letzten Jahres exportieren, die Varianten gruppieren, eine Zuordnungstabelle bauen. Es ist eine Tabelle. Es ist für eine Weile die wertvollste Tabelle die das Unternehmen besitzt.

Die Dateninventur, inklusive der Tabellen die niemand zugibt

Parallel zum Audit baue ich eine Inventur jedes Ortes an dem Daten liegen. Die Liste ist immer länger als der Inhaber erwartet.

Die Shop Datenbank ist die offensichtliche, und die der ich am meisten vertraue, weil sie jede Bestellung aufgezeichnet hat, egal ob jemand irgendwas zugestimmt hat. Der Zahlungsanbieter hat die Wahrheit darüber welches Geld tatsächlich angekommen ist, Rückerstattungen inklusive, was die Shop Datenbank manchmal nicht hat. Die Werbeplattformen haben Ausgaben pro Tag und Kampagne, was sonst nichts hat. Das Mail Tool weiß wer was geöffnet hat. Das ERP, wenn es eines gibt, hat Einkaufspreise und Bestände, was der Unterschied zwischen Umsatz kennen und Marge kennen ist. Die Buchhaltung hat die Retouren die durch die Tür statt durch den Shop zurückgekommen sind.

Und dann, um Tag vier herum, erwähnt jemand die Tabelle. Es gibt immer eine Tabelle. Der Einkauf führt eine mit Lieferzeiten der Lieferanten. Der Gründer führt eine mit den echten Werbebudgets, weil die Plattformzahlen ein Testkonto enthalten. Der Kundenservice führt eine mit Beschwerden pro Produkt. Keine davon ist in irgendeinem System, alle sind die Antwort auf eine der obersten drei Fragen, und keine wurde im ersten Meeting erwähnt, weil niemand eine Tabelle als Daten betrachtet. Es sind Daten. Meistens die besten im Haus.

Ich schreibe für jede Quelle auf was sie enthält, wem sie gehört, wie ich Zugang bekomme, wie oft sie sich aktualisiert, und was ihre Einheit ist. Das Letzte ist wichtiger als es klingt. Der Shop zählt Bestellungen. Der Zahlungsanbieter zählt Transaktionen, und eine Bestellung kann drei Transaktionen sein wenn sie zweimal teilweise erstattet wurde. Die Werbeplattform zählt Conversions, die weder das eine noch das andere sind. Wenn das niemand aufschreibt, addiert das erste Dashboard Bestellungen zu Transaktionen und nennt es Umsatz.

Was ich in Woche eins von dir brauche

Die Zeit des Inhabers in Woche eins sind etwa sechs Stunden. Zwei für das Gespräch über Entscheidungen, eine für die Rückfragen wenn ich Dinge finde, und der Rest verteilt auf Vorstellungen bei denen die die einzelnen Systeme verantworten. Danach sinkt es auf etwa eine Stunde pro Woche bis zum Monatsende, wo es für die Auswertung wieder hochgeht.

Zugang ist überall nur lesend. Eine Read Replica oder ein reiner Lesebenutzer für den Shop. Lesezugriff auf die Werbekonten, kein Admin. Ein Export aus der Buchhaltung statt eines Logins dort. Ich brauche im ersten Monat nirgends Schreibrechte, und wenn mir jemand welche anbietet sage ich nein, weil der schnellste Weg das Vertrauen der IT eines Kunden zu verlieren der ist, der externe Dienstleister zu sein der etwas hätte ändern können.

Zwei Dinge lehne ich ab, und ich sage das im ersten Meeting damit es später nicht peinlich wird. Ich kaufe keine Daten Dritter um deine Kundendatensätze anzureichern. Das ist unter der DSGVO rechtlich wackelig, es ist meistens falsch, und die Verbesserung die es bringt ist kleiner als die vom Reparieren deiner eigenen First Party Daten, wo der erste Monat ohnehin hingeht. Und ich fingerprinte keine Besucher um die zurückzuholen die abgelehnt haben. Nicht weil es nicht funktioniert, das tut es, sondern weil es genau das ist was dein Consent Banner versprochen hat nicht zu tun, und die Datenschutzbehörden haben angefangen dem zuzustimmen.

Woche zwei: das Warehouse Gespräch, und die ehrliche Alternative

Um Tag acht herum fragt der Inhaber ob er ein Data Warehouse braucht, weil ihm jemand gesagt hat dass er eines braucht. Die Antwort für die meisten Unternehmen unter etwa zehn Millionen Umsatz ist: du brauchst ein Warehouse in dem Sinn dass es einen Ort gibt an dem die Quellen zusammenkommen, und du brauchst kein Warehouse in dem Sinn eines Produkts mit einem Vertriebsteam.

Was die meisten KMU tatsächlich brauchen ist eine Postgres Datenbank, getrennt vom Shop, mit einer Handvoll Tabellen: Bestellungen, Bestellpositionen, Kunden, Erstattungen, Werbeausgaben pro Tag und Kampagne, Mail Versendungen, und Einkaufspreise. Plus ein paar geplante Jobs die jede Nacht Daten aus jeder Quelle hineinkopieren. Das ist alles. Es läuft auf einem Server der weniger kostet als ein Geschäftsessen im Monat. Es hält Jahre an Daten ohne es zu merken. Und eine Rails Anwendung oder ein simpler SQL Client kann es direkt lesen, was bedeutet dass die Antworten auf die obersten drei Fragen eine Abfrage entfernt sind statt einen Anbieter. Ich habe über die Überlegung hinter diesem Setup schon einmal geschrieben und meine Meinung nicht geändert.

BigQuery verdient seinen Platz an einem bestimmten Punkt, nämlich wenn du rohe GA4 Event Exporte hast die du mit Bestellungen verbinden willst, oder dein tägliches Event Volumen in die Millionen geht, oder mehrere Leute gleichzeitig Analysen schreiben und Postgres es zu spüren beginnt. Wenn du auf Solidus bist ist diese Verbindung ein bekannter Weg und ich habe ihn im Artikel zu BigQuery und Solidus dokumentiert. Die meisten Kunden erreichen diesen Punkt im ersten Jahr nicht. Manche nie. Auf BigQuery zu starten weil du es später vielleicht brauchst ist der Weg zu einer monatlichen Google Cloud Rechnung die niemand erklären kann.

Woche zwei ist die in der die nächtlichen Jobs geschrieben werden und die ersten Kopien landen. Es ist langweilig und ich mag es, weil es am Ende zum ersten Mal einen einzigen Ort gibt an dem eine Bestellung, ihr Anzeigenklick, ihre Mail und ihre Erstattung in benachbarten Tabellen sitzen.

Identitäten zusammenführen, und wo das aufhört

Die Frage unter den meisten der obersten drei ist: ist das dieselbe Person? Dieselbe Person die im März auf die Anzeige geklickt und im Mai gekauft hat. Dieselbe Person die ein Kundenkonto hat und einen Gastkauf mit einer anderen Mailadresse. Dieselbe Person am Handy und am Laptop.

Manches davon ist lösbar. Mailadressen lassen sich normalisieren. Ein Kundenkonto mit derselben Adresse wie eine Gastbestellung ist wahrscheinlich derselbe Haushalt. Ein Token des Zahlungsanbieters kann zwei Bestellungen mit derselben Karte verbinden. Das ordentlich zu machen holt erstaunlich viel Wiederkaufverhalten zurück das die Berichte des Shops übersehen, weil der Shop jeden Gastkauf für einen neuen Kunden hält, und die tatsächliche Wiederkaufrate ist höher als irgendjemand geglaubt hat.

Manches davon ist nicht lösbar und sollte nicht versucht werden. Einen Nutzer mit Einwilligung mit einer Sitzung ohne Einwilligung zu verbinden ist genau das was die Ablehnung abgelehnt hat. Geräteübergreifendes Matching ohne Login ist Fingerprinting unter anderem Namen. Ich ziehe die Linie in Woche zwei schriftlich: das hier verbinden wir, das ist die Regel für jede Verbindung, und das hier lassen wir bewusst unverbunden. Das Dokument ist kurz. Es ist auch das was ich einem Datenschutzbeauftragten geben würde wenn je einer fragt, und es schon geschrieben zu haben ist mehr wert als die Analyse die es schützt.

Definitionen, oder warum sich jedes Unternehmen selbst widerspricht

Das nützlichste einzelne Ergebnis des ersten Monats ist eine Seite mit Definitionen. Klingt trivial. War noch kein einziges Mal trivial.

Was ist ein Kunde? Jemand der bestellt hat, oder jemand mit einem Konto? Zählt eine vollständig erstattete Bestellung? Zählt ein B2B Konto mit zwölf Nutzern als einer oder als zwölf? Was ist eine Bestellung? Zählt eine Abo Verlängerung als Bestellung, und wenn ja, wird die Wiederkaufrate dann bedeutungslos? Was ist eine Retoure? Der Artikel der zurückkam, die Erstattung die rausging, oder der Umtausch der keins von beidem war? Was ist Umsatz? Mit Umsatzsteuer oder ohne, vor Rabatten oder danach, vor Retouren oder danach, zum Bestelldatum oder Versanddatum oder Zahlungsdatum?

Ich stelle diese Fragen dem Inhaber, der Finanzperson und der Marketingperson getrennt, und ich hatte noch nie drei übereinstimmende Antworten. Finanzen zählt Umsatz netto zum Rechnungsdatum. Marketing zählt ihn brutto zum Bestelldatum, weil die Werbeplattform das so zeigt. Der Inhaber hat eine Zahl im Kopf die irgendwo dazwischen liegt und die ist die mit der er Entscheidungen trifft. Wenn alle im selben Meeting sitzen und denselben Monat anschauen, schauen sie auf drei verschiedene Zahlen und jeder hält die anderen zwei für falsch.

Der erste Monat beendet das. Nicht indem die richtige Definition gewählt wird, es gibt keine richtige, sondern indem pro Begriff eine gewählt und aufgeschrieben wird, mit Begründung. Von da an bedeutet das Wort Umsatz in diesem Unternehmen eine Sache. Die Streitereien darüber ob der letzte Monat gut oder schlecht war hören einfach auf, weil es keine Möglichkeit mehr gibt sie zu führen.

Ein zusammengesetztes Beispiel, aber eines das ich in mehreren Formen gesehen habe: ein Kunde glaubte seine Retourenquote liege bei rund neun Prozent, denn das berichtete der Shop. Der Shop zählte Retouren die über sein Portal angestoßen wurden. Retouren die über den Kundenservice zurückkamen, und Umtausche, und Artikel die der Zahlungsanbieter nach einem Streitfall erstattet hatte, lagen in drei anderen Systemen. Die echte Quote lag näher an neunzehn. Das gesamte Werbebudget war auf Margen gesetzt die von neun ausgingen. An dem Modell das ihnen im Jahr davor verkauft worden war war nichts falsch, außer seinen Eingaben, und die waren um den Faktor zwei falsch.

Woche drei: die ersten Antworten, und die die alle überraschen

In Woche drei sind die nächtlichen Jobs oft genug gelaufen um ihnen zu trauen, die Definitionen existieren, und ich kann anfangen die obersten drei zu beantworten. Das ist der erste Punkt an dem der Inhaber überhaupt etwas sieht, und ich versuche sicherzustellen dass das Erste was er sieht eine Zahl ist die er nicht erwartet hat.

Kohorten. Nimm jeden Kunden dessen erste Bestellung in einem bestimmten Monat war und folge ihm. Welcher Anteil hat innerhalb von neunzig Tagen wieder bestellt, innerhalb eines Jahres? Was hat die Gruppe insgesamt ausgegeben gegenüber dem was sie in der Gewinnung gekostet hat? Monat für Monat aufgereiht ist das der eine Chart der verändert wie Inhaber denken, weil er aus "wir haben letztes Jahr zwei Millionen gemacht" ein "die Kunden die wir im März gewonnen haben sind so viel wert und die vom November so viel, und hier ist warum" macht. Die März Kohorte kam über Suche und Nachbestellungen. Die November Kohorte kam über eine Rabattaktion und kam nie wieder. Beide sahen im monatlichen Umsatzchart identisch aus.

Wiederkaufrate, sauber definiert. Nach der Identitätsarbeit in Woche zwei geht die Wiederkaufrate meistens nach oben, manchmal deutlich, weil Gastkäufe aufhören wie Fremde auszusehen. Ein Kunde der dachte vierzehn Prozent seiner Kunden kämen wieder, stellte fest dass es sechsundzwanzig waren. Das änderte was ein Neukunde wert war, was änderte was er für einen zahlen konnte, was das Werbebudget änderte. Dieselben Daten, dasselbe Unternehmen, eine Verknüpfung.

Marge nach Kanal. Das ist die die weh tut. Nimm jeden Akquisekanal, nimm die Bestellungen die er gebracht hat, zieh die Wareneinsatzkosten aus dem ERP ab, zieh Retouren mit der ehrlichen Retourenquote ab, zieh die Werbeausgaben ab, und schau was übrig bleibt. Der Kanal mit dem besten ROAS ist sehr oft nicht der Kanal mit dem besten Deckungsbeitrag, weil die Rabattcodes die einen Kanal in der Plattform gut aussehen lassen für das Reporting der Plattform unsichtbar sind. Ich habe einen Marktplatzkanal gesehen der nach Umsatz der größte und nach Marge negativ war. Niemand hatte je die Gebühren abgezogen.

Das sind keine ausgefeilten Analysen. Es ist Arithmetik auf sauberen, definierten, verknüpften Daten. Genau deshalb wurden sie vorher nie gemacht. Die ganze Raffinesse ging in das Modell, und das Modell hatte keine sauberen, definierten, verknüpften Daten auf denen es laufen konnte.

Der Moment in dem die Durchschnitte aufhören zu lügen

Irgendwann in Woche drei fragt der Inhaber warum sein durchschnittlicher Bestellwert seit zwei Jahren flach ist während sich alles andere verändert hat. Die Antwort ist fast immer dass der Durchschnitt aus zwei Gruppen besteht die sich in entgegengesetzte Richtungen bewegen, und ich hole meistens den Artikel den ich genau dazu geschrieben habe heraus statt ihn zu wiederholen.

Die praktische Version ist aber die: sobald die Daten an einem Ort sind, kommt jede Zahl mit einer Verteilung statt eines Durchschnitts. Der durchschnittliche Bestellwert wird zu einem Histogramm mit zwei Buckeln, die Geschenkkäufer und die Vorratskäufer, und die zwei Buckel reagieren auf völlig unterschiedliches Marketing. Die durchschnittliche Lieferzeit wird zu einem langen Schwanz in dem acht Prozent der Bestellungen länger als eine Woche brauchen, und diese acht Prozent sind die die Bewertungen schreiben. Der durchschnittliche Kundenwert wird zu einer Kurve in der das oberste Zehntel der Kunden vierzig Prozent der Marge ausmacht, und jetzt hat die Frage wem man das Treueangebot schickt eine Antwort.

Nichts davon braucht ein Modell. Es braucht die Daten in einer Form in der du nach einer Verteilung statt einem Mittelwert fragen kannst, und der erste Monat ist der in dem sie in diese Form kommen.

Das erste Dashboard sind drei Zahlen

Am Ende von Woche drei baue ich ein Dashboard, und es hat drei Zahlen. Nicht dreißig. Drei.

Welche drei hängt von den obersten drei Fragen ab, aber in einem Shop sind es meistens: Wiederkaufrate nach Kohorte, Deckungsbeitrag nach Kanal in diesem Monat, und Tage an Bestand oder Geld bei aktuellem Tempo. In einem SaaS: Net Revenue Retention, Accounts die diese Woche das Muster vor der Kündigung zeigen, und Payback Zeitraum der Akquisen des letzten Quartals. Jede Zahl hat einen Bereich, weil ich mich weigere eine Punktschätzung für etwas zu zeigen das eine Stichprobe ist, und der Bereich ist die ehrliche Antwort auf "wie sicher sind wir".

Der Grund warum es drei sind ist dass drei Zahlen angeschaut werden. Ich habe in jedem Unternehmen das eines hatte zugesehen wie Dashboards mit dreißig Zahlen ignoriert wurden, auch solche die ich früh in meiner Laufbahn selbst gebaut habe, bevor ich es besser wusste. Ein Inhaber schaut sich jahrelang jeden Montagmorgen drei Zahlen an. Die Version mit dreißig wird in der ersten Woche geöffnet und wird dann zu einem Tab der nie geschlossen und nie gelesen wird.

Alles andere was die Daten beantworten können ist als Frage verfügbar die ich ausführen kann, und im zweiten Monat entscheiden wir welche dieser Fragen es verdient die vierte Zahl zu werden. Meistens keine.

Woche vier: entscheiden was gebaut wird, und warum Forecasting zuletzt kommt

Die letzte Woche ist ein Entscheidungsmeeting, und es ist das erste Mal im Monat dass jemand darüber redet etwas zu bauen.

Inzwischen haben wir eine Liste dessen was die Daten heute beantworten können, was sie mit einer bestimmten Reparatur beantworten könnten, und was sie ohne Daten die das Unternehmen nicht hat nicht beantworten können. Der Inhaber ordnet die Reparaturen genauso wie er die Fragen geordnet hat. Meistens ist das Obere der Liste unspektakulär: die vier Events reparieren die zählen, die dreißig löschen die nicht zählen, Einkaufspreise nächtlich ins Warehouse holen statt aus einer Quartalstabelle, Kampagnen ab jetzt konsistent taggen. Jedes davon macht die drei Zahlen genauer, und Genauigkeit verzinst sich.

Dann fragt der Inhaber nach Forecasting, weil es das ist was ihm ursprünglich verkauft wurde, und ich sage: zuletzt. Nicht nie, zuletzt. Ich habe einen vollständigen Leitfaden zum Forecasting geschrieben und der erste Abschnitt handelt von Datenqualität, weil ein Forecast eine Maschine ist die deine Definitionen in die Zukunft fortschreibt. Wenn deine Retourenquote um den Faktor zwei falsch ist, sagt der Forecast selbstbewusst eine Marge voraus die es nicht gibt, mit einem hübschen Konfidenzintervall um die falsche Zahl. Ein Forecast der in Woche eins eines Projekts gebaut wird ist Fiktion mit Fehlerbalken. Ein Forecast der im dritten Monat gebaut wird, auf einem Warehouse mit einem Jahr sauberer Historie und Definitionen denen alle zustimmen, ist ein Werkzeug aus dem Budgets abgeleitet werden können. Der Unterschied ist nicht der Algorithmus. Es ist alles oberhalb dieses Absatzes.

Dasselbe gilt für die Modelle die die Leute wirklich begeistern, die Empfehlungsmaschinen und die Kündigungsvorhersagen und die dynamische Preisgestaltung. Sie alle brauchen dasselbe Fundament und sie alle gehen ohne es auf dieselbe Weise schief. Der erste Monat ist nicht die Verzögerung vor der interessanten Arbeit. Er ist der Teil der interessanten Arbeit der entscheidet ob der Rest echt ist.

Was du am Ende des ersten Monats schriftlich bekommst

Ich schließe den Monat mit einem Dokument ab, weil ein Monat Arbeit der im Kopf von jemandem lebt nicht das wert ist was dafür bezahlt wurde. Es enthält:

Die Entscheidungsliste, geordnet, mit den dreien an denen wir gearbeitet haben und was wir gefunden haben. Das Tracking Audit: jede Quelle, was sie zählt, wo sie doppelt zählt, wo sie übersieht, und um wie viel, mit der Consent Rate schriftlich damit niemand mehr GA4 für die Wahrheit hält. Die Dateninventur, Tabellen inklusive, mit Verantwortlichen und Zugängen. Die Definitionsseite, eine Bedeutung pro Begriff, vom Inhaber freigegeben. Die Verknüpfungsregeln und die bewussten Nichtverknüpfungen. Die nächtlichen Jobs, dokumentiert, laufend, und versioniert in einem Repository das dem Unternehmen gehört. Das Dashboard mit drei Zahlen, mit Bereichen. Und die geordnete Liste dessen was als Nächstes repariert und gebaut wird, mit grobem Aufwand für jeden Punkt.

Alles darin gehört dir. Das Warehouse liegt auf deinem Server, der Code in deinem Repository, das Dokument in deinem Portal. Wenn wir am Tag einunddreißig aufhören zusammenzuarbeiten, behältst du alles davon und jeder kompetente Entwickler kann anhand des Dokuments weitermachen. Das ist keine großzügige Geste, so soll die Konzept und Planungsphase bei jedem Projekt funktionieren, und deshalb kann ich den ersten Monat so anbieten wie ich es auf der Preisseite tue. Der Monat ist für mich günstig herzugeben, weil er etwas produziert das entweder offensichtlich wert ist fortgesetzt zu werden oder offensichtlich nicht, und wir beide können am Ende sehen was davon zutrifft.

Die Version davon die schiefgeht

Ich sollte ehrlich sein wie das scheitert, denn manchmal tut es das.

Es scheitert wenn der Inhaber in Woche eins keine sechs Stunden hat. Nicht weil er faul ist, sondern weil das Geschäft brennt und das Gespräch über Entscheidungen immer wieder verschoben wird. Ohne es rate ich bei den Fragen, und ein Monat der geratene Fragen beantwortet ist das Dashboard auf das niemand schaut, schon wieder.

Es scheitert wenn der Zugang drei Wochen dauert. Ein reiner Lesebenutzer für die Datenbank sollte einen Nachmittag dauern. Wenn es bis Tag zwanzig dauert weil es über eine externe Agentur laufen muss die die Datenbank als ihre betrachtet, wird aus Monat eins Monat zwei und der Schwung ist weg.

Und es scheitert wenn das Definitionsmeeting einen Streit statt einer Seite produziert, wenn Finanzen und Marketing lieber jeweils ihre eigene Zahl behalten als sich auf eine zu einigen. Das kann ich moderieren. Auflösen kann ich es nicht, und ein Unternehmen das sich nicht darauf einigen will was Umsatz bedeutet ist nicht bereit für ein Modell das ihn vorhersagt.

Nichts davon ist häufig. Alles davon ist am Ende von Woche eins sichtbar, was ein weiteres Argument dafür ist eine zu haben.

Was es nicht ist

Es ist keine KI. Nichts im ersten Monat nutzt ein Sprachmodell oder ein neuronales Netz oder irgendetwas das in einem Pitch beeindruckend aussähe. Es ist SQL, ein paar geplante Jobs, ein paar Tabellen die in Rente gehen, und viele Gespräche darüber was Wörter bedeuten.

Es ist kein Dashboard Projekt. Ein Dashboard fällt dabei ab, mit drei Zahlen, aber das Ergebnis ist das Fundament auf dem das Dashboard steht, und dieses Fundament ist das was den Forecast aus Monat sechs lesenswert macht.

Und es ist nicht dasselbe wie das was dir letztes Mal verkauft wurde, was ziemlich genau der Punkt ist. Wäre es das, hättest du die Antworten schon, und du würdest keinen Artikel darüber lesen warum du sie nicht hast.

Wenn du wissen willst was deine Daten heute beantworten können, ist der erste Monat der in dem wir es herausfinden. Melde dich und wir fangen mit deinem Kalender an.

Wenn du ein Dashboard hast auf das niemand schaut, oder gerade dabei bist eines zu kaufen, lass uns den ersten Monat stattdessen mit den Fragen verbringen. Ich sage dir was deine Daten heute beantworten können, was nicht, und was es bräuchte um die Lücke zu schließen.

1%jeder Rechnung geht an eine Charity, die du wählst.

Eine Spende, nie Sponsoring. Du wählst das Anliegen beim Onboarding.

Die Geschichte hinter dem Versprechen →

Bleib deiner Konkurrenz voraus.

Die neuesten innovativen Produkte und Services, direkt in dein Postfach, bevor deine Mitbewerber davon hören.

Sichere dir bis zu 5% auf deine ersten sechs Monate: 1% pro gewähltem Thema, die vollen 5% wenn du alles nimmst. Limitiertes Angebot · endet am 31. Dezember 2026.

Nur für Neukunden. Es gelten die AGB.

* Bis zu 5% auf deine ersten sechs Monatsrechnungen, nur für Neukunden. Alle Bedingungen.

Fragen zu Preisen, Verträgen oder zur Zusammenarbeit?

Zu den FAQ