Zählen und Summieren schlägt Machine Learning, meistens jedenfalls
Hier ist ein Muster das ich immer wieder bei Inhabern sehe denen künstliche Intelligenz verkauft wurde. Jemand hat eine völlig gewöhnliche Geschäftsfrage, was sollen wir verlangen, welche Kunden sind gleich weg, wo versickert eigentlich das Geld, und bevor irgendwer auch nur eine einzige Sache gezählt hat springt das Gespräch schon zu Machine Learning. Lass uns ein Modell trainieren. Und meistens, und ich meine wirklich meistens, hätte ein sorgfältiges Zählen und eine Summe auf der Rückseite eines Briefumschlags die Frage schneller beantwortet, zu einem Bruchteil der Kosten, und mit einer Ehrlichkeit die dir eine Blackbox nie geben wird. Ich will dir die Gewohnheit zeigen die gute Analysten haben und fast alle anderen überspringen. Bevor du zu etwas Cleverem greifst, brichst du das Problem auf seine einfachste treibende Gleichung herunter, und du lässt diese Gleichung dir sagen welche einzelne Zahl das Ergebnis tatsächlich bewegt. Mach das zuerst und du wirst staunen wie oft sich das Modell als eine sehr teure Art herausstellt Rechnen zu vermeiden.
Die Interviewfrage die jeden verrät
Es gibt eine klassische Analytics Interviewfrage die ich liebe, wegen der Gnadenlosigkeit mit der sie Leute sortiert. Der Interviewer sagt, ganz beiläufig, wir bringen ein Produkt auf den Markt, was sollen wir dafür verlangen. Und du kannst dem Kandidaten in Echtzeit dabei zusehen wie er entscheidet welche Art Analyst er ist.
Der Angeber greift zu etwas Cleverem. Er fängt an über Preiselastizitätsmodelle zu reden, eine Regression auf vergleichbare Produkte, vielleicht ein Machine Learning Modell trainiert auf aus dem Web gekratzten Wettbewerberpreisen. Das klingt beeindruckend. Es ist an diesem Punkt auch völlig nutzlos, denn er hat noch gar nicht aufgeschrieben was der Preis überhaupt bewirkt.
Der gute Analyst macht etwas fast Langweiliges. Er sagt, na ja, Umsatz ist Preis mal Menge, also fangen wir da an und schauen was sich wirklich bewegt. Das ist alles. Das ist der ganze Trick, und es ist die Gewohnheit die ich dir in diesem Artikel mitgeben will, denn sie lässt sich auf fast jede Datenfrage übertragen die ein Unternehmen dir je stellen wird. Ich habe sie bei der Preisgestaltung benutzt, bei der Akquise, bei der Abwanderung, in der Lagerhaltung, bei der Personalplanung, und die Form ist immer dieselbe. Schreib das Ergebnis als ein Produkt und eine Summe aus ein paar ehrlichen Treibern, dann geh und zähl den Treiber der die Arbeit leistet.
Brich es auf seine einfachste Gleichung herunter
Die Methode hat in der Branche einen Namen. In The Data Analytics Handbook, dem Interviewleitfaden der 2014 die Runde machte, wird sie beschrieben als ein Problem auf seine einfachste Gleichung herunterzubrechen bevor du überhaupt Daten anfasst. Du beginnst nicht mit den Daten. Du beginnst mit der Arithmetik des Geschäfts, geschrieben als eine ehrliche Zeile, und erst dann gehst du die Zahlen suchen um sie zu füllen.
Also, was sollen wir verlangen. Umsatz ist das was wir wachsen lassen wollen, und Umsatz besteht aus genau zwei Teilen.
Das sieht trivial aus. Ist es nicht, und hier ist warum. In dem Moment in dem du es aufschreibst hast du die Spannung freigelegt um die es bei der ganzen Preisfrage eigentlich geht. Drück den Preis hoch und, sofern deine Kunden nicht aus Stein sind, geht die Menge runter. Die Frage ist also nie was ist der höchste Preis. Sie ist bei welchem Preis Preis mal Menge am größten ist.
Lass mich Zahlen draufsetzen, illustrative, die Art über die du streiten kannst. Sagen wir du verkaufst heute zu 40 Euro und setzt zehntausend Stück im Jahr ab.
Vierhunderttausend Euro. Jetzt bist du versucht den Preis auf 44 Euro anzuheben, ein Plus von zehn Prozent. Dein Bauch sagt der Umsatz steigt um zehn Prozent. Aber du gehst zählen, du schaust dir tatsächlich an was letztes Mal passiert ist als du am Preis gedreht hast, und du findest dass ein Plus von zehn Prozent dich rund acht Prozent deiner Menge kostet. Die Menge fällt also auf neuntausendzweihundert.
Vierhundertviertausendachthundert. Er ist gestiegen, aber kaum um ein Prozent, nicht um zehn. Und jetzt hat sich das ganze Bild verändert, denn du verkaufst achthundert Stück weniger zu einer höheren Marge, was fast sicher mehr Gewinn ist obwohl sich der Umsatz kaum bewegt hat. Die Gleichung hat dir nicht nur eine Antwort gegeben. Sie hat die ganze Frage umgerahmt, von welcher Preis zu was optimieren wir eigentlich, Umsatz oder Gewinn, denn die beiden zeigen jetzt in verschiedene Richtungen.
Kein Modell hat dir das gesagt. Ein Zählen dessen was letztes Mal passiert ist als du den Preis bewegt hast hat dir das gesagt, eingesetzt in eine Gleichung die ein Kind lesen kann.
A HA eins, das Verhältnis um das sich der Preis wirklich dreht
Lass mich den Preisfall einen Schritt weiter treiben, denn darin versteckt sich eine zweite Erkenntnis an der die meisten glatt vorbeigehen. Was tatsächlich entschieden hat ob diese Preiserhöhung sich lohnte war ein einziges Verhältnis, wie viel Menge du für jedes Prozent Preis verlierst das du draufpackst. Analysten nennen es Elastizität, aber du brauchst das Wort nicht um die Idee zu benutzen.
Eine Elastizität von minus null Komma acht heißt die Nachfrage ist unelastisch, du verlierst weniger Menge als den Preis den du gewinnst, also hebt eine Preiserhöhung den Umsatz. Wäre dieses Verhältnis als minus eins Komma fünf zurückgekommen, hätte dieselbe Rechnung dir gesagt den Preis zu senken, nicht zu heben. Der wahre Hebel hinter der Preisfrage ist also gar nicht der Preis. Es ist ein ehrliches Verhältnis das du nur bekommst indem du zählst was letztes Mal passiert ist. Das ist die Sache an der du arbeiten solltest, und kein Modell wird sie dir zu niedrigeren Kosten reichen als es deine eigene Verkaufshistorie schon tut.
Der Hebel liegt offen sichtbar
Lass mich ein zweites machen, denn das Muster ist der Punkt, nicht die Preisgestaltung.
Ein Inhaber kommt zu mir und sorgt sich ums Wachstum. Wir brauchen mehr Kunden, sagt er, und irgendwer hat ihm erzählt die Antwort sei ein Propensity Modell das jeden Besucher danach bewertet wie wahrscheinlich er kauft. Großes Projekt. Teuer. Bevor wir einen Cent dafür ausgeben schreiben wir die Gleichung.
Neukunden sind einfach die Leute die auftauchen mal dem Anteil davon der kauft. Zwei Hebel, nur zwei. Also zählen wir. Traffic sind fünfzigtausend Besucher im Monat. Die Konversionsrate liegt bei zwei Prozent.
Tausend Neukunden im Monat. Jetzt kommt die nützliche Frage, eigentlich die einzige Frage, welche dieser zwei Zahlen leichter zu bewegen ist. Und hier verdient sich das Zählen seinen Lohn. Wir schauen, und wir finden dass der Traffic seit einem Jahr flach ist trotz stetiger Werbeausgaben, während die Konversionsrate im selben Zeitraum still von zwei Komma sechs Prozent auf zwei Prozent gerutscht ist, gleich nach einem Umbau des Checkouts.
Da ist er. Der Hebel ist die Konversion, und genauer gesagt ein Checkout der schlechter geworden ist. Die Konversion zurück auf zwei Komma sechs Prozent zu heben, nur den Schaden rückgängig zu machen, bringt dir dreizehnhundert Kunden bei gleichem Traffic.
Ein Plus von dreißig Prozent, für die Kosten ein Formular zu reparieren. Das Propensity Modell hätte drei Monate damit verbracht zu lernen genau die Besucher zu ranken die an einem kaputten Checkout ohnehin schon absprangen. Es hätte das falsche Glied der Kette optimiert, teuer, und eine schöne bewertete Liste erzeugt die nichts verändert.
Das ist das zweite A HA Moment, und es ist das das den ganzen Artikel bezahlt. Das Modell kostet nicht nur mehr. Es versteckt aktiv den Hebel, denn es beantwortet die Frage wer wird am ehesten konvertieren wenn die Frage die zählte war warum ist die Konversion gefallen. Ein Zählen beantwortete die zweite Frage an einem Nachmittag.
Zieh dieselbe Zeile einen Schritt weiter
Schau was passiert wenn ich diese Gleichung ausdehne bis zu dem was den Inhaber wirklich interessiert, nämlich Geld, nicht Kunden. Du multiplizierst einfach mit dem nächsten ehrlichen Treiber weiter.
Jetzt sind drei Hebel auf einer Zeile, und du kannst alle drei zählen gehen. Sagen wir der durchschnittliche Bestellwert liegt bei achtzig Euro.
Achtzigtausend Euro im Monat. Das Schöne an der ausgedehnten Zeile ist dass sie dich Hebel in derselben Währung vergleichen lässt. Ein Sprung der Konversion von zwei auf zwei Komma sechs Prozent ist vierundzwanzigtausend Euro im Monat wert. Ein Anstieg des Bestellwerts von achtzig auf vierundachtzig Euro, vier Prozent, ist etwa viertausend wert. Plötzlich ist die Rangfolge dessen woran zu arbeiten ist keine Meinungssache mehr, sie sitzt direkt da in der Arithmetik, und du hast nie etwas trainiert.
Die Marketing Variante, gleiche Form
Sobald du die Gewohnheit hast siehst du dasselbe Skelett überall. Hier ist das nach dem ich greife wann immer das Gespräch um bezahlte Akquise geht, und es lohnt sich es auswendig zu können.
Gewinn aus Akquise ist der Wert eines Kunden über sein Leben, minus dem was seine Gewinnung gekostet hat, mal der Anzahl die du gewinnst. Sagen wir ein Kunde ist über sein Leben 900 Euro wert, kostet 300 in der Gewinnung, und du gewinnst tausend davon.
Sechshunderttausend Euro. Jetzt schau auf diese Klammer, denn die Klammer ist der Hebel. Wenn deine CLV Schätzung weich ist, und in den meisten Geschäften ist sie eine als Fakt verkleidete Vermutung, dann ruhen die ganzen sechshunderttausend auf einer Zahl die niemand tatsächlich gezählt hat. Die wertvollste Analytics Arbeit hier ist nicht ein Modell das den CAC auf die zweite Nachkommastelle vorhersagt. Sie ist zu gehen und ordentlich zu zählen was ein Kunde wirklich wert ist, denn ein Fehler von fünfzig Euro im CLV bewegt die Antwort um fünfzigtausend Euro, und keine noch so ausgefeilte Modellierung weiter unten kann einen faulen Input retten. Zähl das was die Gleichung als am wichtigsten ausweist, und heb dir das Clevere für den Moment auf in dem die Arithmetik ausgeht.
CLV ist selbst eine Gleichung, also mach sie auf
Hier ist eine Falle die es wert ist benannt zu werden. Leute behandeln CLV als einen einzelnen Fakt, ein Etikett von neunhundert Euro auf dem Kunden, während er in Wahrheit eine weitere kleine Gleichung ist die darum bettelt aufgemacht zu werden. Die einfachste ehrliche Fassung ist diese.
Sagen wir ein Kunde zahlt fünfzig Euro im Monat, du behältst nach Kosten sechzig Prozent davon, und er bleibt dreißig Monate.
Da sind deine neunhundert Euro, aber jetzt hat es Nähte an denen du ziehen kannst. Die Lebensdauer in Monaten ist einfach eins geteilt durch deine monatliche Abwanderungsrate, also hält ein Kunde der mit drei Komma drei Prozent im Monat abwandert etwa dreißig Monate. Senk diese Abwanderung auf zwei Komma fünf Prozent und die Lebensdauer springt auf vierzig Monate, und der CLV klettert auf zwölfhundert Euro ohne einen einzigen Neukunden zu gewinnen oder einen einzigen Preis zu heben. Das ist das A HA das die meisten Akquise Paniken umrahmt. Der günstigste Kunde den du gewinnen kannst ist sehr oft der den du schon hast und still verlierst.
Ein dritter Treiber den zu zählen sich lohnt, das Leck das keiner beobachtet
Dieser letzte Punkt verdient seine eigene Zeile, denn Abwanderung ist der Treiber den ich am wenigsten gezählt und am meisten besorgt sehe. Wenn du irgendetwas auf Abonnementbasis betreibst, hat dein monatlich verlorener Umsatz eine schmerzhaft einfache Form.
Fünfzehnhundert Kunden, drei Prozent monatliche Abwanderung, sechzig Euro pro Stück.
Zweitausendsiebenhundert Euro die jeden Monat zur Tür hinausgehen, zweiunddreißigtausendvierhundert im Jahr, und es summiert sich, denn diese Kunden wären geblieben und hätten wieder gezahlt. Jetzt stell das neben die Akquise. Um zweitausendsiebenhundert Euro verlorenen MRR bei dreihundert Euro CAC und sechzig Euro Monatswert zu ersetzen, musst du fünfundvierzig Neukunden im Monat gewinnen nur um auf der Stelle zu treten. Als eine Zeile geschrieben wird offensichtlich dass die Abwanderung von drei auf zwei Prozent zu drücken mehr wert ist als fast alles was du auf der Akquiseseite tun könntest, und das hast du durch Zählen herausgefunden, nicht durch das Trainieren eines Abwanderungsmodells das dir gesagt hätte wer geht ohne dir je zu sagen dass es weniger kostet sie zum Bleiben zu bringen.
Ein durchgerechneter Mini Fall, das SaaS das ein Abwanderungsmodell wollte
Lass mich die ganze Gewohnheit an einem realistischen Beispiel zusammensetzen, Zahlen illustrativ wie immer. Ein Gründer kam zu mir überzeugt dass er ein Machine Learning Abwanderungsmodell braucht. Er hatte gelesen dass die klugen SaaS Firmen jedes Konto auf Abwanderungsrisiko bewerten, und er wollte eins. Budget wurde schon aufgestellt. Vor all dem schrieben wir die Gleichungen.
Fang dort an wo das Geld tatsächlich ist.
Hunderttausend Euro im Monat. Dann das Leck.
Dann taten wir das was das Modell ihn nie hätte tun lassen. Wir zählten die Abwanderung, aber aufgeschlüsselt danach wie der Kunde hereingekommen war. Und die Aufteilung war krass. Kunden die über eine Rabattaktion gewonnen wurden wanderten mit fünf Komma fünf Prozent im Monat ab. Kunden die zum vollen Preis gewonnen wurden wanderten mit eins Komma fünf Prozent ab. Gleiches Produkt, wild unterschiedliches Leck, und die gemischten drei Komma drei Prozent hatten es versteckt.
Fast das ganze Leck, zweitausendvierhundertfünfundsiebzig Euro der insgesamt dreitausenddreihundert, kam aus einem Segment das zum Teil aus Schnäppchenjägern bestand die nie vorhatten zu bleiben. Ein Abwanderungsmodell hätte pflichtbewusst gelernt genau das vorherzusagen und ihm eine Liste gefährdeter Konten gereicht, die meisten davon die Aktionskohorte, und vorgeschlagen Geld auszugeben um Leute zu halten die ohnehin nie den vollen Preis zahlen würden. Das Zählen sagte ihm etwas weit Nützlicheres und weit weniger Schmeichelhaftes, dass der Akquisekanal selbst die Abwanderung herstellte, und dass die Lösung stromaufwärts lag, bei der Art wie er Kunden einkaufte, nicht stromabwärts in einem Retentionsmodell. Er stoppte die Aktion. Das war das ganze Projekt, und es kostete einen Nachmittag am Whiteboard.
Eine kleine Bibliothek von Gleichungen für den Kopf
Sobald du der Gewohnheit traust hilft es ein paar davon mit dir herumzutragen, denn das Schwere ist meist bloß sich zu erinnern dass die Zeile existiert. Hier ist die Auswahlliste die ich tatsächlich benutze.
| Geschäftsfrage | Die einfachste Gleichung | Der Hebel den sie freilegt |
|---|---|---|
| Was sollen wir verlangen | Umsatz = Preis x Menge | Wie viel Menge sich pro Prozent Preis bewegt |
| Wie bekommen wir mehr Kunden | Neukunden = Traffic x Konversionsrate | Welche der zwei gerutscht ist |
| Ist unsere Akquise profitabel | Gewinn = (CLV minus CAC) x Kunden | Die Ehrlichkeit der CLV Zahl |
| Was ist ein Kunde wert | CLV = ARPU x Marge x Lebensdauer | Die Lebensdauer, also eins durch Abwanderung |
| Wo versickert der Umsatz | verlorener MRR = Kunden x Abwanderung x ARPU | Die Abwanderungsrate, nach Segment geteilt |
| Haben wir genug Leute | Kapazität = Leute x Stunden x Auslastung | Die Auslastung, der wirklich fakturierbare Anteil |
Keine davon braucht ein Modell zum Ausrechnen. Jede davon braucht dich um eine Zahl ehrlich zu zählen, und jede davon zeigt, einmal aufgeschrieben, auf die Zahl die das Zählen wert ist.
Brauchst du also wirklich ein Modell, oder ein Zählen
Hier ist die Entscheidung die ich laut durchgehe, bevor irgendwer in einem meiner Projekte die Worte Machine Learning sagen darf.
Die meisten Fragen verlassen nie die linke Seite. Du schreibst die Gleichung, du zählst die Treiber, das Zählen beantwortet sie, du lieferst. Ein Modell verdient seinen Platz nur in der unteren rechten Ecke, wo das Muster wirklich zu verworren ist um es als Zeile zu schreiben, und stabil genug um das Lernen wert zu sein, und du schon Daten hast die gut genug zum Lernen sind. Das ist ein echter Ort. Betrugsmuster, Nachfrageprognosen über tausende Artikel, Empfehlungen im großen Maßstab, die widersetzen sich wirklich einer einzelnen Gleichung und ein Modell ist das richtige Werkzeug. Aber es ist eine Ecke, nicht die ganze Landkarte, und die Tragödie ist wie viele Geschäfte in dieser Ecke starten, für Fragen die sie nie hätten verlassen müssen.
Zählen gegen Modellieren, ehrlich verglichen
Ich bin nicht gegen Modelle. Ich baue sie wenn sie gerechtfertigt sind. Aber der Handel ist real und es lohnt sich ihn auf einer Seite zu sehen.
| Worauf es dir ankommt | Zählen und Summieren | Machine Learning Modell |
|---|---|---|
| Zeit bis zur ersten Antwort | Stunden | Wochen bis Monate |
| Kosten | Fast nichts | Daten, Werkzeuge und Leute |
| Kannst du es dem Vorstand erklären | Ja, es ist eine Zeile | Selten, und nicht ehrlich |
| Kann jemand es anfechten | Ja, jede Zahl ist sichtbar | Nur der der es gebaut hat |
| Zeigt es dir den Hebel | Fast immer | Fast nie, es vergräbt ihn |
| Wann es wirklich gewinnt | Einfache, einmalige, rahmbare Fragen | Komplexe, stabile, wiederkehrende Muster |
Lies die Zeile die sagt kann jemand es anfechten, denn das ist die die Inhaber unterschätzen. Ein Zählen ist verteidigbar. Jede Zahl in der Gleichung liegt offen da für jeden zum Anfechten, und dieses Anfechten ist der Ort an dem das echte Verständnis entsteht. Ein Modell reicht dir eine Antwort ohne Nähte, und der Moment in dem du eine Zahl nicht hinterfragen kannst ist der Moment in dem sie still Entscheidungen zu treffen beginnt denen du nie zugestimmt hast.
Häufige Fehler die ich sehe
Nach genug solcher Projekte tauchen immer wieder dieselbe Handvoll Fehler auf, und es lohnt sich sie zu benennen damit du dich selbst ertappst.
Der erste ist zum Modell zu greifen bevor die Gleichung steht. Jemand verliebt sich in die Idee der Vorhersage bevor irgendwer die eine Zeile geschrieben hat die sagt was er vorhersagen will und warum. Das Modell wird zu einer Art die härtere, bescheidenere Arbeit des Zählens zu vermeiden.
Der zweite ist einen Treiber zu optimieren der schon nahe an seiner Decke ist. Wenn deine Konversionsrate schon exzellent ist, ist es brutal schwer noch einen Splitter herauszuquetschen, während der Traffic der flach daneben liegt sich mit bescheidenem Aufwand verdoppeln ließe. Die Gleichung zeigt dir beide Zahlen nebeneinander, damit du die mit dem meisten Spielraum wählen kannst, und trotzdem fallen Leute auf den Treiber herein der aufregend wirkt statt auf den der tatsächlich locker ist.
Der dritte ist einem gemischten Durchschnitt zu trauen der eine Aufteilung versteckt. Die drei Prozent Abwanderung die in Wahrheit fünf Komma fünf und eins Komma fünf waren. Die zwei Prozent Konversion die auf dem Handy acht Prozent und am Rechner ein halbes Prozent sind. Durchschnitte sind der Ort an dem Hebel sich verstecken gehen, also frag dich, sobald du die Gleichung hast, immer was passiert wenn ich diese Zahl nach Segment aufbreche.
Der vierte ist einen weichen Input zu behandeln als wäre er hart. Wieder CLV, oder eine Kostenzahl die jemand vor zwei Jahren in einer Besprechung geschätzt hat. Die Gleichung ist nur so ehrlich wie ihre schwächste Zahl, und die wertvollste Stunde die du verbringen kannst ist oft gar keine Modellierung, sie ist zu gehen und den einen Input zu zählen den alle still angenommen haben.
Der fünfte, und der teuerste, ist etwas zu bauen das niemand hinterfragen kann. Wenn die Antwort die herauskommt nicht gegen ein Zählen geprüft werden kann, hast du deine Unsicherheit nicht verringert, du hast sie nur in einer Maschine versteckt, und versteckte Unsicherheit ist weit gefährlicher als die sichtbare, denn sie hält jeden davon ab mit ihr zu streiten.
Und einen sechsten sehe ich fast so oft, nämlich die Gleichung zu schreiben und dann trotzdem den falschen Treiber zu bewegen weil er sich bequemer anfühlt. Der Traffic ist leicht zu kaufen, also kauft man Traffic, obwohl die Zeile klar zeigt dass die Konversion das lockere Glied ist. Die Gleichung tut ihre Arbeit nur wenn du auch ehrlich auf sie hörst, und ehrlich auf sie zu hören heißt oft die unbequemere der zwei Zahlen anzupacken. Genau dafür ist die Zeile da, sie nimmt dir die Ausrede weg dass du es nicht wusstest.
Wie du das am Montagmorgen anwendest
Nichts davon ist Theorie, hier ist also die Routine, klein genug um sie tatsächlich zu benutzen. Sie passt auf einen Klebezettel.
Schritt eins, schreib das Ergebnis das dich wirklich interessiert an den Kopf einer Seite, in Geld wenn du kannst. Schritt zwei, frag woraus es besteht, und frag weiter bis du eine Zeile aus ein paar Treibern hast, multipliziert und addiert. Schritt drei, widersteh dem Drang Daten zu sammeln bevor die Zeile fertig ist, denn die Zeile sagt dir welche Daten überhaupt das Sammeln wert sind. Schritt vier, geh und zähl jeden Treiber, aus echter Historie, nicht aus dem Gedächtnis. Schritt fünf, und das ist der den Leute überspringen, brich jeden Durchschnitt in Segmente auf und schau ob der Hebel in Wahrheit eine versteckte Scheibe ist. Schritt sechs, wähl den Treiber mit dem meisten Spielraum und dem geringsten Aufwand, und beweg ihn. Nur wenn all das die Frage wirklich unbeantwortet lässt, und das Muster stabil und wiederkehrend ist, lässt du das Wort Modell zurück in den Raum. Neun von zehn Mal bist du schon fertig.
Wie ich das mit einem Kunden tatsächlich durchgehe
Wenn mir jemand eine Datenfrage bringt rührt die erste Sitzung fast nie einen Datensatz an. Wir holen ein Whiteboard und wir schreiben die Gleichung. Was wollen wir wirklich bewegen, und woraus besteht es, multipliziert und addiert zu einer ehrlichen Zeile. Neun von zehn Mal wird der Raum still, denn die Gleichung hat gerade offensichtlich gemacht welche Zahl niemand zu messen bemüht war, und diese fehlende Zahl ist das ganze Projekt. Wir gehen sie zählen. Oft ist das der gesamte Auftrag, und der Kunde geht mit einer Antwort die er seinem eigenen Vorstand erklären kann ohne mich im Raum, was genau so sein sollte.
Das zehnte Mal geht die Arithmetik wirklich aus. Die Beziehung ist tatsächlich zu verknotet für eine Zeile, die Daten sind reich und stabil, und ein Modell ist der ehrliche nächste Schritt. Dann bauen wir eins, gerne, aber wir bauen es im Wissen welchen Hebel es genau bewegen soll, denn die Gleichung hat es uns gesagt, und wir können seine Antwort gegen ein Zählen prüfen um sicherzugehen dass es nicht in Unsinn abgewandert ist. Ein Modell das du nicht gegen Arithmetik auf Plausibilität prüfen kannst ist ein Modell dem du nicht trauen solltest, und die Arithmetik muss zuerst kommen damit diese Prüfung überhaupt existiert.
Wenn dir eine große Zahl für ein Machine Learning Projekt genannt wurde und du das nagende Gefühl hast dass noch niemand die einfache Sache tatsächlich gezählt hat, dann ist das genau das Gespräch das ich gerne führe. Bring die Frage mit, wir schreiben die Gleichung gemeinsam, und öfter als du erwarten würdest gehst du raus ohne das Modell überhaupt zu brauchen. Das ist die Art unglamouröser, geldsparender Arbeit auf der meine Daten und Analytics Praxis aufgebaut ist, und du kannst einen Termin buchen wann immer du eine zweite Meinung willst bevor du ausgibst.
Die eine Gewohnheit die du mitnehmen sollst
Wenn du eine einzige Sache hiervon mitnimmst, mach sie zum Reflex. Das nächste Mal wenn eine Geschäftsfrage auf deinem Tisch landet, und bevor irgendwer das Wort Modell sagt, frag dich was ist die einfachste Gleichung die das beschreibt. Schreib sie als eine Zeile. Multipliziere die Treiber, addiere die Teile, und starre sie an bis sie dir sagt welche Zahl die Arbeit leistet. Dann geh diese Zahl zählen, wirklich zählen, und schau ob die Frage schon beantwortet ist. Meistens wird sie es sein, und du hast Monate und eine Menge Geld gespart, und du verstehst dein eigenes Geschäft auf eine Art die dir keine Blackbox je erlaubt hätte. Das Clevere ist immer noch da für wenn du es wirklich brauchst. Du wirst es nur weit seltener brauchen als irgendwer dir verkaufen will.