Panel Regression und Umsatz auf vergleichbarer Fläche
Unternehmen mit mehreren Standorten leiden an einer ganz bestimmten Verwirrung. Das Flaggschiff hatte einen Rekordherbst, das kleine Haus ein schwaches Jahr, das Marketing hat 40 Prozent mehr Newsletter verschickt, und niemand kann sagen, welche Tatsache welche erklärt. Panel Regression ist genau dafür gebaut: Daten mit einem Querschnitt an Einheiten (Hotels, Filialen, Märkte, SaaS Konten) und einer Reihe von Zeitperioden gleichzeitig. In diesem Kapitel nehme ich fünf fiktive Hotels im Salzkammergut durch zwölf Quartale und zeige, warum eine gepoolte Regression den Newsletter schmeichelt und beim Preis das Vorzeichen falsch hat, wie Fixed Effects jedes Hotel nur mit seiner eigenen Geschichte vergleichen, was der Hausman Test wirklich fragt, warum Standardfehler geclustert werden müssen und wie dieselbe Maschinerie die Like for Like Kennzahl erzeugt, die Händler veröffentlichen. Die Residuen leisten dann etwas, das keine Tabelle kann: Sie zeigen ein Hotel, das vier Quartale in Folge still hinter sich selbst zurückfällt, rund 90.000 Euro wert, während die Nachbarn auf Kurs bleiben. Das ist Teil 9 von 21 der Serie Marketing Analytics.
Ein gutes Quartal oder ein gutes Hotel?
Jeden Jänner sitzen die fünf Direktoren der Seeblick Hotels mit der Eigentümerin an einem Tisch in Bad Ischl, ein Stapel Ausdrucke in der Mitte. Das Flaggschiff am Wolfgangsee meldet den besten Herbst seiner Geschichte. Das Haus Bergblick weiter oben im Tal meldet ein schwaches Jahr und schiebt es auf das Wetter, die Strassenbaustelle und die Buchungsplattformen. Das Marketing meldet 40 Prozent mehr Newsletter und doppeltes Budget für Paid Social. Jeder hat eine Zahl. Niemand weiss, welche Zahl welche erklärt.
Die Eigentümerin hat mir die Frage gestellt, die ich in irgendeiner Form von jedem Unternehmen mit mehreren Standorten höre: "Ist Bergblick ein schlechtes Hotel, oder hatte Bergblick ein schlechtes Jahr?" Das sind zwei verschiedene Probleme mit zwei verschiedenen Lösungen, und eine Tabelle, die alle fünf Häuser zusammenzählt, kann sie nicht auseinanderhalten. Panel Regression kann das. Sie ist die Methode für Daten mit zwei Dimensionen gleichzeitig, einem Querschnitt an Einheiten (Hotels, Filialen, Regionen, Kundenkonten) und einer Reihe von Zeitperioden (Wochen, Monate, Quartale), und sie ist das statistische Rückgrat der Kennzahl "Umsatz auf vergleichbarer Fläche", die jeder Händler veröffentlicht und kaum jemand herleiten kann. Dieses Kapitel zeigt, wie sie funktioniert, was sie über Marketingausgaben sagt, wenn die Einheiten sehr unterschiedlich gross sind, und wie sie Bergblick dabei erwischt hat, hinter der eigenen Geschichte zurückzubleiben statt hinter den Nachbarn.
Wo dieses Kapitel in der Serie steht
Wir sind in Teil zwei der Serie, Techniken mit abhängiger Variable, Kapitel 4 bis 10. Das vorige Kapitel über Survival Analyse, Churn und Customer Lifetime Value hat einzelne Kunden durch die Zeit begleitet, bis sie gegangen sind. Dieses Kapitel begleitet ebenfalls Einheiten durch die Zeit, aber die Einheiten sind Hotels und das Ergebnis sind Buchungen, also sind wir zurück in der Regression, mit einem Dreh. Das nächste Kapitel über Nachfrageprognosen, Autokorrelation und Saisonalität nimmt sich die Zeitdimension allein vor und fragt, wie das nächste Quartal aussieht.
Warum alles in einen Topf werfen die Struktur versteckt
Seeblick hat fünf Hotels und zwölf Quartale an Daten, 2023 bis 2025. Das sind 60 Zeilen, jede mit direkten Zimmernächten, Newsletter Versand, Ausgaben für Paid Social, der durchschnittlichen Zimmerrate und dem Quartal. Der naheliegende Schritt ist, die 60 Zeilen in eine Regression zu werfen und die Koeffizienten abzulesen. Das Marketingteam hatte das in Excel schon getan und war stolz auf das Ergebnis: jede zusätzlichen tausend Newsletter brachten 71 zusätzliche Zimmernächte, und eine höhere Zimmerrate ging mit mehr Buchungen einher, nicht mit weniger.
Beide Zahlen sind auf lehrreiche Art falsch. Das Hotel am Wolfgangsee hat 72 Zimmer, eine Seeterrasse, eine Adressliste, die viermal so gross ist wie die des Gasthofs Attersee, und es verlangt 60 Euro mehr pro Nacht. In den gepoolten Daten wandern hohes Newsletter Volumen, hoher Preis und hohe Buchungen gemeinsam, nicht weil Newsletter oder Preise Buchungen verursachen, sondern weil alle drei zum grossen Hotel gehören. Die Regression sieht eine Punktwolke, zieht eine Linie hindurch, und die Linie beschreibt vor allem die Hotelgrösse.
Das Liniendiagramm unten zeigt das Rohmaterial. Die Zahlen in diesem Kapitel sind illustrativ, so gebaut, dass sie sich wie echte verhalten.
Fünf Häuser, zwölf Quartale. Die vertikalen Abstände zwischen den Linien sind die Hoteleffekte; das Zittern innerhalb einer Linie ist das, was Marketing und Saison erklären müssen.
Die Lösung: jedes Hotel bekommt seine eigene Grundlinie, und dann stellt man eine engere Frage. Wenn ein Hotel mehr Newsletter verschickt als sonst, bekommt es dann mehr Buchungen als sonst? Dieser Vergleich ist immun gegen Hotelgrösse, Lage und Seeblick, weil sich das alles von Quartal zu Quartal nicht ändert. Man nennt das ein Modell mit festen Effekten, Fixed Effects, und das Diagramm zeigt die Entscheidung, die du dabei triffst.
Drei Arten, mit der Hoteldimension umzugehen. Gepoolte OLS tut so, als gäbe es sie nicht. Fixed Effects geben jeder Einheit einen eigenen Achsenabschnitt. Random Effects behandeln die Achsenabschnitte als Ziehungen aus einer Verteilung, was effizient ist, aber nur unter einer Bedingung ehrlich, die der Hausman Test prüft.
Das Panel Modell, mit Mathematik
Schreib für die direkten Zimmernächte im Hotel im Quartal . Die gepoolte Regression des Teams lautet
wobei der Newsletter Versand in Tausend ist, die Ausgaben für Paid Social in Tausend Euro, die durchschnittliche Zimmerrate in Zehnereuro, ein einziger Achsenabschnitt für alle Hotels, die Koeffizienten die Effekte, die wir wollen, und alles, was das Modell nicht erklärt. Das Problem sitzt in : dort steckt "das ist das Flaggschiff am Wolfgangsee", und das korreliert mit und , also sind die Koeffizienten verzerrt.
Das zweiseitige Fixed Effects Modell holt Hotel und Quartal aus dem Fehlerterm heraus und gibt beiden einen eigenen Parameter:
Hier ist der feste Hoteleffekt, eine Zahl je Hotel, die alles aufsaugt, was sich an diesem Haus in den drei Jahren nicht ändert: Zimmer, Lage, Ruf, das Frühstück. ist der Periodeneffekt, eine Zahl je Quartal, die alles aufsaugt, was alle fünf Hotels gleichzeitig getroffen hat: die Saison, ein verregneter Juli, eine geänderte Plattformprovision. Die Koeffizienten messen jetzt nur noch Variation innerhalb eines Hotels und innerhalb eines Quartals, und genau die wollen wir.
Man kann das mit Dummy Variablen schätzen, fünf für Hotels und elf für Quartale. Der elegantere Weg ist die Within Transformation, die von jeder Beobachtung den Durchschnitt des eigenen Hotels abzieht:
wobei die mittleren Buchungen von Hotel über die zwölf Quartale sind und der Querstrich bei jedem Regressor dasselbe bedeutet. Beachte, dass verschwunden ist: es ist innerhalb eines Hotels konstant, also entfernt das Abziehen des Hotelmittels es exakt. Kleinste Quadrate auf den zentrierten Daten liefern dasselbe wie die Dummy Version, und die Bedeutung wird offensichtlich. Jedes Hotel wird nur mit sich selbst verglichen. Der Preiskoeffizient beantwortet jetzt "wenn Bergblick seine Rate über das eigene übliche Niveau hebt, was passiert mit Bergblicks Buchungen", nicht "bekommen teure Hotels mehr Buchungen".
Fixed oder Random Effects: die Hausman Intuition
Es gibt eine konkurrierende Spezifikation. Random Effects behalten einen Hotelterm, behandeln ihn aber als zufällige Ziehung statt als zu schätzenden Parameter:
wobei ein gemeinsamer Achsenabschnitt ist, die Abweichung des Hotels davon mit Varianz , und die letzte Bedingung ist der Haken: das unbeobachtete Niveau des Hotels darf nicht mit den Regressoren korrelieren. Random Effects nutzen die Variation innerhalb und zwischen den Hotels, also sind ihre Standardfehler kleiner. Es ist der effizientere Schätzer, wenn die Bedingung gilt, und ein verzerrter, wenn nicht.
Bei Seeblick ist die Bedingung offensichtlich verletzt: das grosse Hotel verschickt mehr Newsletter und verlangt mehr, weil es das grosse Hotel ist. Die Hausman Intuition ist schlicht: schätze beide, und wenn die Koeffizienten stärker auseinanderliegen, als das Stichprobenrauschen erklären könnte, ist die Random Effects Annahme gebrochen und du bleibst bei Fixed Effects. Formal:
wobei und die beiden Koeffizientenvektoren sind und die Klammer die Differenz ihrer Kovarianzmatrizen. folgt einer Chi Quadrat Verteilung mit so vielen Freiheitsgraden, wie Koeffizienten getestet werden. Ein grosses heisst, die beiden Schätzungen liegen weiter auseinander, als der Zufall erlaubt.
Das Rechenbeispiel: fünf Hotels, zwölf Quartale
Ein paar Zeilen des Panels, damit du siehst, wie die Daten aussehen. Die verfügbaren Zimmer zählen auch, darauf komme ich beim Umsatz auf vergleichbarer Fläche zurück.
| Hotel | Quartal | Direkte Zimmernächte | Newsletter (Tsd.) | Paid Social (Tsd. €) | Ø Rate (€) |
|---|---|---|---|---|---|
| Seeblick am Wolfgangsee | 2025 Q3 | 3.520 | 48,0 | 9,5 | 218 |
| Haus Bergblick | 2025 Q3 | 1.990 | 19,5 | 5,5 | 149 |
| Gasthof Attersee | 2025 Q3 | 1.580 | 11,5 | 3,0 | 131 |
| Haus Bergblick | 2025 Q1 | 1.480 | 17,0 | 4,5 | 139 |
Jetzt die drei Schätzer nebeneinander. Standardfehler in Klammern; die letzte Spalte zeigt, was mit den Fixed Effects Standardfehlern passiert, sobald sie nach Hotel geclustert werden, was ich unten erkläre.
| Variable | Gepoolte OLS | Random Effects | Fixed Effects (Hotel und Quartal) | FE, geclusterte SE |
|---|---|---|---|---|
| Newsletter Versand, je 1.000 | 71 (9) | 46 (10) | 38 (11) | 38 (16) |
| Paid Social, je 1.000 € | 9 (6) | 18 (7) | 21 (7) | 21 (10) |
| Durchschnittsrate, je 10 € | 12 (8) | minus 29 (13) | minus 44 (15) | minus 44 (22) |
| Q2 gegenüber Q1 | 230 | 238 | 241 | 241 |
| Q3 gegenüber Q1 | 590 | 612 | 624 | 624 |
| Q4 gegenüber Q1 | 170 | 178 | 183 | 183 |
| R Quadrat | 0,61 | 0,87 (within) | 0,87 (within) | |
| Hausman H (3 FG) | 14,6 |
Zeile für Zeile gelesen. Der Newsletter Koeffizient halbiert sich fast von gepoolt zu Fixed Effects, von 71 auf 38. Die gepoolten 71 hatten die Grösse des Flaggschiffs auf dem Rücken; die 38 der Fixed Effects sagen, dass ein Hotel, das tausend Newsletter mehr verschickt als sonst, etwa 38 Zimmernächte mehr bucht als sonst. Bei einer Durchschnittsrate von rund 160 Euro sind das etwa 6.000 Euro Direktumsatz je tausend Versendungen, immer noch ein gutes Geschäft, aber die Hälfte von dem, was das Team geglaubt hat, und das ändert, was Listenwachstum wert ist.
Paid Social bewegt sich in die andere Richtung, von 9 auf 21. Gepoolt sah es fast nutzlos aus, weil die kleinen Hotels anteilig mehr dafür ausgegeben und aus Gründen, die nichts mit Social zu tun hatten, weniger gebucht haben. Innerhalb eines Hotels bringen zusätzliche 1.000 Euro etwa 21 Zimmernächte, rund 3.400 Euro Umsatz. Positiver Ertrag, und jetzt sichtbar.
Der Preiskoeffizient zählt für die Eigentümerin am meisten. Gepoolt heisst es, höhere Preise bringen mehr Buchungen, und das ist das Flaggschiff, das da spricht. Fixed Effects sagen, dass ein Hotel, das seine Rate um 10 Euro über die eigene Norm hebt, etwa 44 Zimmernächte pro Quartal verliert. Bei einem typischen Quartal von 1.800 Nächten ist das eine Elastizität nahe minus 0,4 am Mittelwert: Preiserhöhungen bringen noch Umsatz, aber weniger, als Nächte mal Preis vermuten lässt. Die Saisoneffekte bewegen sich über die Spalten kaum, und das ist beruhigend: jeder hat einen Sommer.
Die Random Effects Spalte liegt zwischen den beiden anderen, wie sie muss, weil sie Variation innerhalb und zwischen den Hotels mischt. Die Hausman Statistik von 14,6 bei drei Freiheitsgraden hat einen p Wert unter 0,01, also ist die Mischung hier nicht vertrauenswürdig und wir bleiben bei den Fixed Effects.
Die geclusterten Standardfehler verdienen einen Satz. Die 60 Beobachtungen sind keine 60 unabhängigen Ziehungen; die zwölf Quartale eines Hotels teilen sich alles, was das Modell über dieses Hotel übersehen hat, also sind die Residuen über die Zeit korreliert. Clustern nach Hotel lässt die Standardfehler das berücksichtigen. Sie wachsen um etwa 40 Prozent, und der Newsletter Effekt geht von sehr sicher zu einfach sicher. Mit nur fünf Clustern ist die Korrektur selbst wackelig, was einer der Fallstricke unten ist. Ich berichte beide und sage es dazu.
Was die Fixed Effects über das Haus Bergblick sagen
Die sind kein Störfaktor; sie sind das zweite Ergebnis. Hier sind sie, ausgedrückt als erwartete Zimmernächte pro Quartal bei durchschnittlichem Marketing und durchschnittlicher Rate der Gruppe, zusammen mit den über 2025 summierten Residuen.
| Hotel | Zimmer | Fixed Effect (Nächte je Quartal) | Nächte je Zimmer | Summe Residuen 2025 |
|---|---|---|---|---|
| Seeblick am Wolfgangsee | 72 | 2.410 | 33,5 | plus 45 |
| Villa Traunsee | 48 | 1.660 | 34,6 | minus 20 |
| Haus Bergblick | 45 | 1.520 | 33,8 | minus 625 |
| Landhaus Mondsee | 38 | 1.310 | 34,5 | plus 60 |
| Gasthof Attersee | 34 | 1.090 | 32,1 | plus 35 |
Die Fixed Effects, geteilt durch die Zimmer, zeigen, dass die fünf Häuser einander erstaunlich ähnlich sind, sobald Marketing, Rate und Saison herausgerechnet sind. Bergblicks 33,8 direkte Nächte je Zimmer und Quartal liegen genau in der Mitte. Es ist kein schlechtes Hotel und bleibt strukturell nicht hinter den Nachbarn zurück; hätte die Eigentümerin nur auf die Summen geschaut, hätte sie es als schwächstes der drei mittelgrossen Häuser abgelegt und wäre weitergegangen.
Die Residuen sagen etwas völlig anderes. Ein Residuum ist die Lücke zwischen dem, was ein Hotel gebucht hat, und dem, was sein Fixed Effect, der Quartalseffekt und sein Marketing vorhergesagt haben. Bei vier Hotels summieren sich die Residuen 2025 auf nahe null, wie es sein soll. Bei Bergblick auf minus 625 Zimmernächte, und das Muster über die Zeit ist der Punkt.
Bergblicks Quartalsresiduen: acht Quartale Rauschen um null, dann vier Quartale mit einer wachsenden Lücke.
Zwölf Residuen, acht davon klein und mit wechselndem Vorzeichen, dann vier hintereinander negativ und wachsend: minus 95, minus 140, minus 210, minus 180. Bei Bergblicks Durchschnittsrate von etwa 145 Euro sind das rund 90.000 Euro Direktumsatz, die laut der eigenen Geschichte des Hotels, dem Marketing der Gruppe und der Saison 2025 hätten kommen sollen und nicht gekommen sind. Das bedeutet "hinter der eigenen Geschichte zurückbleiben", und es ist eine ganz andere Diagnose als "das kleinste der mittelgrossen Hotels". Baustelle, Wetter und Plattformen haben alle getroffen, und die Quartalseffekte haben sie schon aufgesaugt. Bei Bergblick hat sich im ersten Quartal 2025 etwas geändert. In diesem fiktiven Fall war es ein neuer Revenue Manager, der still Kontingente auf die Plattformen verschoben hatte; in echten Fällen habe ich ein kaputtes Buchungswidget und eine abgewanderte Empfangsleiterin gesehen. Das Panel Modell sagt dir nicht die Ursache. Es sagt dir, wo und wann du hinschauen musst, mit einer Zahl dran.
Umsatz auf vergleichbarer Fläche und Like for Like Vergleiche
Händler veröffentlichen jedes Quartal "Umsatzwachstum auf vergleichbarer Fläche" oder "Like for Like Umsatz", weil das Gesamtwachstum zwei Dinge mischt: bestehende Filialen laufen besser oder schlechter, und Filialen eröffnen oder schliessen. Acht Prozent Wachstum mit zwölf neuen Filialen ist ein völlig anderes Geschäft als acht Prozent mit demselben Bestand. Die Like for Like Kennzahl behält nur Filialen, die in beiden Perioden existiert haben, bei vergleichbarer Kapazität, und vergleicht sie mit sich selbst:
wobei die vergleichbare Menge an Einheiten ist, der Umsatz der Einheit im Quartal , und dasselbe Quartal ein Jahr früher, damit sich die Saison herauskürzt. Das ist die einfache Version. Das Panel Modell mit Fixed Effects ist dieselbe Idee, richtig gemacht: eine Filiale mit sich selbst zu vergleichen ist genau das, was die Within Transformation tut, und die Periodeneffekte sind die Korrektur für "alle hatten ein schlechtes Quartal", die das einfache Verhältnis nicht leisten kann. Die Residuen des Panel Modells sind faktisch eine Like for Like Zahl je Einheit und Periode, bereinigt um Marketing und Preis dieser Einheit.
Zwei Dinge zur Kapazität. Wenn ein Hotel einen Flügel für die Renovierung schliesst oder eine Filiale ihre Verkaufsfläche verkleinert, ist die Einheit nicht mehr mit der eigenen Geschichte vergleichbar, also lässt du diese Perioden weg oder modellierst Buchungen je verfügbarem Zimmer; die Sanierung im Landhaus Mondsee 2024 Q1 war ein rätselhafter Einbruch, bis ich das getan habe. Und die vergleichbare Menge muss feststehen, bevor du auf die Ergebnisse schaust. Nachträglich zu entscheiden, welche Filialen als vergleichbar gelten, ist der Weg, auf dem Like for Like Zahlen geschönt werden.
Dieselbe Idee für SaaS Konten und Shops mit mehreren Märkten
Das Hotelbeispiel ist der Klassiker, aber die Struktur taucht überall auf, wo ich arbeite. Werkbank, das fiktive Rails SaaS für Handwerksbetriebe aus dieser Serie, hat ein paar tausend Konten, die monatlich beobachtet werden: Sitze, Logins, verschickte Rechnungen, erhaltene Onboarding Mails, Planpreis. Die Konten unterscheiden sich enorm in der Grösse, und eine gepoolte Regression von Sitzwachstum auf Onboarding Mails erzählt dir vor allem, dass grosse Konten von allem mehr bekommen. Konto Fixed Effects fragen stattdessen, ob ein Konto, das mehr Onboarding Kontakte erhält als sonst, mehr Sitze hinzufügt als sonst. Die Daten haben schon die richtige Form, eine Zeile je Mandant und Periode, wenn die Multi Tenancy Entscheidungen in einer Rails Anwendung, die teuer rückgängig zu machen sind, gut getroffen wurden: eine Mandantenkennung auf jeder Tabelle macht das Panel später möglich.
The Gift Bow, mein Solidus Demo Shop für Geschenkkörbe, verkauft nach Grossbritannien und Österreich: zwei Märkte und 104 Wochen sind ein dünner Querschnitt, aber schon zwei Markteffekte plus Wocheneffekte trennen "Grossbritannien ist der grössere Markt" von "die britische Kampagne in Woche 46 hat funktioniert". Wann immer deine Daten gleichzeitig ein "wer" und ein "wann" haben und sich die "wer" auf Arten unterscheiden, die du nicht vollständig messen kannst, hast du ein Panel und solltest es als solches behandeln.
So führst du es durch
Du brauchst eine Zeile je Einheit und Periode, mit der abhängigen Variable, den Marketing Inputs derselben Periode, dem Preis und einem Kapazitätsmass. Zwölf Perioden und fünf Einheiten sind nahe am Minimum, das ich noch modellieren würde; acht Perioden und drei Einheiten sind ein Diagramm, keine Regression. Die Tabelle zu bauen ist ein Vormittag in SQL; die Within Transformation selbst ist eine Fensterfunktion, avg(x) over (partition by hotel), von jeder Spalte abgezogen. In Python ist die Dummy Version mit geclusterten Fehlern eine Handvoll Zeilen, und ich bevorzuge sie gegenüber der zentrierten Version, weil die Fixed Effects als benannte Koeffizienten herauskommen, die du der Eigentümerin geben kannst:
import pandas as pd
import statsmodels.formula.api as smf
df = pd.read_csv("seeblick_panel.csv") # eine Zeile je Hotel und Quartal
df["email_k"] = df["email_sends"] / 1000
df["social_k"] = df["paid_social_eur"] / 1000
df["rate10"] = df["avg_rate_eur"] / 10
fe = smf.ols(
"direct_nights ~ email_k + social_k + rate10 + C(hotel) + C(quarter)",
data=df,
).fit(cov_type="cluster", cov_kwds={"groups": df["hotel"]})
print(fe.summary())
df["resid"] = fe.resid # das Bergblick Diagramm ist diese Spalte
Wer R verwendet, greift zu fixest, dessen feols(y ~ x | hotel + quarter, cluster = ~hotel) die lesbarste Spezifikation eines zweiseitigen Fixed Effects Modells ist, die ich kenne.
Bevor ich dem Ergebnis vertraue, mache ich vier Prüfungen. Ich zeichne die Residuen je Einheit über die Zeit, so ist das Bergblick Muster überhaupt erst aufgetaucht. Ich vergleiche die Tabellen für Fixed und Random Effects und rechne die Hausman Statistik. Ich schätze das Modell neu mit den letzten zwei Perioden herausgehalten und prüfe, ob sich die Koeffizienten kaum bewegen. Und ich nehme die Marketingausgaben des nächsten Quartals als Regressor für die Buchungen dieses Quartals hinein: Wenn zukünftige Ausgaben aktuelle Buchungen vorhersagen, läuft die Kausalität rückwärts und das Marketingteam reagiert auf Buchungen, statt sie zu treiben. Von der sauberen Tabelle bis zum Entscheidungsmemo brauche ich für einen Kunden dieser Grösse etwa zwei Wochen, und der grösste Teil davon sind die Daten.
Fallstricke
Wenige Cluster. Geclusterte Standardfehler sind nur asymptotisch richtig, das heisst, sie verhalten sich mit 40 oder 50 Clustern gut und mit fünf schlecht. Bei wenigen Clustern berichte ich konventionelle, geclusterte und Wild Bootstrap Standardfehler, sage, welcher welcher ist, und lasse den breitesten jede Entscheidung treiben, die Geld kostet.
Zeitkonstante Variablen verschwinden. Fixed Effects saugen alles an einer Einheit auf, was sich nicht ändert, also kannst du den Effekt eines Seeblicks nicht schätzen, oder den Effekt, das Flaggschiff zu sein, oder den eines Mandanten, der seit dem ersten Tag im Enterprise Plan ist. Wenn das die Frage ist, sind Fixed Effects das falsche Werkzeug und du bist zurück im Querschnitt mit all seinen Störfaktoren.
Marketing, das auf Umsatz reagiert. Hotels geben für Paid Social aus, wenn die Buchungen schwach sind, und kürzen, wenn sie voll sind. Das erzeugt innerhalb eines Hotels eine negative Korrelation zwischen Ausgaben und Buchungen, die nichts mit der Wirkung der Ausgaben zu tun hat. Der Test mit den vorgezogenen Ausgaben oben fängt das Schlimmste ab, die Ausgaben um eine Periode zu verzögern hilft, und die richtige Lösung ist ein Experiment, Teil fünf dieser Serie. Fixed Effects entfernen die Verzerrung zwischen den Einheiten; gegen Verzerrung innerhalb einer Einheit über die Zeit tun sie nichts.
Gruppenkampagnen durch fünf geteilt. Wenn eine Markenkampagne läuft und die Buchhaltung die Kosten gleichmässig auf die Hotels verteilt, sind die "Ausgaben je Hotel" Fiktion und ihr Koeffizient bedeutungslos. Verwende Ausgaben, die tatsächlich auf die Einheit gerichtet waren, oder modelliere die Gruppenkampagne als Periodeneffekt.
Ein Niveau mit einem Trend verwechseln. Ein Hotel mit niedrigem Fixed Effect ist kleiner oder schlechter gelegen; ein Hotel mit negativen und wachsenden Residuen verändert sich. Bergblick hatte ein gewöhnliches Niveau und einen beunruhigenden Trend. Nur die Fixed Effects zu berichten hätte den Trend übersehen; nur Summen zu berichten hätte das Niveau falsch gelesen. Du brauchst beide Tabellen, und du brauchst genug Perioden: mit vier Quartalen fressen die Quartalseffekte alles und die Marketing Koeffizienten sind Rauschen. Drei Jahre Quartalsdaten sind ein brauchbares Minimum, und zwei Jahre Wochendaten schlagen fünf Jahre Jahresdaten.
So mache ich das für Kunden
Das Ergebnis ist eine Tabelle mit Koeffizienten, nach denen du handeln kannst, eine Tabelle mit Einheitseffekten, die du reihen kannst, und ein Residuendiagramm je Einheit, das dir sagt, wo du dieses Quartal hinschauen sollst. Dazu kommt ein einseitiges Entscheidungsmemo: die Zahl, ihre ehrlich angegebene Fehlermarge und das Risiko, falls die Zahl falsch ist. Für Seeblick stand im Memo sinngemäss: "Listenwachstum ist etwa 6.000 Euro je tausend Kontakte wert, Preiserhöhungen zahlen sich noch aus, aber mit einer Elastizität um minus 0,4, und Bergblick hat seit Jänner rund 90.000 Euro Direktumsatz gegenüber der eigenen Geschichte verloren; finde heraus warum, bevor du noch einen Euro in sein Marketing steckst."
Was ich von dir brauche, ist das Panel: eine Zeile je Einheit und Periode, was in der Regel Exporte aus der Buchungsmaschine oder dem Shop, dem Newsletter Tool, den Werbekonten und der Preisliste bedeutet. Wenn deine Systeme diese Tabelle nicht liefern können, ist das der erste Befund und oft der wertvollste; der Artikel über Datenrollen erklärt, wer in einem kleinen Unternehmen diese Leitung besitzen sollte.
Der erste Monat läuft so wie alle meine Engagements. Ein kostenloser Workshop, in dem wir herausfinden, ob du überhaupt ein Panel hast und was die eine Frage ist. Dann zwei Wochen echte Arbeit auf meine Rechnung: die Tabelle, die Modelle, die Prüfungen, das Memo, bevor du dich zu irgendetwas verpflichtest. Danach ist es entweder ein Data Science Projekt mit festem Umfang oder, wo die Antwort direkt in Budgetentscheidungen fliesst, ein Performance Marketing Mandat, das auf Provisionsbasis laufen kann. Du besitzt den Code, die Daten und das Modell; die Preisseite legt die Bedingungen in klarer Sprache dar. Eine verantwortliche Person, ehrliche Fehlerbalken, keine Eitelkeitskennzahlen.
Fragen an dein Team oder deine Agentur
- Wenn ihr berichtet, dass ein Kanal wirkt, ist das innerhalb der Einheiten über die Zeit, oder sind es vor allem die grossen Einheiten, die von allem mehr haben?
- Hat jede Einheit im Vergleich in beiden Perioden dieselbe Kapazität, und wer hat wann entschieden, welche Einheiten als vergleichbar gelten?
- Zeigt mir die Residuen je Einheit über die Zeit. Welche Einheit entfernt sich von ihrer eigenen Geschichte, und seit wann?
- Sind die Standardfehler nach Einheit geclustert, und wie viele Cluster gibt es?
- Habt ihr getestet, ob die Ausgaben der nächsten Periode den Umsatz dieser Periode vorhersagen?
- Welche unserer Fragen betreffen Unterschiede zwischen Einheiten, wo Fixed Effects nicht helfen, und welche Veränderungen innerhalb von Einheiten, wo sie es tun?
Diese Serie ist inspiriert von Mike Grigsbys Marketing Analytics (Kogan Page). Erklärungen, Beispiele und Zahlen hier sind meine eigenen.