Der grobe Ablauf steht schon auf der Startseite: Mythos sammeln, Daten erheben, statistisch prüfen, Verdikt vergeben. Hier die ausführliche Version, mit den Details, die uns beim Schreiben wichtig sind.
Der Analyseplan kommt zuerst
Bevor irgendjemand bei uns auch nur eine Zahl anschaut, legen wir schriftlich fest: die These, welche Kontrollvariablen wir einbeziehen, welche statistischen Tests wir planen. Das klingt bürokratisch, hat aber einen konkreten Zweck: Es schützt davor, die Analyse unbewusst so lange zu drehen, bis ein spannenderer Twist rauskommt. Wer erst die Daten anschaut und sich dann eine passende Methode aussucht, findet fast immer irgendein Muster, das nichts bedeutet.
Konkret sieht das so aus: Ein durchdachtes Notebook mit einer Markdown-Zelle ganz oben, in der Hypothese und geplante Tests festgehalten sind – bevor die erste Zeile Code auf die Ergebnisse schaut.
Das statistische Werkzeug
Je nach Frage kommt unterschiedliches Werkzeug zum Einsatz, aber ein paar Verfahren tauchen in den bisherigen Analysen immer wieder auf:
- Korrelation und Regression (Spearman, logistische Regression), um zu prüfen, ob ein Zusammenhang durch eine dritte, versteckte Variable erklärt wird – z. B. ob „mehr Ballbesitz hilft" in Wahrheit nur bedeutet „starke Teams haben mehr Ballbesitz UND gewinnen öfter".
- Welch-t-Test und Chi-Quadrat-Test, um zu prüfen, ob ein beobachteter Unterschied zwischen zwei Gruppen (z. B. Teams mit und ohne frühen Gegentreffer) statistisch echt ist oder auch Zufall sein könnte.
- Gepaarter t-Test und Wilcoxon-Vorzeichen-Rang-Test, für Vorher-Nachher-Vergleiche an denselben Teams – z. B. Punkte und Tabellenplatz von Bundesliga-Aufsteigern im ersten vs. zweiten Jahr nach dem Aufstieg. Der Wilcoxon-Test läuft dabei immer als Robustheits-Check mit: Er braucht keine Normalverteilung der Differenzen und bestätigt, dass ein Ergebnis nicht nur an ein paar Ausreißern hängt.
- Wilson-Konfidenzintervalle und Fisher's-Exact-Test, speziell für kleine Stichproben – bei nur 30 Bundesliga-Saisons (wie beim Herbstmeister-Mythos) braucht es robustere Methoden als bei tausenden Einzelspielen.
- Regression zur Mitte als Gegen-Check: Wirkt ein beobachteter „Einbruch" nach einer Fabel-Serie wirklich wie ein besonderer Effekt, oder würde man das bei jedem außergewöhnlich starken Team ohnehin erwarten?
- Cluster-robuste Standardfehler, wenn Beobachtungen nicht ganz unabhängig voneinander sind – etwa weil ein Verein im untersuchten Zeitraum mehrfach aufgestiegen ist (der 1. FC Köln allein sieben Mal seit 1996/97). Ohne Korrektur würde ein „Wiederholungstäter" das Ergebnis stärker prägen, als es eigentlich sollte; die Standardfehler werden deshalb pro Verein geclustert statt pro Einzelfall berechnet.
- Kaplan-Meier-Schätzer und Log-Rank-Test, für Fragen wie „wie schnell fällt typischerweise das nächste Tor" (Mythos „Zwei Tore sind schnell gefallen"): Ein Teil der Fälle ist rechtszensiert, weil ein Spiel endet, bevor das nächste Tor fällt – ein einfacher Mittelwert würde diese Fälle verzerren. Kaplan-Meier schätzt die „Überlebenswahrscheinlichkeit" (hier: wie lange eine Führung ohne weiteres Gegentor hält) trotzdem korrekt, der Log-Rank-Test prüft, ob sich zwei solcher Kurven statistisch unterscheiden.
- Mann-Whitney-U-Test, um zwei unabhängige Gruppen unterschiedlicher Größe zu vergleichen, ohne eine Normalverteilung vorauszusetzen – etwa Bundesliga- Meister (eine Handvoll Saisons) gegen den Rest der Liga beim Standardsituationen- Mythos. Das nichtparametrische Gegenstück zum Welch-t-Test für unverbundene Stichproben, so wie Wilcoxon das Gegenstück zum gepaarten t-Test für verbundene Stichproben ist.
- Stratifizierte Regression mit festen Effekten, um einen Gruppenvergleich exakt für eine Drittvariable zu kontrollieren, statt nur näherungsweise dafür zu adjustieren – etwa bei der Frage, ob ein Tor kurz vor der Halbzeitpause den weiteren Spielverlauf anders prägt als ein gleich hoher Halbzeitstand, der durch ein früheres Tor zustande kam: Jede Halbzeitstand-Kategorie (1:0, 2:1, ...) bekommt in der Regression einen eigenen festen Effekt, sodass der interessierende Koeffizient nur noch die Variation innerhalb desselben Halbzeitstands misst und nicht durch unterschiedlich verteilte Ausgangslagen zwischen den Gruppen verzerrt wird.
- Exakter Binomialtest und Zweistichproben-Test für Anteile, um zu prüfen, ob ein beobachteter Anteil in einer Teilgruppe vom bekannten Gesamt-Anteil abweicht – etwa beim Standardsituationen-Mythos: Ist ein Standardtor unter allen Eröffnungstoren bzw. spielentscheidenden Toren häufiger als im Liga-Durchschnitt (20,1 %)? Der exakte Binomialtest eignet sich für den Vergleich gegen einen festen Referenzwert, der Zweistichproben-Test für Anteile für den Vergleich zweier tatsächlich beobachteter Gruppen gegeneinander.
- Bootstrap-Konfidenzintervall und Permutationstest, als Doppel-Absicherung für Korrelationen, wenn die üblichen Annahmen (Normalverteilung, große Stichprobe) nicht sicher gelten – etwa bei der Frage, ob überdurchschnittliche Chancenverwertung von Saison zu Saison wiederkehrt. Der Bootstrap zieht tausendfach mit Zurücklegen aus den eigenen Daten und zeigt, wie stark der geschätzte Zusammenhang schwanken könnte; der Permutationstest mischt eine der beiden Variablen zufällig durch und prüft direkt, ob der beobachtete Zusammenhang stärker ist, als reiner Zufall erwarten lässt. Für die reine Signifikanzfrage ist der Permutationstest das robustere Verfahren, weil er ganz ohne Verteilungsannahme auskommt – der Bootstrap ergänzt ihn um eine Einschätzung, wie groß ein möglicher echter Effekt maximal plausibel wäre.
- Power-Analyse, um ein unauffälliges Ergebnis ehrlich einzuordnen: Ein nicht signifikanter Test ist kein Beweis für „kein Effekt" – entscheidend ist, wie klein ein Effekt sein müsste, damit die Stichprobe ihn zuverlässig übersehen würde. Wir berechnen deshalb, ab welcher Effektgröße wir mit 80 % Wahrscheinlichkeit überhaupt etwas gefunden hätten, und sagen offen, wenn ein kleiner echter Effekt dadurch nicht ausgeschlossen werden kann.
- Interaktionsterm in einer Regression, wenn die Frage nicht „gibt es einen Effekt" ist, sondern „ist der Effekt in einer Untergruppe anders stark als sonst" – etwa bei der Frage, ob Mainz 05 stärker oder schwächer von der Gegnerstärke abhängt als der Rest der Liga. Statt nur den Effekt innerhalb einer Gruppe zu schätzen, bekommt die Regression eine eigene Steigung für die interessierende Gruppe (hier: „ist Mainz" × Tabellenplatz-Abstand zum Gegner) neben der Steigung für alle anderen – der Interaktionskoeffizient zeigt direkt, ob und wie stark sich beide Steigungen unterscheiden, statt zwei getrennte Modelle informell nebeneinanderzulegen. Wichtige Nebenerkenntnis aus der Praxis: Cluster-robuste Standardfehler (siehe oben) können für einen Interaktionskoeffizienten irreführend klein ausfallen, wenn er nur innerhalb eines einzigen Clusters variiert (z. B. nur für den einen Verein, um den es geht) – in so einem Fall sind heteroskedastie-robuste oder nach der tatsächlichen Beobachtungseinheit geclusterte Standardfehler die verlässlichere Wahl.
- Regressionssteigung gegen einen Referenzwert testen, wenn nicht „gibt es überhaupt einen Zusammenhang" (Referenzwert 0) die eigentliche Frage ist, sondern „ist der Zusammenhang stärker oder schwächer als eine bestimmte, inhaltlich bedeutsame Marke" – etwa beim Mythos „Chancenverwertung ist Glückssache": Eine Steigung von genau 1 in der Regression von Tordifferenz auf xG-Differenz würde bedeuten, dass sich Prozessqualität eins zu eins in echte Tore übersetzt, ganz ohne zusätzlichen Stärke-Effekt beim Torabschluss. Wir prüfen deshalb, ob die geschätzte Steigung statistisch von 1 abweicht, nicht von 0 – derselbe t-Test wie sonst, nur mit dem inhaltlich passenden Referenzwert.
- Einstichproben-t-Test gegen einen festen Referenzwert, wenn nicht zwei Gruppen verglichen werden, sondern die Kennzahl eines einzelnen Teams über mehrere eigene Saisons hinweg gegen einen inhaltlich sinnvollen Fixwert – meist 0 – geprüft wird. Erstmals eingesetzt für Bayern Münchens durchschnittliche xG-Überperformance beim Chancenverwertungs-Mythos, später für dieselbe Frage bei Mainz 05: Weicht der Mittelwert einer Handvoll Saisonwerte überhaupt von 0 ab, oder ist eine beobachtete Über- bzw. Unterperformance bei so wenigen Beobachtungen (meist nur rund 12 Saisons) nicht von Zufall zu unterscheiden? Anders als beim gepaarten t-Test gibt es hier keine Vorher-Nachher-Struktur, sondern nur wiederholte Messungen derselben Einheit – bei so kleinen Stichproben ergänzen wir den Test deshalb konsequent um ein Bootstrap-Konfidenzintervall und eine Power-Analyse (siehe oben), damit ein nicht signifikantes Ergebnis nicht als „kein Effekt" missverstanden wird.
- Poisson-Raten-Regression und Zwei-Stichproben-Ratentest, für Fragen zu Ereignissen pro Zeiteinheit statt zu einer einzelnen Ja/Nein-Entscheidung – etwa beim Joker-Effekt-Mythos: Treffen eingewechselte Spieler pro 90 gespielte Minuten wirklich häufiger als die Startelf? Der Ratentest vergleicht zwei Torraten direkt und liefert ein Ratenverhältnis mit Konfidenzintervall statt nur einen p-Wert, die Poisson-Regression rechnet zusätzlich Kontrollvariablen wie Heimvorteil und Teamstärke heraus. Die unterschiedliche Einsatzzeit fließt dabei als „Exposure" (ein Offset-Term
log(Minuten/90)) direkt ins Modell ein, statt vorher grob auf eine gemeinsame Rate pro 90 Minuten umgerechnet zu werden – ein Kurzeinsatz von 5 Minuten bleibt dadurch korrekt ein unsichererer Datenpunkt als 90 durchgespielte Minuten.
Vom Verdikt zum Artikel
Sobald die Analyse steht, wird ein Verdikt festgelegt: Bestätigt, Teilweise bestätigt oder Widerlegt, zusammen mit den Kernzahlen. Das ist verbindlich – der Artikeltext erzählt diese Zahlen anschließend nur noch verständlich aus, darf aber weder das Verdikt noch eine einzige Zahl verändern. Erst danach folgt eine redaktionelle Prüfung auf Konsistenz, Ton und ob wirklich alles zum Verdikt passt.
Was wir bewusst nicht tun
Wir suchen nicht nach dem spektakulärsten Ergebnis, sondern nach dem ehrlichsten. Wenn eine Stichprobe klein ist, sagen wir das – auch wenn eine Zahl dadurch weniger eindrucksvoll wirkt. Wenn die perfekte Datenquelle nicht verfügbar ist, weichen wir transparent auf eine gute Ersatzgröße aus, statt ihr endlos hinterherzulaufen (mehr dazu auf der Datenbasis-Seite). Und wenn ein Mythos nach genauerem Hinsehen doch komplizierter ist, als der erste Blick vermuten ließ, ist genau das die eigentliche Geschichte, nicht ein Kompromiss.