Datenbasis

Jede Analyse auf dieser Seite steht und fällt mit den Daten dahinter. Deshalb hier offen, woher die Zahlen kommen, wie wir sie erheben und wo sie an ihre Grenzen stoßen – die ausführliche Version steht außerdem am Ende jedes einzelnen Artikels im Abschnitt „Quellen & Methodik".

Die Quellen im Überblick

Für die Bundesliga gibt es keine einzelne Quelle, die alles liefert. Deshalb kombinieren wir je nach Fragestellung mehrere:

Für den technischen Zugriff nutzen wir meistens das Python-Paket soccerdata, das mehrere dieser Quellen bündelt und automatisch rate-limitiert. Wo dessen Wrapper an alten Datenständen scheitert (ist uns bei sehr frühen Bundesliga-Saisons passiert), greifen wir direkt auf die Rohdaten zu und dokumentieren das transparent im jeweiligen Artikel.

Wie wir Daten erheben

Kein Live-Scraping während jemand die Seite besucht. Für jede Analyse holen wir die nötigen Daten einmalig (oder bei Bedarf erneut) offline ab, prüfen sie, und speichern sie lokal und versioniert. Die eigentliche Website greift dann nur noch auf diese aufbereiteten, bereits geprüften Datensätze zu – das macht die Analysen reproduzierbar und unabhängig davon, ob eine Quelle gerade erreichbar ist.

Cross-Validierung: Wir glauben keiner Quelle blind

Wo möglich, prüfen wir eine Quelle gegen eine zweite, unabhängige. Ein paar Beispiele aus den bisherigen Analysen:

Wenn wir bei diesen Abgleichen einen Fehler in unserer eigenen Verarbeitung gefunden haben (kam schon vor), wird er korrigiert, bevor ein Artikel online geht – nicht danach.

Wo Daten an ihre Grenzen stoßen

Ehrlich gesagt: öfter, als uns lieb ist. FBref-xG ließ sich für Mythos 1 wegen instabilem Bot-Schutz nicht zuverlässig abrufen, wir sind stattdessen auf die tatsächliche Tordifferenz als Ersatzgröße ausgewichen und haben das im Artikel offengelegt. OpenLigaDB deckt die Bundesliga erst zuverlässig ab 2004/05 ab, für ältere Saisons braucht es zusätzlich football-data.co.uk mit eigenen Einschränkungen (z. B. keine offizielle Spieltag-Nummer, die wir dann rekonstruieren mussten). Unser Anspruch ist dabei nicht, auf die perfekte Quelle zu warten, sondern mit der bestmöglichen verfügbaren Näherung zu arbeiten und jede Einschränkung offen zu benennen, statt sie zu verschweigen.

Mehr Details

Jeder Artikel endet mit einem eigenen „Quellen & Methodik"-Abschnitt mit den konkreten Abrufdaten, Einschränkungen und einem Link zum vollständigen, nachvollziehbaren Analyse-Notebook. Dort steht jeder Zwischenschritt, nicht nur das Endergebnis. Wie wir aus diesen Daten am Ende ein Verdikt ableiten (Statistik, Kontrollvariablen, Tests), steht ausführlich auf der Methodik-Seite.