Der Spruch
Die Uhr steht auf 44 Minuten, die Anzeigetafel zeigt schon Nachspielzeit, und dann fällt es doch noch ein Tor. Der TV-Experte in der Halbzeitanalyse ist sich sofort sicher: genau der richtige Moment. Ein Tor kurz vor der Pause soll besonders schwer wiegen, es begleitet die unterlegene Mannschaft direkt in die Kabine, raubt der Halbzeitansprache ihre Wirkung, sitzt tiefer als ein Tor mitten im Spiel. Der Trainer der führenden Mannschaft nickt zufrieden: mit Rückenwind in die Pause, das nimmt der Gegner mit.
Ein Paradebeispiel dafür liefert ausgerechnet das Spiel, während dieser Artikel entsteht: Am 12. September 2026 verschießt Mainz' Nadiem Amiri in der 43. Minute gegen Eintracht Frankfurt einen Elfmeter zum möglichen 1:1. Nur zwei Minuten später, in der Nachspielzeit der ersten Halbzeit (45.+1), erhöht ausgerechnet der Ex-Mainzer Jonathan Burkardt auf 2:0 – genau die Art von Doppelschlag, der sich wie ein psychologischer K.-o. anfühlt, verschossen kurz vor der Kabine und direkt danach kassiert. Mainz verliert am Ende 1:3.
Klingt nach handfester Sportpsychologie, direkt aus dem Lehrbuch. Wir wollten wissen, ob davon im tatsächlichen Spielverlauf danach auch nur irgendetwas ankommt.
Die Datenbasis
Zwölf komplette Bundesliga-Saisons, 2014/15 bis 2025/26, 3.672 Spiele. Als Quelle dienen Understat (Schuss- und xG-Daten je Halbzeit) und OpenLigaDB (offizielle Torminuten samt Nachspielzeit- und Elfmeter-Flag). Für die Gruppeneinteilung reicht die rohe Minute allein nicht: Understats Minutenzähler läuft beim Wiederanpfiff der zweiten Halbzeit einfach weiter, ohne neu bei null zu starten. Ein Tor in der Nachspielzeit der ersten Halbzeit und ein früher Treffer nach dem Seitenwechsel können deshalb dieselbe rohe Minutenzahl tragen. Erst OpenLigaDBs eigenes Nachspielzeit-Flag macht die Zuordnung sauber möglich.
Damit ergeben sich drei Gruppen:
- Gruppe A (spät): Das letzte Tor der 1. Halbzeit fällt zwischen Minute 41 und 45 oder in der Nachspielzeit – 718 Spiele.
- Gruppe B (früh): Das letzte Tor der 1. Halbzeit fällt zwischen Minute 1 und 40 – 2.019 Spiele.
- Gruppe C (Vergleichsgruppe): Das erste Tor der 2. Halbzeit fällt kurz nach dem Wiederanpfiff, Minute 46 bis 50 – 518 Spiele. Sie dient dazu, einen reinen Timing-Effekt von einem Pausen-spezifischen psychologischen Effekt zu unterscheiden: Wirkt ein spätes Tor besonders, weil es kurz vor irgendeinem Ereignis fällt, oder speziell, weil danach die Kabine wartet?
Erster Blick: Ist da überhaupt was dran?
Der naheliegendste Test: Wie unterscheidet sich die zweite Halbzeit, wenn man einfach alle Gruppe-A-Spiele mit allen Gruppe-B-Spielen vergleicht?
| Gruppe A (spät, Tor Min. 41–45+) | Gruppe B (früh, Tor Min. 1–40) | |
|---|---|---|
| Spiele | 718 | 2.019 |
| Ø Tordifferenz 2. Halbzeit | 0,170 | 0,132 |
| Ø Punkte zum Spielende | 2,11 | 2,13 |
| Sieg-Quote | 63,9 % | 64,2 % |
Auf den ersten Blick sieht das sogar nach der erwarteten Richtung aus: Teams mit spätem Tor holen im Schnitt einen minimal höheren Tordifferenz-Wert in Halbzeit zwei. Nur ist der Unterschied winzig, und die Punkte- und Sieg-Quote-Werte zeigen in die exakt andere Richtung. Ein Welch-t-Test auf die Tordifferenz kommt auf p = 0,54, bei den Punkten auf p = 0,72.
Kurz erklärt — p-Wert
Kurz erklärt — p-Wert: Die Wahrscheinlichkeit, ein mindestens so großes Ergebnis rein zufällig zu beobachten, wenn es in Wirklichkeit gar keinen Unterschied gibt. Ab p < 0,05 gilt ein Befund üblicherweise als statistisch signifikant, sprich: vermutlich kein Zufall. Bei p = 0,54 oder p = 0,72 ist man von dieser Schwelle meilenweit entfernt – die Daten liefern schlicht keinen Hinweis auf einen echten Unterschied.
Die dazugehörige Effektstärke ist genauso ernüchternd: Cohens d = 0,026 bei der Tordifferenz.
Kurz erklärt — Cohens d
Kurz erklärt — Cohens d: Ein Maß dafür, wie groß ein Unterschied zwischen zwei Gruppen wirklich ist, unabhängig von der Stichprobengröße. Als Faustregel gilt: ab 0,2 ein kleiner Effekt, ab 0,5 ein mittlerer, ab 0,8 ein großer. Ein Wert von 0,026 liegt so nah an null, dass praktisch kein messbarer Unterschied übrig bleibt.
Schon der naive Blick spricht also gegen den Mythos. Aber ein naiver Vergleich hat hier ein methodisches Problem, das erst auffällt, wenn man genauer hinschaut.
Der Haken: Warum ein einfacher Vergleich hier zu kurz greift
Gruppe A (spät) Gruppe B (früh)
Halbzeitstand aus Sicht des Torschützen-Teams, 8 häufigste Kategorien + „Sonstige“ (13 weitere, seltene Kategorien zusammengefasst).
Der Grund dafür ist rein mechanisch, nicht psychologisch: Wenn in einer Halbzeit insgesamt mehr Tore fallen, ist statistisch wahrscheinlicher, dass das letzte davon auch spät fällt – schlicht, weil mehr Tore mehr Gelegenheiten für ein spätes Tor bedeuten. Gruppe A enthält deshalb überproportional viele Spiele mit hohem Halbzeitstand (2:0, 2:1, 3:0), während Gruppe B von der simplen 1:0-Führung dominiert wird. Vergleicht man beide Gruppen ungefiltert, vergleicht man also nicht nur "spätes Tor vs. frühes Tor", sondern nebenbei auch "wilderes Spiel vs. ruhigeres Spiel". Um das sauber herauszurechnen, braucht es einen Vergleich innerhalb identischer Ausgangslagen.
Kurz erklärt — Stratifizierung (feste Effekte je Halbzeitstand)
Kurz erklärt — Stratifizierung (feste Effekte je Halbzeitstand): Statt alle Spiele beider Gruppen pauschal zu mitteln, wird jedes Spiel nur mit Spielen aus der jeweils anderen Gruppe verglichen, die zur Halbzeit exakt denselben Spielstand hatten – ein 1:1 mit spätem Tor also nur mit einem 1:1 mit frühem Tor, ein 2:0 nur mit einem 2:0. So bleibt sichergestellt, dass ein gemessener Unterschied wirklich am Zeitpunkt des Tores liegt und nicht an unterschiedlich torreichen Halbzeiten.
Praktisch gut machbar ist das hier: 714 der 718 Gruppe-A-Spiele (99,4 %) haben einen Halbzeitstand, der auch mindestens einmal in Gruppe B vorkommt. Nach dem Zusammenführen bleiben 16 gemeinsame Halbzeitstand-Kategorien und 2.732 gematchte Spiele übrig, für die ein direkter Vergleich bei gleicher Ausgangslage möglich ist.
Der Kern-Test: gleicher Halbzeitstand, gleiche Bedingungen
Zusätzlich zur Stratifizierung nach Halbzeitstand wird noch für Heimvorteil und eine grobe Teamstärke kontrolliert (mittlere Saison-Tordifferenz beider Mannschaften). Das Ergebnis:
| Modell | Koeffizient „spätes Tor" | p-Wert |
|---|---|---|
| Naiv (unstratifiziert) | 0,039 Tore | 0,54 |
| Stratifiziert nach Halbzeitstand | 0,020 Tore | 0,76 |
| Stratifiziert + Heimvorteil + Teamstärke | 0,021 Tore | 0,73 |
Lineare Regression auf die Tordifferenz der zweiten Halbzeit (Koeffizient für ein spätes Tor), drei Varianten: naiv, stratifiziert nach Halbzeitstand, und zusätzlich kontrolliert für Heimvorteil und Teamstärke. n = 2.732 gematchte Spiele (5 wegen nicht gematchter Halbzeitstände ausgeschlossen).
Das ist methodisch der interessanteste Moment der ganzen Analyse: Die Stratifizierung ändert den Punktschätzer tatsächlich spürbar, der naive Effekt war also teils ein Artefakt der unterschiedlichen Halbzeitstände. Nur bleibt am Ende von "klein" eben "noch kleiner" übrig, kein Vorzeichenwechsel wie bei anderen bisher untersuchten Mythen. Bei den Punkten sieht es genauso aus (Koeffizient 0,043, p = 0,34), bei der Sieg-Wahrscheinlichkeit ebenfalls (p = 0,33). Und das Ergebnis ist robust: Schließt man Eigentore (11 von 718 Fällen in Gruppe A) oder Elfmetertore (62 von 718) als letztes Tor der ersten Halbzeit aus, bleibt der Koeffizient zwischen 0,008 und 0,021, weiterhin mit p über 0,7.
Ist das nur zu wenig Stichprobe?
Ein berechtigter Einwand an dieser Stelle: Vielleicht gibt es den Effekt ja wirklich, nur ist die Stichprobe zu klein, um ihn zu entdecken. Genau dafür gibt es ein eigenes Werkzeug.
Power-Analyse für α = 0.05, Ziel-Power 80 %, n = 718 (Gruppe A) vs. 2.019 (Gruppe B) Spiele.
Kurz erklärt — Statistische Power
Kurz erklärt — Statistische Power: Die Wahrscheinlichkeit, einen tatsächlich vorhandenen Effekt in einer Stichprobe auch zu entdecken, statt ihn fälschlich als "kein Unterschied" einzustufen. Üblich ist eine Zielgröße von 80 Prozent. Reicht die Power nicht, kann ein Nullbefund einfach heißen "die Stichprobe war zu klein, um es zu sehen" – nicht "es gibt wirklich keinen Effekt".
Hier ist genau das Gegenteil der Fall. Mit 718 gegenüber 2.019 Spielen hätte der Test selbst einen kleinen, in der Praxis noch relevanten Effekt (Cohens d ab 0,12) mit 80 Prozent Wahrscheinlichkeit aufgedeckt. Der tatsächlich gemessene Effekt liegt mit d = 0,026 weit unter dieser Schwelle. Der Nullbefund ist also kein Ergebnis von "zu wenig Daten", sondern ein echter Nullbefund.
Liegt es an der Pause selbst?
Bleibt noch eine Frage offen: Vielleicht ist gar nicht das "kurz vor" entscheidend, sondern irgendetwas rund um die Pause allgemein. Dafür dient Gruppe C – Spiele mit einem Tor kurz nach dem Wiederanpfiff, Minute 46 bis 50.
Naiv: t = 0,35, p = 0,73. Kontrolliert für Halbzeitstand, Heimvorteil und Teamstärke: Koeffizient 0,040, p = 0,59.
Naiv verglichen liegt Gruppe A (0,170) sogar leicht vor Gruppe C (0,141), aber wieder ohne jede statistische Substanz (p = 0,73). Kontrolliert man erneut für Halbzeitstand, Heimvorteil und Teamstärke, bleibt der Koeffizient bei 0,040 mit p = 0,59. Spricht ziemlich klar gegen einen Pausen-spezifischen psychologischen Zusatzeffekt: Ein Tor kurz vor der Halbzeit wirkt nicht anders nach als eines kurz danach.
Die Anekdoten: Auch die dramatischsten Einzelfälle zeigen nichts Besonderes
Ein Extremfall aus dem Datensatz illustriert das gut. Union Berlin gegen Wolfsburg, 10. Februar 2024: Wegen Fanprotesten mit Tennisbällen auf dem Platz kam es zur längsten Nachspielzeit im gesamten Datensatz. Deniz Doekhis Tor fiel real erst in der 45.+25. Minute, also fast eine Viertelstunde später als jedes andere "späte" Tor im Sample. Wenn ein Tor kurz vor der Halbzeit psychologisch besonders schwer wiegt, dann müsste ausgerechnet dieses Tor der Beweis dafür sein. Ist es nicht: Union brachte die 1:0-Führung stinknormal über die Zeit, Endstand 1:0. Selbst der extremste denkbare Fall erzwingt kein Sonderergebnis.
Umgekehrt lohnt ein Blick auf die 36 Fälle in Gruppe A, in denen eine durch das späte Tor hergestellte Halbzeitführung am Ende doch noch komplett verspielt wurde – etwa Freiburg gegen Bayer Leverkusen am 16. September 2023, als Freiburg mit einer 2:1-Führung in die Pause ging und am Ende 2:4 verlor. Ein "psychologisch besonders wichtiges" spätes Tor ist offenbar keine Ergebnis-Garantie.
Das Mainz-Frankfurt-Beispiel aus der Einleitung passt in dasselbe Bild, nur auf eine andere Art: Ob der verschossene Elfmeter und Burkardts Tor tatsächlich am Timing lagen oder einfach am ohnehin schon unterlegenen Spielverlauf, lässt sich im Einzelfall nie beweisen, und dieses eine Spiel liegt ohnehin außerhalb des ausgewerteten Zwölf-Jahres-Zeitraums. Aber es zeigt gut, wie leicht sich aus einem einzelnen dramatischen Moment eine Geschichte erzählen lässt, die sich in den aggregierten Daten oben nicht wiederfindet.
Rein explorativ (also nicht Teil des vorab festgelegten Testplans) haben wir noch geprüft, wie oft eine solche Führung überhaupt kollabiert:
36 von 505 Führungen in Gruppe A verspielt, 145 von 1618 in Gruppe B. Fisher-Exact-Test: p = 0,24.
Von 505 Fällen in Gruppe A, in denen das späte Tor überhaupt eine Halbzeitführung herstellte, gingen 36 (7,1 %) am Ende doch noch verloren. In Gruppe B waren es 145 von 1.618 (9,0 %). Ein Fisher-Exact-Test kommt auf p = 0,235 – kein signifikanter Unterschied.
Kurz erklärt — Fisher-Exact-Test
Kurz erklärt — Fisher-Exact-Test: Ein Signifikanztest für kleine 2×2-Tabellen (hier: Führung verspielt ja/nein, Gruppe A/B), der auch bei überschaubaren Fallzahlen exakte statt nur angenäherte p-Werte liefert.
Die Richtung passt zwar zufällig zur Mythos-Erwartung – wer spät trifft, hält die Führung minimal öfter. Aber bei p = 0,235 ist das reines Rauschen, keine belastbare Aussage. Explizit dazugesagt, weil solche Zahlen in Artikeln gerne aus dem Zusammenhang gerissen werden: Diese eine Zahl beweist nichts, sie illustriert nur.
Verdikt
Widerlegt. In keiner der drei getesteten Kennzahlen (Tordifferenz, Punkte und Sieg-Wahrscheinlichkeit in der zweiten Halbzeit) zeigt sich ein statistisch von Null unterscheidbarer Effekt – weder im naiven Vergleich noch nach Stratifizierung nach identischem Halbzeitstand und Kontrolle für Heimvorteil und Teamstärke. Auch der Vergleich mit einem Tor kurz nach statt vor der Pause zeigt keinen Unterschied. Die Stichprobe war groß genug, um selbst einen kleinen Effekt zu entdecken – der Nullbefund ist also kein Stichprobengrößen-Problem, sondern ein echtes Ergebnis. Ein Tor kurz vor der Halbzeit fühlt sich möglicherweise wichtiger an. Im tatsächlichen Spielverlauf danach zeigt es sich einfach nicht.
Diskussion
Kommentare werden geladen …