Ein Leck mit perfekter Kalibrierung: Same-Day-Leakage in der Verspätungsprognose messen
Wird „wie läuft der Tag an diesem Flughafen“ über den ganzen Tag statt nur über die bereits vergangenen Stunden berechnet, steigt die PR-AUC um 21 % und der erwartete Kalibrierungsfehler fällt auf 0.00008, was jede Ergebnistabelle als 0.000 ausgibt. Gute Kalibrierung belegt keine saubere Pipeline.
Veröffentlichte Modelle zur Verspätungsprognose werden regelmäßig auf einer zufälligen Aufteilung evaluiert, mit historischen Merkmalen, die über den gesamten Datensatz berechnet wurden. Beides sind Lecks. Beim Bau von TransportPredictor habe ich gemessen, was das zweite wert ist, und festgestellt, dass sich sein deutlichstes Symptom hinter einer Kennzahl verbirgt, die üblicherweise als Entwarnung gelesen wird.
Aufbau, und warum es US-Flüge sind
Knapp ist in europäischen Luftfahrtdaten nicht die Menge, sondern die Zielgröße. Keine Quelle veröffentlicht tatsächliche Abflugzeiten je Flug für europäische Flughäfen zu den Bedingungen, die dieses Projekt akzeptiert: kein Konto, kein API-Schlüssel, kein Kontingent, keine Aufbewahrungsklausel. Das US-Verkehrsministerium veröffentlicht genau das, gemeinfrei, für jeden Inlandsflug.
Die Methode entsteht deshalb dort, wo die Grundwahrheit in dieser Größenordnung vorliegt. Methoden lassen sich zwischen Regionen übertragen, angepasste Modelle nicht, und nichts in diesem Text beschreibt Frankfurt oder irgendeinen europäischen Flughafen. Leakage ist eine Eigenschaft davon, wie ein Merkmal gegen eine Uhr berechnet wird, nicht eine Eigenschaft eines Landes. Genau deshalb lässt sich diese Frage auf dem Korpus beantworten, der sie beantworten kann.
5.834.764 US-Inlandsflüge ab 15 großen Drehkreuzen, Januar 2023 bis Dezember 2024. Zielgröße ist ein Abflug mit 15 Minuten Verspätung oder mehr; die Basisrate im Testzeitraum liegt bei 18,7 %. Die Prognose erfolgt zwei Stunden vor dem planmäßigen Abflug. Ein Merkmal ist also nur zulässig, wenn es zu diesem Zeitpunkt bereits beobachtbar war. Die Aufteilung ist chronologisch und überschneidungsfrei: Die letzten beiden Monate werden zurückgehalten.
Zwei Varianten desselben Merkmals
Der stärkste Einzelprädiktor ist die Verspätungsquote, die am Abflughafen im bisherigen Tagesverlauf beobachtet wurde. Dafür gibt es zwei Rechenwege:
- as-of: nur Flüge, die zum Prognosezeitpunkt tatsächlich abgeflogen waren;
- ganzer Tag: ein Group-by über den Kalendertag, einschließlich der Stunden, die noch gar nicht stattgefunden hatten.
Die zweite Variante ist kein Strohmann. Genau das liefert ein Group-by von Haus aus.
| Kodierung | PR-AUC | Brier-Skill | Kalibrierungsfehler |
|---|---|---|---|
| as-of | 0.287 | +0.015 | 0.050 |
| ganzer Tag | 0.348 | +0.072 | 0.00008 |
Das Leck ist +21,3 % PR-AUC wert und verfünffacht den Brier-Skill nahezu.
Entscheidend ist die letzte Zahl
Der erwartete Kalibrierungsfehler des undichten Merkmals beträgt 0.00008. Auf die drei Nachkommastellen gerundet, die eine Ergebnistabelle üblicherweise führt, steht dort 0.000, und in sechs der neun besetzten Zuverlässigkeitsklassen ist die Abweichung exakt null. Die as-of-Kodierung kommt auf 0.050, rund sechshundertfünfzigmal schlechter.
Ein Modell, das die Antwort gesehen hat, ist auf genau diesen Daten kalibriert, weil Vorhersage und Ergebnis innerhalb jeder Klasse dieselbe Größe sind. Kalibrierung gilt gemeinhin als Beleg dafür, dass eine Pipeline sauber ist. Hier ist sie der deutlichste verfügbare Hinweis darauf, dass sie es nicht ist.
Warum eine grobe Prüfung das übersieht
Derselbe Test auf einer streckenbezogenen Verspätungsquote verschiebt die PR-AUC von 0.219 auf 0.223, ein Zuwachs von 1,7 %. Streckenbezogene Quoten sind über Monate stabil, ein Blick in die Zukunft verbessert die Schätzung daher kaum. Wer Leakage nur an einer groben, träge veränderlichen Gruppierung prüft, kommt zu dem Schluss, seine Pipeline sei sauber.
Was hier nicht behauptet wird
Nichts davon besagt, dass das as-of-Modell gut ist. Mit 0.287 gegenüber einer Basisrate von 0.187 ist es ein moderates Signal, und mehr geben zwei Stunden Vorlauf nicht her. Die Aussage betrifft ausschließlich die Größe des Abstands zwischen beiden Kodierungen und die Frage, wo er sich versteckt.
Der Rest der Arbeit
Diese Messung stammt aus einem größeren Projekt, dessen übriger Teil als Dashboard veröffentlicht ist. Es hält dieselbe Grenze ein und benennt sie auf jeder Seite: Frankfurt und 31 weitere europäische Flughäfen sind über die veröffentlichte Tagesreihe von EUROCONTROL abgedeckt, während das Modell je Flug das oben beschriebene amerikanische ist. Das Dashboard zeigt also Frankfurts tägliche Pünktlichkeit seit 2022, diese 32 Flughäfen im Ranking vor und nach Herausrechnen des netzweiten Tageseffekts, sowie eine Model Card mit einer nummerierten Liste dessen, was das Modell nicht aussagt, beginnend damit, dass es keinen europäischen Flughafen beschreibt.
Alles dahinter sind offene Massendaten. Kein Konto, kein API-Schlüssel, kein Kontingent, und jede Zahl ist auf den Commit zurückführbar, der sie erzeugt hat.