Forschung
Publikationen und Notizen, aus den Systemen, die ich baue.
Forschungs- und Engineering-Notizen zu Retrieval, Evaluierung und den Systemen, die KI in Produktion genau halten.
Per RSS abonnieren- Benchmark 4 Min. Lesezeit Ein Leck mit perfekter Kalibrierung: Same-Day-Leakage in der Verspätungsprognose messen Wird „wie läuft der Tag an diesem Flughafen“ über den ganzen Tag statt nur über die bereits vergangenen Stunden berechnet, steigt die PR-AUC um 21 % und der erwartete Kalibrierungsfehler fällt auf 0.00008, was jede Ergebnistabelle als 0.000 ausgibt. Gute Kalibrierung belegt keine saubere Pipeline.
- Forschung 2 Min. Lesezeit Eine Containment-Metrik ohne Untergrenze: ein Audit des Retrieval-Scorings in GraphRAG Ein Null-Retriever, der nur Entitätsnamen zurückgibt, erreicht unter Containment-Scoring 100 % Fakten-Recall. Warum dieser Metrik der Boden fehlt, und ein Channel-Gating-Fix, der ehrliche Systeme nichts kostet.
- Benchmark 2 Min. Lesezeit GraphRAG-Retrieval in Synapse messen Acht paraphrasierte Anfragen gegen eine geseedete Neo4j-Fixture: Hit@1 88 %, MRR 0.92. Was Synapses Eval-Harness misst, und was es bewusst nicht behauptet.