AM.
Forschung

Eine Containment-Metrik ohne Untergrenze: ein Audit des Retrieval-Scorings in GraphRAG

Ein Null-Retriever, der nur Entitätsnamen zurückgibt, erreicht unter Containment-Scoring 100 % Fakten-Recall. Warum dieser Metrik der Boden fehlt, und ein Channel-Gating-Fix, der ehrliche Systeme nichts kostet.

Ahmed Maaloul Forschung 2 Min. Lesezeit

Retrieval-augmentierte Systeme auf Basis von Wissensgraphen werden häufig mit einer Containment-Regel evaluiert: Eine Gold-Passage gilt als gefunden, sobald der Kontext die Oberflächenform einer daraus extrahierten Entität enthält. Beim Bau von Synapse bin ich auf eine Eigenschaft dieser Regel gestoßen, die niemand in einer Metrik haben will: sie hat keine Untergrenze.

Das Null-Kontroll-Ergebnis

Am saubersten zeigt das ein Retriever, der seine Aufgabe unmöglich erfüllen kann. Auf einem internen Multi-Hop-Benchmark mit 14 Fragen habe ich einen Null-Retriever bewertet, der nichts als das alphabetische Entitätsvokabular des Graphen zurückgibt. Keine Beschreibungen, keine Kanten, keine Prosa, und keine Möglichkeit, irgendeine Frage zu beantworten.

Unter Containment-Scoring erreicht er 100 % Fakten-Recall. Unter einer prosa-basierten Regel, die einen Fakt nur anrechnet, wenn der Kontext tatsächliche Evidenz dafür enthält, erreicht derselbe Retriever 0 %.

Es repliziert, und es ist nicht der Bug eines einzelnen Systems

Derselbe Mechanismus zeigt sich auf HotpotQA (n = 50). Dessen Both-gold-Regel rechnet eine Frage nur dann an, wenn beide zugehörigen Gold-Absätze gefunden wurden; ein Graph-only-Retriever erreicht darauf unter Containment 100 % und 0 % unter Prosa-Grounding, wobei 93 % seiner angerechneten Treffer aus Entitätsnamen-Blöcken stammen statt aus abgerufener Evidenz.

Um eine Implementierungs-Eigenheit auszuschließen, habe ich dieselbe Null-Kontrolle gegen ein zweites, unabhängig entwickeltes GraphRAG-System laufen lassen, LightRAG. Gleiches Bild: Ein Retriever ohne jede Evidenz erreicht 100 % unter Containment und 0 % unter Prosa-Grounding. Die Inflation ist eine Eigenschaft der Metrik, nicht einer Codebasis.

Was ehrliches Scoring übrig lässt

Unter prosa-basiertem Scoring ist der Vorteil des Wissensgraphen real, aber budgetneutral: Eine einfache Passagen-Baseline erreicht dasselbe Ergebnis und liest dabei 45 % des Kontexts. Das ist eine bescheidenere Aussage, als die meisten GraphRAG-Evaluationen treffen, und ich halte sie für die zutreffende in Setups wie diesem.

Der Fix

Das Paper schlägt Channel-Gated-Scoring vor: Eine Entität wird nur angerechnet, wenn sie über einen Kanal ankommt, der Evidenz tragen kann. Das kostet prosa-tragende Systeme nichts und beseitigt den freien Boden vollständig. Das Null-Kontroll-Protokoll ist mit dem Code veröffentlicht, sodass sich dasselbe Audit gegen jede eigene Retrieval-Eval fahren lässt, bevor man ihren Zahlen vertraut.

Wer ein GraphRAG-System mit Recall-artigen Metriken evaluiert, hat mit einer Null-Kontrolle den günstigsten Sanity-Check überhaupt: Wenn ein Retriever, der nur Entitätsnamen zurückgibt, punkten kann, misst die Metrik Vokabular, nicht Retrieval.