Evaluation planen
GraphRAG evaluieren: Retrieval vor Antwort
Antwortqualität allein verdeckt Fehler; getrennte Metriken für Entitäten, Kanten, Retrieval, Belege und Antwort sind aussagekräftiger.
Goldset nach Fragetyp bauen
Ein Goldset enthält reale Fragen, akzeptable Antworten, relevante Passagen und zulässiges Nichtwissen. Mindestens zwei Prüfer klären strittige Fälle und versionieren Änderungen.
Extraktion vor Retrieval messen
Entitäten und Kanten werden gegen markierte Spans geprüft. Danach misst Retrieval, ob relevante Belege in den Kandidaten liegen; erst zuletzt wird die Antwort bewertet.
Zitate als eigene Ebene prüfen
Ein vorhandenes Zitat genügt nicht. Es muss den konkreten Satz tragen, erreichbar sein und aus der indexierten Version stammen.
Regressionen lokalisieren
Jeder Lauf speichert Corpus-Hash, Pipelineversion, Parameter und Ergebnisse pro Frage. Differenzen werden nach Stufe gruppiert, statt nur einen Gesamtscore zu vergleichen.
Goldset-Eintrag mit Sollbelegen
Die Antwort darf bei fehlendem Beleg ausdrücklich offen bleiben.
question_id: q-044
type: global
question: Welche Regionen melden Lieferstopps?
gold_evidence: [d12#p3, d19#p8]
allowed_answer: [Nord, West]
unknown_allowed: false
reviewers: [r1, r2]Eigenständiges Prüfartefakt ohne erfundene Messwerte oder Anbieterwertung.
Entscheidungsregel
Lege ein manuell geprüftes, versioniertes Testset an.
Quellen zu diesem Beitrag
Primärquellen auf Artikelebene, geprüft am 18.09.2026.
- RAGAS paper
Forschungsarbeit zu RAG-Evaluationsdimensionen. - Microsoft GraphRAG evaluation
Offizielle Query-Dokumentation als Systembezug.