hypergraphs.de

Evaluation planen

GraphRAG evaluieren: Retrieval vor Antwort

Antwortqualität allein verdeckt Fehler; getrennte Metriken für Entitäten, Kanten, Retrieval, Belege und Antwort sind aussagekräftiger.

Redaktion Hypergraphs.deFachprüfung: 18.09.2026TechArticle

Goldset nach Fragetyp bauen

Ein Goldset enthält reale Fragen, akzeptable Antworten, relevante Passagen und zulässiges Nichtwissen. Mindestens zwei Prüfer klären strittige Fälle und versionieren Änderungen.

Extraktion vor Retrieval messen

Entitäten und Kanten werden gegen markierte Spans geprüft. Danach misst Retrieval, ob relevante Belege in den Kandidaten liegen; erst zuletzt wird die Antwort bewertet.

Zitate als eigene Ebene prüfen

Ein vorhandenes Zitat genügt nicht. Es muss den konkreten Satz tragen, erreichbar sein und aus der indexierten Version stammen.

Regressionen lokalisieren

Jeder Lauf speichert Corpus-Hash, Pipelineversion, Parameter und Ergebnisse pro Frage. Differenzen werden nach Stufe gruppiert, statt nur einen Gesamtscore zu vergleichen.

Goldset-Eintrag mit Sollbelegen

Die Antwort darf bei fehlendem Beleg ausdrücklich offen bleiben.

question_id: q-044
type: global
question: Welche Regionen melden Lieferstopps?
gold_evidence: [d12#p3, d19#p8]
allowed_answer: [Nord, West]
unknown_allowed: false
reviewers: [r1, r2]

Eigenständiges Prüfartefakt ohne erfundene Messwerte oder Anbieterwertung.

Entscheidungsregel

Lege ein manuell geprüftes, versioniertes Testset an.

Quellen zu diesem Beitrag

Primärquellen auf Artikelebene, geprüft am 18.09.2026.

Im GraphRAG-Pfad weiterlesen