ContextualRecallScorer
Misst den Recall des abgerufenen Kontexts anhand des Anteils erfolgreich abgerufener relevanter Informationen. Hilft, Lücken in der Retrieval-Abdeckung zu erkennen.
Übersicht
Misst den Recall des abgerufenen Kontexts anhand des Anteils erfolgreich abgerufener relevanter Informationen. Hilft, Lücken in der Retrieval-Abdeckung zu erkennen.
Anwendungsfälle
- RAG-basierte Frage-Antwort-Systeme
Funktionsweise
Dieser Scorer evaluiert Antworten mit LLM-as-Judge-Technologie. Ein großes Sprachmodell erhält konkrete Evaluierungskriterien und die zu bewertenden Inhalte. Anschließend wird sein Urteil analysiert, um einen Score und eine ausführliche Begründung zu erzeugen.
Eingabeschema
| Parameter | Typ | Erforderlich | Beschreibung |
|---|---|---|---|
| output_text | str | Ja | The generated answer |
| input_text | str | Ja | The original query |
| context | dict | list[str] | Ja | Retrieved chunks |
| expected_output | str | Nein | Ground truth (helps estimate coverage) |
Ausgabeschema
| Feld | Typ | Beschreibung |
|---|---|---|
| score | float | Recall score (0-10) |
| passed | bool | True if recall acceptable |
| reasoning | str | Coverage analysis |
| metadata.estimated_total_relevant | int | Estimated relevant info |
Score-Interpretation
Standardschwellenwert: 7/10
Verwandte Scorer
ContextualPrecisionScorer
Misst die Precision des abgerufenen Kontexts anhand des Anteils der Chunks, die tatsächlich zur Bean...
RAGRAGASScorer
Implementiert den RAGAS-Rahmen (Retrieval Augmented Generation Assessment) für eine umfassende RAG-B...
RAGContextualRecallScorerPP
Berechnet den Recall abgerufener Chunks anhand einer Schätzung aller verfügbaren relevanten Chunks. ...
RAGContextualPrecisionScorerPP
Berechnet die Precision abgerufener Chunks anhand numerischer Relevanzwerte. Precision = Anzahl der ...
Häufig gestellte Fragen
Wann sollte ich diesen Scorer verwenden?
Verwenden Sie ContextualRecallScorer, wenn Sie die Aspekte rag and llm-judge Ihrer KI-Ausgaben evaluieren möchten. Der Scorer eignet sich besonders für rag-basierte frage-antwort-systeme.
Warum benötigt dieser Scorer keine erwartete Ausgabe?
Dieser Scorer evaluiert Qualitätsaspekte, für die kein Vergleich mit einer Referenzantwort erforderlich ist. System-Prompt und Kontext dienen als implizite Ground Truth.
Kann ich den Schwellenwert anpassen?
Ja, der Standardschwellenwert von 7 lässt sich bei der Konfiguration des Scorers anpassen.
Kurzinfo
Möchten Sie ContextualRecallScorer ausprobieren?
Starten Sie die Evaluierung Ihrer KI-Agenten mit der umfassenden Scorer-Bibliothek von Noveum.ai.
Weitere Scorer entdecken
Entdecken Sie 112 kalibrierte LLM-as-Judge-Scorer für umfassende KI-Evaluierungen
