RetrievalRankingScorer
Berechnet Ranking-Metriken für abgerufenen Kontext, darunter MRR (Mean Reciprocal Rank), NDCG und MAP. Bewertet, wie gut das Retrieval-System relevante Dokumente vor irrelevanten einordnet.
Übersicht
Berechnet Ranking-Metriken für abgerufenen Kontext, darunter MRR (Mean Reciprocal Rank), NDCG und MAP. Bewertet, wie gut das Retrieval-System relevante Dokumente vor irrelevanten einordnet.
Anwendungsfälle
- RAG-basierte Frage-Antwort-Systeme
Funktionsweise
Dieser Scorer validiert Ausgaben mithilfe einer deterministischen regelbasierten Evaluierung anhand konkreter Kriterien. Vordefinierte Regeln und Muster bewerten die Antwort und liefern konsistente, reproduzierbare Ergebnisse ohne LLM-Inferenz.
Eingabeschema
| Parameter | Typ | Erforderlich | Beschreibung |
|---|---|---|---|
| context.rankings | list[int] | Ja | Chunk positions/rankings |
| context.relevance_scores | list[float] | Ja | Relevance scores per chunk |
Ausgabeschema
| Feld | Typ | Beschreibung |
|---|---|---|
| mrr | float | Mean Reciprocal Rank |
| ndcg | float | Normalized Discounted Cumulative Gain |
| map | float | Mean Average Precision |
| avg_ranking | float | Average ranking position |
| combined | float | Combined ranking score |
Score-Interpretation
Standardschwellenwert: 7/10
Verwandte Scorer
SemanticSimilarityScorer
Berechnet die semantische Ähnlichkeit zwischen Anfrage und abgerufenem Kontext anhand von Satz-Embed...
RAGContextualPrecisionScorerPP
Berechnet die Precision abgerufener Chunks anhand numerischer Relevanzwerte. Precision = Anzahl der ...
RAGAggregateRAGScorer
Kombiniert mehrere Retrieval-Scorer mit gewichtetem Durchschnitt für eine umfassende RAG-Bewertung. ...
RAGRAGASScorer
Implementiert den RAGAS-Rahmen (Retrieval Augmented Generation Assessment) für eine umfassende RAG-B...
Häufig gestellte Fragen
Wann sollte ich diesen Scorer verwenden?
Verwenden Sie RetrievalRankingScorer, wenn Sie die Aspekte rag and rule-based Ihrer KI-Ausgaben evaluieren möchten. Der Scorer eignet sich besonders für rag-basierte frage-antwort-systeme.
Warum benötigt dieser Scorer keine erwartete Ausgabe?
Dieser Scorer evaluiert Qualitätsaspekte, für die kein Vergleich mit einer Referenzantwort erforderlich ist. System-Prompt und Kontext dienen als implizite Ground Truth.
Kann ich den Schwellenwert anpassen?
Ja, der Standardschwellenwert von 7 lässt sich bei der Konfiguration des Scorers anpassen.
Kurzinfo
Möchten Sie RetrievalRankingScorer ausprobieren?
Starten Sie die Evaluierung Ihrer KI-Agenten mit der umfassenden Scorer-Bibliothek von Noveum.ai.
Weitere Scorer entdecken
Entdecken Sie 112 kalibrierte LLM-as-Judge-Scorer für umfassende KI-Evaluierungen
