RetrievalF1Scorer
F1-Score, der Precision und Recall für die kontextuelle Bewertung kombiniert. Berechnet das harmonische Mittel beider Werte für eine ausgewogene Retrieval-Bewertung.
Übersicht
F1-Score, der Precision und Recall für die kontextuelle Bewertung kombiniert. Berechnet das harmonische Mittel beider Werte für eine ausgewogene Retrieval-Bewertung.
Anwendungsfälle
- RAG-basierte Frage-Antwort-Systeme
- Genauigkeits-Benchmarking und Validierung
Funktionsweise
Dieser Scorer validiert Ausgaben mithilfe einer deterministischen regelbasierten Evaluierung anhand konkreter Kriterien. Vordefinierte Regeln und Muster bewerten die Antwort und liefern konsistente, reproduzierbare Ergebnisse ohne LLM-Inferenz.
Eingabeschema
| Parameter | Typ | Erforderlich | Beschreibung |
|---|---|---|---|
| precision_scorer | ContextualPrecisionScorerPP | Ja | Precision scorer result |
| recall_scorer | ContextualRecallScorerPP | Ja | Recall scorer result |
Ausgabeschema
| Feld | Typ | Beschreibung |
|---|---|---|
| f1 | float | Harmonic mean of precision and recall |
| precision | float | Precision score |
| recall | float | Recall score |
Score-Interpretation
Standardschwellenwert: 7/10
Verwandte Scorer
ContextualPrecisionScorerPP
Berechnet die Precision abgerufener Chunks anhand numerischer Relevanzwerte. Precision = Anzahl der ...
RAGContextualRecallScorerPP
Berechnet den Recall abgerufener Chunks anhand einer Schätzung aller verfügbaren relevanten Chunks. ...
RAGSemanticSimilarityScorer
Berechnet die semantische Ähnlichkeit zwischen Anfrage und abgerufenem Kontext anhand von Satz-Embed...
RAGAggregateRAGScorer
Kombiniert mehrere Retrieval-Scorer mit gewichtetem Durchschnitt für eine umfassende RAG-Bewertung. ...
Häufig gestellte Fragen
Wann sollte ich diesen Scorer verwenden?
Verwenden Sie RetrievalF1Scorer, wenn Sie die Aspekte rag and accuracy Ihrer KI-Ausgaben evaluieren möchten. Der Scorer eignet sich besonders für rag-basierte frage-antwort-systeme.
Warum benötigt dieser Scorer keine erwartete Ausgabe?
Dieser Scorer evaluiert Qualitätsaspekte, für die kein Vergleich mit einer Referenzantwort erforderlich ist. System-Prompt und Kontext dienen als implizite Ground Truth.
Kann ich den Schwellenwert anpassen?
Ja, der Standardschwellenwert von 7 lässt sich bei der Konfiguration des Scorers anpassen.
Kurzinfo
Möchten Sie RetrievalF1Scorer ausprobieren?
Starten Sie die Evaluierung Ihrer KI-Agenten mit der umfassenden Scorer-Bibliothek von Noveum.ai.
Weitere Scorer entdecken
Entdecken Sie 112 kalibrierte LLM-as-Judge-Scorer für umfassende KI-Evaluierungen
