Noveum.ai
Mehrfachkontext-ScorerLLM-as-Judge

ContextFaithfulnessScorerPP

Erweiterte Faithfulness-Prüfung mit detaillierter Analyse einzelner Behauptungen. Extrahiert zunächst sachliche Behauptungen aus der Antwort und prüft anschließend jede davon anhand des Kontexts. Besonders geeignet zur Erkennung partieller Halluzinationen.

Übersicht

Erweiterte Faithfulness-Prüfung mit detaillierter Analyse einzelner Behauptungen. Extrahiert zunächst sachliche Behauptungen aus der Antwort und prüft anschließend jede davon anhand des Kontexts. Besonders geeignet zur Erkennung partieller Halluzinationen.

multi-contextraghallucinationllm-judgetrace-evaluationfaithfulnessclaims

Anwendungsfälle

  • RAG-basierte Frage-Antwort-Systeme
  • Halluzinationserkennung in generierten Inhalten

Funktionsweise

Dieser Scorer evaluiert Antworten mit LLM-as-Judge-Technologie. Ein großes Sprachmodell erhält konkrete Evaluierungskriterien und die zu bewertenden Inhalte. Anschließend wird sein Urteil analysiert, um einen Score und eine ausführliche Begründung zu erzeugen.

Eingabeschema

ParameterTypErforderlichBeschreibung
output_textstrJaAnswer containing claims to verify
input_textstrNeinOriginal question
contextlist[str] | strJaContext for claim verification

Ausgabeschema

FeldTypBeschreibung
scorefloatFaithfulness score (0-10)
passedboolTrue if faithful
reasoningstrVerification analysis
metadata.verified_claimsintNumber of verified claims
metadata.total_claimsintTotal claims extracted

Score-Interpretation

Standardschwellenwert: 7/10

9-10AusgezeichnetDie Antwort erfüllt alle Evaluierungskriterien vollständig
7-8GutDie Antwort erfüllt die meisten Kriterien mit geringfügigen Mängeln
5-6AusreichendDie Antwort erfüllt die Kriterien teilweise und muss verbessert werden
3-4SchwachDie Antwort weist erhebliche Mängel auf
0-2Nicht bestandenDie Antwort erfüllt die grundlegenden Kriterien nicht

Häufig gestellte Fragen

Wann sollte ich diesen Scorer verwenden?

Verwenden Sie ContextFaithfulnessScorerPP, wenn Sie die Aspekte multi-context and rag Ihrer KI-Ausgaben evaluieren möchten. Der Scorer eignet sich besonders für rag-basierte frage-antwort-systeme.

Warum benötigt dieser Scorer keine erwartete Ausgabe?

Dieser Scorer evaluiert Qualitätsaspekte, für die kein Vergleich mit einer Referenzantwort erforderlich ist. System-Prompt und Kontext dienen als implizite Ground Truth.

Kann ich den Schwellenwert anpassen?

Ja, der Standardschwellenwert von 7 lässt sich bei der Konfiguration des Scorers anpassen.

Kurzinfo

KategorieMehrfachkontext
EvaluierungstypLLM-as-Judge
Erwartete Ausgabe erforderlichNein
Standardschwellenwert7/10

Möchten Sie ContextFaithfulnessScorerPP ausprobieren?

Starten Sie die Evaluierung Ihrer KI-Agenten mit der umfassenden Scorer-Bibliothek von Noveum.ai.

Weitere Scorer entdecken

Entdecken Sie 112 kalibrierte LLM-as-Judge-Scorer für umfassende KI-Evaluierungen