Noveum.ai
Genauigkeit-ScorerLLM-as-Judge

AccuracyScorer

Berechnet die Genauigkeit anhand von Teilstring- oder Token-Übereinstimmungen zwischen Vorhersage und Ground Truth. Weniger streng als ExactMatchScorer und daher für Teilübereinstimmungen geeignet.

Übersicht

Berechnet die Genauigkeit anhand von Teilstring- oder Token-Übereinstimmungen zwischen Vorhersage und Ground Truth. Weniger streng als ExactMatchScorer und daher für Teilübereinstimmungen geeignet.

accuracyrule-basedbenchmarkpartial-matchflexible

Anwendungsfälle

  • Genauigkeits-Benchmarking und Validierung

Funktionsweise

Dieser Scorer evaluiert Antworten mit LLM-as-Judge-Technologie. Ein großes Sprachmodell erhält konkrete Evaluierungskriterien und die zu bewertenden Inhalte. Anschließend wird sein Urteil analysiert, um einen Score und eine ausführliche Begründung zu erzeugen.

Eingabeschema

ParameterTypErforderlichBeschreibung
predictionstrJaGenerated output
ground_truthstrJaExpected output

Ausgabeschema

FeldTypBeschreibung
scorefloatPartial match score (0-10)
passedboolTrue if above threshold
reasoningstrMatch analysis
metadatadictToken overlap details

Score-Interpretation

Standardschwellenwert: 7/10

9-10AusgezeichnetDie Antwort erfüllt alle Evaluierungskriterien vollständig
7-8GutDie Antwort erfüllt die meisten Kriterien mit geringfügigen Mängeln
5-6AusreichendDie Antwort erfüllt die Kriterien teilweise und muss verbessert werden
3-4SchwachDie Antwort weist erhebliche Mängel auf
0-2Nicht bestandenDie Antwort erfüllt die grundlegenden Kriterien nicht

Häufig gestellte Fragen

Wann sollte ich diesen Scorer verwenden?

Verwenden Sie AccuracyScorer, wenn Sie die Aspekte accuracy and rule-based Ihrer KI-Ausgaben evaluieren möchten. Der Scorer eignet sich besonders für genauigkeits-benchmarking und validierung.

Warum benötigt dieser Scorer eine erwartete Ausgabe?

Dieser Scorer vergleicht die generierte Ausgabe mit einem bekannten erwarteten Ergebnis, um Genauigkeitsmetriken zu berechnen.

Kann ich den Schwellenwert anpassen?

Ja, der Standardschwellenwert von 7 lässt sich bei der Konfiguration des Scorers anpassen.

Kurzinfo

KategorieGenauigkeit
EvaluierungstypLLM-as-Judge
Erwartete Ausgabe erforderlichJa
Standardschwellenwert7/10

Möchten Sie AccuracyScorer ausprobieren?

Starten Sie die Evaluierung Ihrer KI-Agenten mit der umfassenden Scorer-Bibliothek von Noveum.ai.

Weitere Scorer entdecken

Entdecken Sie 112 kalibrierte LLM-as-Judge-Scorer für umfassende KI-Evaluierungen