SttEfficacyScorer
Bewertet die Übereinstimmung des Transkripts mit dem gesprochenen Audio auf einer Skala von 1 bis 10. Verarbeitet JSON-Score und Begründung. Die Metadaten können wer_estimate, Auslassungen, Halluzinationen, Ersetzungen und Schweregrad enthalten.
Übersicht
Bewertet die Übereinstimmung des Transkripts mit dem gesprochenen Audio auf einer Skala von 1 bis 10. Verarbeitet JSON-Score und Begründung. Die Metadaten können wer_estimate, Auslassungen, Halluzinationen, Ersetzungen und Schweregrad enthalten.
Anwendungsfälle
- Allgemeine KI-Evaluierung und Qualitätsbewertung
Funktionsweise
Dieser Scorer evaluiert Antworten mit LLM-as-Judge-Technologie. Ein großes Sprachmodell erhält konkrete Evaluierungskriterien und die zu bewertenden Inhalte. Anschließend wird sein Urteil analysiert, um einen Score und eine ausführliche Begründung zu erzeugen.
Eingabeschema
| Parameter | Typ | Erforderlich | Beschreibung |
|---|---|---|---|
| model | any | Ja | - |
| stt_data | any | Ja | - |
| stt_data.metadata | any | Ja | - |
Ausgabeschema
| Feld | Typ | Beschreibung |
|---|---|---|
| score | any | - |
| passed | any | - |
| reasoning | any | - |
| metadata | any | - |
Score-Interpretation
Verwandte Scorer
SttOverSuppressionScorer
Paarweiser Detektor für übermäßige Unterdrückung mit zwei physikalisch fundierten Signalen: musikali...
Sprache und AudioAgentWpmScorer
Berechnet die Sprechrate des Agenten in Wörtern pro Minute aus dem Text der Assistentenantworten und...
Sprache und AudioAiInterruptUserScorer
Zählt Unterbrechungen durch den Agenten, wenn er zu sprechen beginnt, während der Nutzer noch sprich...
Sprache und AudioAssistantAveragePitchScorer
Ermittelt die mittlere Grundfrequenz in Hz auf dem Assistentenkanal mit librosa yin und bildet sie f...
Häufig gestellte Fragen
Wann sollte ich diesen Scorer verwenden?
Verwenden Sie SttEfficacyScorer, wenn Sie die Aspekte stt_efficacy and audio Ihrer KI-Ausgaben evaluieren möchten. Der Scorer eignet sich besonders für allgemeine ki-evaluierung und qualitätsbewertung.
Warum benötigt dieser Scorer keine erwartete Ausgabe?
Dieser Scorer evaluiert Qualitätsaspekte, für die kein Vergleich mit einer Referenzantwort erforderlich ist. System-Prompt und Kontext dienen als implizite Ground Truth.
Kann ich den Schwellenwert anpassen?
Ja, der Standardschwellenwert von 7 lässt sich bei der Konfiguration des Scorers anpassen.
Kurzinfo
Möchten Sie SttEfficacyScorer ausprobieren?
Starten Sie die Evaluierung Ihrer KI-Agenten mit der umfassenden Scorer-Bibliothek von Noveum.ai.
Weitere Scorer entdecken
Entdecken Sie 112 kalibrierte LLM-as-Judge-Scorer für umfassende KI-Evaluierungen
