112 Scorer, 15 Kategorien
Halluzinationen, RAG-Qualität, Antwortkorrektheit, Tool-Nutzung, Kohärenz und Sicherheit: entwickelt aus jahrelanger Analyse systematischer Fehler von Sprachmodellen.
Evaluierung
NovaEval bewertet Ihren realen Datenverkehr mit 112 kalibrierten Scorern aus 15 Kategorien, darunter die einzige spezialisierte Sprach-Suite am Markt. Aus Ihren Produktanforderungen entstehen zudem individuelle Scorer.
112
kalibrierte Scorer
15
Scorer-Kategorien
36
spezialisierte Sprach-Scorer

01 - Funktionen
Halluzinationen, RAG-Qualität, Antwortkorrektheit, Tool-Nutzung, Kohärenz und Sicherheit: entwickelt aus jahrelanger Analyse systematischer Fehler von Sprachmodellen.
36 Sprach-Scorer messen unter anderem Aussprachefehler, Audioabbrüche, Wortfehlerrate, Gesprächsanteil, Unterbrechungen, Stille und die vollständige Latenz der STT-, LLM- und TTS-Pipeline.
Ein Gremium berücksichtigt abweichende Bewertungen, statt sich auf die Meinung eines einzelnen Modells zu verlassen. Das reduziert halluzinierte Scores und liefert kalibrierte Ergebnisse.
Übergeben Sie Ihre Produktanforderungen. Anweisungsbasierte Scorer mit Vorlagenvariablen wie input_text, output_text, expected_output, retrieved_context und tool_calls verwandeln sie in Evaluierungskriterien und schlagen anhand des Datenverkehrs passende Scorer vor.
ETL-Jobs verwandeln Produktions-Traces in lebendige Eval-Datasets, die kontinuierlich aktualisiert werden. Ihre Protokolle werden zum Benchmark.
Eine 7 von 10 bedeutet auch nach einem Modellwechsel dasselbe. Überwachte Score-Verteilungen verhindern, dass sich Ihr Messinstrument unbemerkt verschiebt.
02 - Die Bibliothek
Jeder Scorer liefert einen Score samt Begründung. So können Sie die Bewertung prüfen, statt ihr nur zu vertrauen.

03 - Technische Details
112 kalibrierte Scorer, eine spezialisierte Sprach-Suite, vorlagengesteuerte individuelle Kriterien und automatisch erzeugte Datasets. Jede Bewertung enthält eine nachvollziehbare Begründung.
Scorer-Bibliothek
112 kalibrierte Scorer aus 15 Kategorien decken Halluzinationen, RAG-Qualität, Antwortkorrektheit, Tool-Nutzung, Kohärenz, Sicherheit, Bias, Formatvalidierung und mehr ab. Sie beruhen auf jahrelanger Analyse der Fehler von Sprachmodellen.
Sprach- und Audio-Suite
36 spezialisierte Sprach-Scorer erkennen Aussprachefehler, Audioabbrüche, Wortfehlerrate (WER), Gesprächsanteil, Unterbrechungen, Stille und die Latenz der STT-, LLM- und TTS-Pipeline. Diese Signale sind in einem Transkript nicht sichtbar.
Bewertungsgremium
Ein Gremium aus LLM-Bewertern erkennt Meinungsunterschiede und ersetzt die Einschätzung eines einzelnen Modells. Das Ergebnis sind weniger halluzinierte Scores und belastbare, kalibrierte Bewertungen.
Individuelle Scorer
Anweisungsbasierte Scorer mit Vorlagenvariablen wie input_text, output_text, expected_output, retrieved_context und tool_calls verwandeln Ihre Produktanforderungen in Evaluierungskriterien.
Scorer-Ausgabe
Jeder Scorer liefert einen Score von 0 bis 10, einen booleschen passed-Wert, eine Freitextbegründung und strukturierte Metadaten. So prüfen Sie die Bewertung, statt nur einer Zahl zu vertrauen.
Datasets aus Datenverkehr
ETL erstellt automatisch Evaluierungs-Datasets aus Produktions-Traces. Ihre realen Protokolle werden zu einem lebendigen Benchmark, der kontinuierlich aktualisiert wird.
Der Kreislauf
Die Evaluierung liefert das Steuersignal für alle weiteren Schritte. NovaGuard setzt diese Scores in Echtzeit durch, NovaPilot optimiert auf ihrer Grundlage.
Nächster Schritt
Produktive KI-Agenten, denen Ihre Kunden vertrauen können.
Im Produktivbetrieb bewährt bei Enterprise- und wachstumsstarken Teams