Noveum.ai
EV

Evaluierung

Messen Sie, was Ihre Agenten wirklich leisten.

NovaEval bewertet Ihren realen Datenverkehr mit 112 kalibrierten Scorern aus 15 Kategorien, darunter die einzige spezialisierte Sprach-Suite am Markt. Aus Ihren Produktanforderungen entstehen zudem individuelle Scorer.

112

kalibrierte Scorer

15

Scorer-Kategorien

36

spezialisierte Sprach-Scorer

app.noveum.ai: Eval-Ergebnisse
Score-Ergebnisse eines Eval-Jobs in Noveum

01 - Funktionen

Ein verlässliches Messinstrument, nicht nur eine Zahl.

112 Scorer, 15 Kategorien

Halluzinationen, RAG-Qualität, Antwortkorrektheit, Tool-Nutzung, Kohärenz und Sicherheit: entwickelt aus jahrelanger Analyse systematischer Fehler von Sprachmodellen.

Die einzige spezialisierte Sprach-Suite

36 Sprach-Scorer messen unter anderem Aussprachefehler, Audioabbrüche, Wortfehlerrate, Gesprächsanteil, Unterbrechungen, Stille und die vollständige Latenz der STT-, LLM- und TTS-Pipeline.

Gremium aus LLM-Bewertern

Ein Gremium berücksichtigt abweichende Bewertungen, statt sich auf die Meinung eines einzelnen Modells zu verlassen. Das reduziert halluzinierte Scores und liefert kalibrierte Ergebnisse.

Individuelle Scorer aus Ihrem PRD

Übergeben Sie Ihre Produktanforderungen. Anweisungsbasierte Scorer mit Vorlagenvariablen wie input_text, output_text, expected_output, retrieved_context und tool_calls verwandeln sie in Evaluierungskriterien und schlagen anhand des Datenverkehrs passende Scorer vor.

Datasets aus realem Datenverkehr

ETL-Jobs verwandeln Produktions-Traces in lebendige Eval-Datasets, die kontinuierlich aktualisiert werden. Ihre Protokolle werden zum Benchmark.

Über Versionen hinweg kalibriert

Eine 7 von 10 bedeutet auch nach einem Modellwechsel dasselbe. Überwachte Score-Verteilungen verhindern, dass sich Ihr Messinstrument unbemerkt verschiebt.

02 - Die Bibliothek

18 Kategorien. Ein Kalibrierungsmaßstab.

Jeder Scorer liefert einen Score samt Begründung. So können Sie die Bewertung prüfen, statt ihr nur zu vertrauen.

RAG-EvaluierungHalluzinationenAntwortqualitätAgentenevaluierungSprachlatenzAudio- und TTS-QualitätSicherheitBias-ErkennungKonversationGenauigkeit und AbgleichKontextanalyseFormatvalidierungNLP-MetrikenGremienbewertungMulti-KontextRelevanzG-EvalIndividuell
Halluzinationserkennung mit Begründung
Halluzinations-Scorer mit Begründung: Live-Produkt

03 - Technische Details

Was in jedem Score steckt.

112 kalibrierte Scorer, eine spezialisierte Sprach-Suite, vorlagengesteuerte individuelle Kriterien und automatisch erzeugte Datasets. Jede Bewertung enthält eine nachvollziehbare Begründung.

Scorer-Bibliothek

112 kalibrierte Scorer aus 15 Kategorien decken Halluzinationen, RAG-Qualität, Antwortkorrektheit, Tool-Nutzung, Kohärenz, Sicherheit, Bias, Formatvalidierung und mehr ab. Sie beruhen auf jahrelanger Analyse der Fehler von Sprachmodellen.

Sprach- und Audio-Suite

36 spezialisierte Sprach-Scorer erkennen Aussprachefehler, Audioabbrüche, Wortfehlerrate (WER), Gesprächsanteil, Unterbrechungen, Stille und die Latenz der STT-, LLM- und TTS-Pipeline. Diese Signale sind in einem Transkript nicht sichtbar.

Bewertungsgremium

Ein Gremium aus LLM-Bewertern erkennt Meinungsunterschiede und ersetzt die Einschätzung eines einzelnen Modells. Das Ergebnis sind weniger halluzinierte Scores und belastbare, kalibrierte Bewertungen.

Individuelle Scorer

Anweisungsbasierte Scorer mit Vorlagenvariablen wie input_text, output_text, expected_output, retrieved_context und tool_calls verwandeln Ihre Produktanforderungen in Evaluierungskriterien.

Scorer-Ausgabe

Jeder Scorer liefert einen Score von 0 bis 10, einen booleschen passed-Wert, eine Freitextbegründung und strukturierte Metadaten. So prüfen Sie die Bewertung, statt nur einer Zahl zu vertrauen.

Datasets aus Datenverkehr

ETL erstellt automatisch Evaluierungs-Datasets aus Produktions-Traces. Ihre realen Protokolle werden zu einem lebendigen Benchmark, der kontinuierlich aktualisiert wird.

Der Kreislauf

Teil eines geschlossenen Kreislaufs.

Die Evaluierung liefert das Steuersignal für alle weiteren Schritte. NovaGuard setzt diese Scores in Echtzeit durch, NovaPilot optimiert auf ihrer Grundlage.

Nächster Schritt

Schließen Sie Ihre Agenten an den Kreislauf an

Produktive KI-Agenten, denen Ihre Kunden vertrauen können.

Im Produktivbetrieb bewährt bei Enterprise- und wachstumsstarken Teams