Noveum.ai
In KürzeBenchmark für Voice-AI-Plattformen

Der Benchmark für KI-Evaluierungsplattformen
2026

Welche KI-Evaluierungsplattform erkennt Fehler, ohne gute Antworten zu beanstanden?

Unsere Ergebnisse

Scrollen Sie durch die einzelnen Dimensionen. Fünf Karten erzählen eine Geschichte.

Gesamtwertung

Gesamtrangliste

Gleich gewichteter Durchschnitt über fünf vergleichbare Dimensionen. Ausgewogenheit ist wichtiger als der Sieg in einer einzelnen Spalte.

Vollständiger Abschnitt →
Noveum
0
DeepEval
0
Arize / Phoenix
0
Galileo
0
Ragas
0
Maxim
0
Braintrust
0
Patronus
0
Faktentreue

Recall und Kalibrierung

Im Streudiagramm gewinnt der Bereich oben links. Erkennen Sie Fehler mit hohem Recall, ohne gute Antworten zu beanstanden.

Vollständiger Abschnitt →
für automatische Qualitätsprüfungen ungeeignet60%80%100%0%20%40%Noveum 89% · 10%Ragas 94% · 37%
Scorer-Falle

Gegensätzliche Urteile

Der aktivierte Scorer kann wichtiger sein als der gewählte Anbieter.

Vollständiger Abschnitt →
autoevals ClosedQA
8%
autoevals.ragas
66%
Latenz

Geschwindigkeit des Bewertungsmodells

Noveum liefert ein Urteil in 0,59 s und ist damit 2- bis 27-mal schneller als das übrige Feld.

Vollständiger Abschnitt →
Noveum
0.59s
Arize
1.04s
Braintrust
3.30s
DeepEval
3.86s
Ragas
13.62s
Patronus
15.73s
Konsistenz

Ausgewogenheit über alle Dimensionen

Gleichmäßig helle Zeilen sind besser als einzelne Spitzen und Lücken. Konsistenz ist die seltenste Eigenschaft der Studie.

Vollständiger Abschnitt →
Faktentreue F1AntwortrelevanzKontextrelevanzTool-Auswahl
Noveum1.0001.0000.9951.000
DeepEval0.7160.0470.9661.000
Arize / Phoenix0.8650.0790.9140.890
Galileo0.9220.0000.832NA

So funktioniert der Benchmark

Ein realer Agent führt anspruchsvolle Gespräche. Jede Plattform bewertet mit ihren eigenen nativen Scorern und ohne Lösungshilfe. Fünf Schritte führen vom Belastungstest zu veröffentlichten, reproduzierbaren Wertungen.

RAG-Agent

LangGraph-Chatbot auf gpt-4.1-mini mit 599 Dokumentationsabschnitten. Varianten mit und ohne Quellenbezug.

❯_

100 Gespräche

440 Assistentenbeiträge · 131 echte Halluzinationen · 9 Gruppen anspruchsvoller Szenarien

⦿

Opus-4.8 als Schiedsrichter

Claude Opus-4.8 kennzeichnet jeden Beitrag. Keine Plattform erhält Zugriff auf diese Kennzeichnungen.

8 native Scorer

Ohne Referenzantwort · jeweils die dokumentierte Bestkonfiguration der Plattform

Veröffentlichte Wertungen

95-%-Bootstrap-Konfidenzintervalle, 2.000 Stichproben · vollständig reproduzierbar

Die Methode von Noveum übertraf ClosedQA mit demselben GPT-Bewertungsmodell: 82 % gegenüber 55 % Recall. Der Unterschied liegt in der Methode, nicht im Modell.

Realer Agent

LangGraph-RAG-Chatbot auf gpt-4.1-mini. Überspringt bei 53 % der Beiträge den Abruf. 78 % seiner Halluzinationen entstanden ganz ohne abgerufenen Kontext.

⦿

Neutraler Schiedsrichter

Claude Opus-4.8 kennzeichnet alle 440 Beiträge nach Halluzination, Qualität, Relevanz und Rollentreue. Diese Kennzeichnungen dienen keiner Plattform als Eingabe.

Statistik statt Bauchgefühl

95-%-Bootstrap-Konfidenzintervalle für jede Rate. Gepaarte Signifikanztests bei knappen Ergebnissen. Gleichstände werden als solche ausgewiesen.

Gesamtrangliste

Wer erzielt im Durchschnitt über alle Dimensionen die besten Ergebnisse? Die Gesamtwertung ist ein gleich gewichteter Durchschnitt der fünf Dimensionen mit vergleichbarer Metrik. Ausgewogenheit ist wichtiger als der Sieg in einer einzelnen Spalte.

Noveum
0
DeepEval
0
Arize / Phoenix
0
Galileo
0
Ragas
0
Maxim
0
Braintrust
0
Patronus
0

Nur gehostete Scorer werden aus dem Durchschnitt einer Plattform ausgeschlossen, statt ihn negativ zu beeinflussen.

Klarer Abstand an der Spitze.

Noveum erzielt 0,999 gegenüber 0,650 für DeepEval. Der Abstand an der Spitze ist eindeutig.

Ausgewogenheit ist wichtiger als eine Dimension.

Nur Noveum erzielt gleichzeitig in allen fünf Dimensionen der Gesamtwertung hohe Werte.

Keine Plattform führt in jeder Spalte.

Ragas führt bei der Kontextrelevanz. Braintrust führt bei der Fehlalarmrate für Faktentreue. Arize bietet das ausgewogenste Profil für Tool-Argumente. Noveum überzeugt durch Ausgewogenheit.

Recall und Kalibrierung

Faktentreue erfordert ein Gleichgewicht zwischen Halluzinations-Recall und Fehlalarmrate. Für unbeaufsichtigte Qualitätsprüfungen entscheidet die Fehlalarmrate über die Praxistauglichkeit. Noveum bietet mit 89 % Recall und 10 % Fehlalarmrate die beste Balance. Ragas erkennt mehr, beanstandet aber 37 % der guten Antworten.

Recall und Fehlalarmrate · 440 Beiträgefür automatische Qualitätsprüfungen ungeeignet40%60%80%100%0%10%20%30%40%Oben links gewinntbesserFehlalarmrate (niedriger ist besser ←)Recall (höher ist besser ↑)Braintrust 80% · 8%Arize 82% · 11%DeepEval 73% · 10%Patronus 48% · 18%Noveum 89% · 10%Ragas 94% · 37%

01. Beste Balance

Höchster F1-Wert und stärkste Korrelation mit der Qualität unter den Scorern für Faktentreue.

F1-Gesamtwert84 %

02. Beste Kalibrierung

Braintrust ClosedQA erzielt die niedrigste Fehlalarmrate der Studie.

Fehlalarmrate8 %

03. Hoher Recall, nicht praxistauglich

Ragas erkennt die meisten Halluzinationen, beanstandet aber ein Drittel der guten Antworten.

Halluzinations-Recall94 %

04. Spezialisiert, dennoch übersehen

Patronus Lynx erzielt bei den dialogbezogenen Erfindungen, für die es entwickelt wurde, den niedrigsten Wert.

Recall bei Erfindungen48 %

Die drei höchsten Recall-Werte (Noveum, Braintrust, Arize) überschneiden sich innerhalb ihrer Konfidenzintervalle. Im strengeren gepaarten Test ist der Vorsprung von Noveum gegenüber Braintrust signifikant, während der Vorsprung gegenüber Arize grenzwertig ist. Deshalb weisen wir die Gruppe bewusst als statistischen Gleichstand aus.

Vollständiger Bericht

Vollständigen Benchmark freischalten

Vertiefen Sie die Ergebnisse mit dem 22-seitigen Bericht und Einkaufsleitfaden: sechs direkt aus den Daten abgeleitete Entscheidungshilfen.

Gleiche Daten, gegensätzliche Urteile

Der aktivierte Scorer kann die Ergebnisse stärker verändern als der gewählte Anbieter. Bei identischen Beiträgen liegen die Braintrust-Scorer 58 Prozentpunkte auseinander. Die spezielle DeepEval-Metrik erkennt 1 %, GEval dagegen 73 %. Prüfen Sie, welcher Scorer tatsächlich aktiviert ist.

autoevals ClosedQA
8%
autoevals.ragas
66%

58 Prozentpunkte Unterschied bei identischen Beiträgen.

GEval-Konfiguration
73%
FaithfulnessMetric
1%

Spezielle Metrik: 1 %. GEval: 73 %.

Recall
99%
Fehlalarm
48%

Hoher Recall, aber fast die Hälfte der guten Antworten wird beanstandet.

01. Scorer-Abweichung

Gleicher Anbieter, gleiche Daten: gegensätzliche Urteile allein durch die Wahl des Scorers.

Fehlalarmdifferenz58 Pkt.

02. Unpassende Metrik

FaithfulnessMetric erkennt fast nichts, GEval dagegen 73 % bei identischen Beiträgen.

Recall-Differenz72 Pkt.

03. Zu viele Beanstandungen

Maxim erkennt fast alles, beanstandet aber beinahe die Hälfte der guten Antworten.

Beanstandete gute Antworten48 %

Spezialisierungsmuster

Aggregierter Recall verbirgt Spezialisierungen. Erfundene Code-APIs sind am schwierigsten (21 bis 88 % Recall), während verkettete Fakten zu 100 % gelöst werden. Prompt Injection kehrt die Rangfolge um: Scorer auf Abschnittsebene führen, Noveum erreicht seinen Höchstwert bei Druck zu themenfremden Fakten.

0%Ragas
0%Noveum
0%Braintrust
0%Arize
0%DeepEval
0%Patronus
0%Noveum
0%Ragas
0%Arize
0%Braintrust
0%DeepEval
0%Patronus

01. Code-APIs sind am schwierigsten

Erfundene SDK-Methoden werden am häufigsten übersehen. Noveum erreicht 75 %.

Noveum Recall75 %

02. Verkettete Fakten gelöst

Alle allgemeinen Bewertungsmodelle erreichen 100 % bei der Zusammenführung verketteter Fakten.

Allgemeine Bewertungsmodelle100 %

03. Druck zu Fakten

Noveum erzielt perfekten Recall bei Druck zu themenfremden Fakten.

Recall außerhalb des Themenbereichs100 %

04. Injection kehrt Rangfolge um

Scorer auf Abschnittsebene führen. Noveum erzielt in seiner schwächsten bedeutenden Gruppe 55 %.

Noveum Recall55 %

Abruf und Antworten

Die RAG-Evaluierung unterscheidet Kontextrelevanz (Qualität des Abrufs) und Antwortrelevanz (wurde die Frage beantwortet?). Ragas führt beim Kontext mit r = 0,95. Noveum setzt sich bei der Antwortrelevanz mit r = 0,78 ab, während die übrigen Plattformen nahe null liegen.

0Noveum
0Ragas
0DeepEval
0Arize
0Braintrust

Kontextrelevanz ist die stärkste Dimension des Feldes, Noveum führt hier nicht. Ragas liegt mit r = 0,95 vorn, Noveum mit 0,945 praktisch gleichauf (an einer zurückgehaltenen Stichprobe mit r = 0,93 für 280 Beiträge validiert, die der Scorer während der Entwicklung nie gesehen hatte). Bei fast der Hälfte aller Beiträge wurde nichts abgerufen. Alle starken Scorer behandeln einen leeren Abruf als tatsächlichen Nullwert.

0Noveum
0Ragas
0Braintrust
0Arize
0DeepEval

Bei der Antwortrelevanz trennte sich das Feld deutlich. Noveum erreicht eine Korrelation von r = 0,78, während alle anderen nativen Scorer zwischen 0,04 und 0,27 liegen. Eine Einschränkung: Die Gold-Labels dieser Dimension wiesen nur eine geringe Varianz auf, weshalb ihre statistische Aussagekraft geringer ist.

Richtiges Tool, echte Argumente

Agentenfehler entstehen durch die Wahl des falschen Tools oder erfundene Argumente in ansonsten plausiblen Aufrufen. Nur vier Plattformen bieten native Scorer für Tool-Aufrufe. Noveum und DeepEval liegen bei der Auswahl gleichauf. Arize erkennt erfundene Argumente am ausgewogensten.

0%Noveum
0%DeepEval
0%Arize
0%Ragas
0%Noveum
0%Arize
0%DeepEval
0%Ragas

01. Tool-Auswahl

Noveum und DeepEval erzielen bei der Spezifität der Tool-Auswahl beide den perfekten Wert.

Spezifität100 %

02. Erfundene Argumente

Arize bietet die beste Balance. Noveum ist die vorsichtigste autonome Qualitätsprüfung.

Arize Spezifität81 %

03. Kein universelles Profil

Qualitätsprüfungen benötigen wenige Fehlalarme, Regressionstests einen hohen Exact-Match-Recall.

Aufteilung nach Anwendungsfall2 Modi

Der Rolle treu bleiben

Rollentreue prüft, ob der Agent seine Persona unter dem Druck mehrerer Gesprächsrunden beibehält. Nur Noveum und DeepEval bieten native Scorer. Noveum führt mit r = 0,79. Bewertungsmodelle der GPT-Klasse liegen zwischen 0,56 und 0,68.

Noveum
0
DeepEval
0
Galileo
0
Ragas
0
Maxim
0
Patronus
0
Arize
0
Braintrust
0

Der native Dialog-Scorer von Noveum führt mit r = 0,79 und trennt gute von schlechten Agenten am klarsten. Die Scorer der GPT-Klasse liegen zwischen r = 0,56 und 0,68. Bei dieser Aufgabe bestimmt das Bewertungsmodell die Leistung stärker als die technische Anbindung, sofern der Scorer nicht wirklich spezialisiert ist.

Geschwindigkeit des Bewertungsmodells

Für Echtzeitprüfungen und die Verarbeitung großer Mengen ist ein langsames Bewertungsmodell unabhängig von seiner Genauigkeit ungeeignet. Noveum benötigt 0,59 s und ist damit 2- bis 27-mal schneller als das übrige Feld.

Noveum
0.59s
Arize
1.04s
Braintrust
3.30s
DeepEval
3.86s
Ragas
13.62s
Patronus
15.73s

Die Latenz bezeichnet hier den lokalen Aufruf des Bewertungsmodells, der für jede Plattform identisch gemessen wurde, nicht die Umlaufzeit einer gehosteten API. Ein Bewertungsmodell mit 13 bis 16 Sekunden Latenz (Ragas, Patronus) ist für die Verarbeitung einer Anfrage ungeeignet.

Hoch und gleichmäßig

Eine Plattform kann in einer Dimension führen und dennoch als allgemeiner Evaluator ungeeignet sein, wenn ihre Leistung stark schwankt. Die Werte sind über fünf Dimensionen normalisiert. Gleichmäßige Zeilen sind besser als einzelne Spitzen und Lücken.

NA bedeutet, dass die Plattform einen speziellen Scorer gehostet oder serverseitig ausführt (ausgeschlossen, nicht als null gewertet). Eine Zelle mit 0,000 steht für den schlechtesten Messwert oder eine bestätigte Funktionslücke. Die fünf Spalten zeigen den mittels Min-Max-Verfahren normalisierten Wert jeder Plattform pro Dimension aus §9.4c. Die Gesamtwertung von Noveum beträgt 0,999.

Faktentreue F1AntwortrelevanzKontextrelevanzTool-AuswahlRollentreue
Noveum1.0001.0000.9951.0001.000
DeepEval0.7160.0470.9661.0000.522
Arize / Phoenix0.8650.0790.9140.8900.130
Galileo0.9220.0000.832NA0.478
Ragas0.4940.3461.0000.1300.478
Maxim0.8920.0510.000NA0.435
Braintrust0.8980.3080.1630.0000.000
Patronus0.0000.0000.0000.0000.391
0.999
Noveum Wertung

Die wichtigste Kennzahl. Verwenden Sie diesen Wert in Balken und Diagrammen.

Noveum ist die einzige Plattform, die mit einer Gesamtwertung von 0,999 in jeder gemessenen Dimension sowohl hohe als auch gleichmäßige Werte erzielt. Jede andere wettbewerbsfähige Plattform weist mindestens eine deutliche Spitze und eine Lücke auf: DeepEval bei der Antwortrelevanz nahe null, Braintrust ohne Tool- und Dialog-Scorer sowie Galileo und Maxim mit zu vielen Beanstandungen bei der Faktentreue. Soll eine Plattform einen vollständigen Agenten abdecken, ist die Ausgewogenheit die entscheidende Kennzahl.

Häufig gestellte Fragen

Reproduzierbar · offene Daten

Vollständigen Bericht herunterladen

22-seitiger Benchmark mit Einkaufsleitfaden. Jede Wertung ist reproduzierbar.

22 Seiten · 8 Plattformen · 6 Dimensionen · Konfidenzintervalle mit 2.000 Stichproben · öffentliches Testsystem