Gesamtrangliste
Gleich gewichteter Durchschnitt über fünf vergleichbare Dimensionen. Ausgewogenheit ist wichtiger als der Sieg in einer einzelnen Spalte.
Vollständiger Abschnitt →
Welche KI-Evaluierungsplattform erkennt Fehler, ohne gute Antworten zu beanstanden?
Scrollen Sie durch die einzelnen Dimensionen. Fünf Karten erzählen eine Geschichte.
Gleich gewichteter Durchschnitt über fünf vergleichbare Dimensionen. Ausgewogenheit ist wichtiger als der Sieg in einer einzelnen Spalte.
Vollständiger Abschnitt →Im Streudiagramm gewinnt der Bereich oben links. Erkennen Sie Fehler mit hohem Recall, ohne gute Antworten zu beanstanden.
Vollständiger Abschnitt →Der aktivierte Scorer kann wichtiger sein als der gewählte Anbieter.
Vollständiger Abschnitt →Noveum liefert ein Urteil in 0,59 s und ist damit 2- bis 27-mal schneller als das übrige Feld.
Vollständiger Abschnitt →Gleichmäßig helle Zeilen sind besser als einzelne Spitzen und Lücken. Konsistenz ist die seltenste Eigenschaft der Studie.
Vollständiger Abschnitt →| Faktentreue F1 | Antwortrelevanz | Kontextrelevanz | Tool-Auswahl | |
|---|---|---|---|---|
| Noveum | 1.000 | 1.000 | 0.995 | 1.000 |
| DeepEval | 0.716 | 0.047 | 0.966 | 1.000 |
| Arize / Phoenix | 0.865 | 0.079 | 0.914 | 0.890 |
| Galileo | 0.922 | 0.000 | 0.832 | NA |
Ein realer Agent führt anspruchsvolle Gespräche. Jede Plattform bewertet mit ihren eigenen nativen Scorern und ohne Lösungshilfe. Fünf Schritte führen vom Belastungstest zu veröffentlichten, reproduzierbaren Wertungen.
LangGraph-Chatbot auf gpt-4.1-mini mit 599 Dokumentationsabschnitten. Varianten mit und ohne Quellenbezug.
440 Assistentenbeiträge · 131 echte Halluzinationen · 9 Gruppen anspruchsvoller Szenarien
Claude Opus-4.8 kennzeichnet jeden Beitrag. Keine Plattform erhält Zugriff auf diese Kennzeichnungen.
Ohne Referenzantwort · jeweils die dokumentierte Bestkonfiguration der Plattform
95-%-Bootstrap-Konfidenzintervalle, 2.000 Stichproben · vollständig reproduzierbar
Die Methode von Noveum übertraf ClosedQA mit demselben GPT-Bewertungsmodell: 82 % gegenüber 55 % Recall. Der Unterschied liegt in der Methode, nicht im Modell.
LangGraph-RAG-Chatbot auf gpt-4.1-mini. Überspringt bei 53 % der Beiträge den Abruf. 78 % seiner Halluzinationen entstanden ganz ohne abgerufenen Kontext.
Claude Opus-4.8 kennzeichnet alle 440 Beiträge nach Halluzination, Qualität, Relevanz und Rollentreue. Diese Kennzeichnungen dienen keiner Plattform als Eingabe.
95-%-Bootstrap-Konfidenzintervalle für jede Rate. Gepaarte Signifikanztests bei knappen Ergebnissen. Gleichstände werden als solche ausgewiesen.
Wer erzielt im Durchschnitt über alle Dimensionen die besten Ergebnisse? Die Gesamtwertung ist ein gleich gewichteter Durchschnitt der fünf Dimensionen mit vergleichbarer Metrik. Ausgewogenheit ist wichtiger als der Sieg in einer einzelnen Spalte.
Nur gehostete Scorer werden aus dem Durchschnitt einer Plattform ausgeschlossen, statt ihn negativ zu beeinflussen.
Noveum erzielt 0,999 gegenüber 0,650 für DeepEval. Der Abstand an der Spitze ist eindeutig.
Nur Noveum erzielt gleichzeitig in allen fünf Dimensionen der Gesamtwertung hohe Werte.
Ragas führt bei der Kontextrelevanz. Braintrust führt bei der Fehlalarmrate für Faktentreue. Arize bietet das ausgewogenste Profil für Tool-Argumente. Noveum überzeugt durch Ausgewogenheit.
Faktentreue erfordert ein Gleichgewicht zwischen Halluzinations-Recall und Fehlalarmrate. Für unbeaufsichtigte Qualitätsprüfungen entscheidet die Fehlalarmrate über die Praxistauglichkeit. Noveum bietet mit 89 % Recall und 10 % Fehlalarmrate die beste Balance. Ragas erkennt mehr, beanstandet aber 37 % der guten Antworten.
Höchster F1-Wert und stärkste Korrelation mit der Qualität unter den Scorern für Faktentreue.
Braintrust ClosedQA erzielt die niedrigste Fehlalarmrate der Studie.
Ragas erkennt die meisten Halluzinationen, beanstandet aber ein Drittel der guten Antworten.
Patronus Lynx erzielt bei den dialogbezogenen Erfindungen, für die es entwickelt wurde, den niedrigsten Wert.
Die drei höchsten Recall-Werte (Noveum, Braintrust, Arize) überschneiden sich innerhalb ihrer Konfidenzintervalle. Im strengeren gepaarten Test ist der Vorsprung von Noveum gegenüber Braintrust signifikant, während der Vorsprung gegenüber Arize grenzwertig ist. Deshalb weisen wir die Gruppe bewusst als statistischen Gleichstand aus.
Vollständiger Bericht
Vertiefen Sie die Ergebnisse mit dem 22-seitigen Bericht und Einkaufsleitfaden: sechs direkt aus den Daten abgeleitete Entscheidungshilfen.
Der aktivierte Scorer kann die Ergebnisse stärker verändern als der gewählte Anbieter. Bei identischen Beiträgen liegen die Braintrust-Scorer 58 Prozentpunkte auseinander. Die spezielle DeepEval-Metrik erkennt 1 %, GEval dagegen 73 %. Prüfen Sie, welcher Scorer tatsächlich aktiviert ist.
58 Prozentpunkte Unterschied bei identischen Beiträgen.
Spezielle Metrik: 1 %. GEval: 73 %.
Hoher Recall, aber fast die Hälfte der guten Antworten wird beanstandet.
Gleicher Anbieter, gleiche Daten: gegensätzliche Urteile allein durch die Wahl des Scorers.
FaithfulnessMetric erkennt fast nichts, GEval dagegen 73 % bei identischen Beiträgen.
Maxim erkennt fast alles, beanstandet aber beinahe die Hälfte der guten Antworten.
Aggregierter Recall verbirgt Spezialisierungen. Erfundene Code-APIs sind am schwierigsten (21 bis 88 % Recall), während verkettete Fakten zu 100 % gelöst werden. Prompt Injection kehrt die Rangfolge um: Scorer auf Abschnittsebene führen, Noveum erreicht seinen Höchstwert bei Druck zu themenfremden Fakten.
Erfundene SDK-Methoden werden am häufigsten übersehen. Noveum erreicht 75 %.
Alle allgemeinen Bewertungsmodelle erreichen 100 % bei der Zusammenführung verketteter Fakten.
Noveum erzielt perfekten Recall bei Druck zu themenfremden Fakten.
Scorer auf Abschnittsebene führen. Noveum erzielt in seiner schwächsten bedeutenden Gruppe 55 %.
Die RAG-Evaluierung unterscheidet Kontextrelevanz (Qualität des Abrufs) und Antwortrelevanz (wurde die Frage beantwortet?). Ragas führt beim Kontext mit r = 0,95. Noveum setzt sich bei der Antwortrelevanz mit r = 0,78 ab, während die übrigen Plattformen nahe null liegen.
Kontextrelevanz ist die stärkste Dimension des Feldes, Noveum führt hier nicht. Ragas liegt mit r = 0,95 vorn, Noveum mit 0,945 praktisch gleichauf (an einer zurückgehaltenen Stichprobe mit r = 0,93 für 280 Beiträge validiert, die der Scorer während der Entwicklung nie gesehen hatte). Bei fast der Hälfte aller Beiträge wurde nichts abgerufen. Alle starken Scorer behandeln einen leeren Abruf als tatsächlichen Nullwert.
Bei der Antwortrelevanz trennte sich das Feld deutlich. Noveum erreicht eine Korrelation von r = 0,78, während alle anderen nativen Scorer zwischen 0,04 und 0,27 liegen. Eine Einschränkung: Die Gold-Labels dieser Dimension wiesen nur eine geringe Varianz auf, weshalb ihre statistische Aussagekraft geringer ist.
Agentenfehler entstehen durch die Wahl des falschen Tools oder erfundene Argumente in ansonsten plausiblen Aufrufen. Nur vier Plattformen bieten native Scorer für Tool-Aufrufe. Noveum und DeepEval liegen bei der Auswahl gleichauf. Arize erkennt erfundene Argumente am ausgewogensten.
Noveum und DeepEval erzielen bei der Spezifität der Tool-Auswahl beide den perfekten Wert.
Arize bietet die beste Balance. Noveum ist die vorsichtigste autonome Qualitätsprüfung.
Qualitätsprüfungen benötigen wenige Fehlalarme, Regressionstests einen hohen Exact-Match-Recall.
Rollentreue prüft, ob der Agent seine Persona unter dem Druck mehrerer Gesprächsrunden beibehält. Nur Noveum und DeepEval bieten native Scorer. Noveum führt mit r = 0,79. Bewertungsmodelle der GPT-Klasse liegen zwischen 0,56 und 0,68.
Der native Dialog-Scorer von Noveum führt mit r = 0,79 und trennt gute von schlechten Agenten am klarsten. Die Scorer der GPT-Klasse liegen zwischen r = 0,56 und 0,68. Bei dieser Aufgabe bestimmt das Bewertungsmodell die Leistung stärker als die technische Anbindung, sofern der Scorer nicht wirklich spezialisiert ist.
Für Echtzeitprüfungen und die Verarbeitung großer Mengen ist ein langsames Bewertungsmodell unabhängig von seiner Genauigkeit ungeeignet. Noveum benötigt 0,59 s und ist damit 2- bis 27-mal schneller als das übrige Feld.
Die Latenz bezeichnet hier den lokalen Aufruf des Bewertungsmodells, der für jede Plattform identisch gemessen wurde, nicht die Umlaufzeit einer gehosteten API. Ein Bewertungsmodell mit 13 bis 16 Sekunden Latenz (Ragas, Patronus) ist für die Verarbeitung einer Anfrage ungeeignet.
Eine Plattform kann in einer Dimension führen und dennoch als allgemeiner Evaluator ungeeignet sein, wenn ihre Leistung stark schwankt. Die Werte sind über fünf Dimensionen normalisiert. Gleichmäßige Zeilen sind besser als einzelne Spitzen und Lücken.
NA bedeutet, dass die Plattform einen speziellen Scorer gehostet oder serverseitig ausführt (ausgeschlossen, nicht als null gewertet). Eine Zelle mit 0,000 steht für den schlechtesten Messwert oder eine bestätigte Funktionslücke. Die fünf Spalten zeigen den mittels Min-Max-Verfahren normalisierten Wert jeder Plattform pro Dimension aus §9.4c. Die Gesamtwertung von Noveum beträgt 0,999.
| Faktentreue F1 | Antwortrelevanz | Kontextrelevanz | Tool-Auswahl | Rollentreue | |
|---|---|---|---|---|---|
| Noveum | 1.000 | 1.000 | 0.995 | 1.000 | 1.000 |
| DeepEval | 0.716 | 0.047 | 0.966 | 1.000 | 0.522 |
| Arize / Phoenix | 0.865 | 0.079 | 0.914 | 0.890 | 0.130 |
| Galileo | 0.922 | 0.000 | 0.832 | NA | 0.478 |
| Ragas | 0.494 | 0.346 | 1.000 | 0.130 | 0.478 |
| Maxim | 0.892 | 0.051 | 0.000 | NA | 0.435 |
| Braintrust | 0.898 | 0.308 | 0.163 | 0.000 | 0.000 |
| Patronus | 0.000 | 0.000 | 0.000 | 0.000 | 0.391 |
Die wichtigste Kennzahl. Verwenden Sie diesen Wert in Balken und Diagrammen.
Noveum ist die einzige Plattform, die mit einer Gesamtwertung von 0,999 in jeder gemessenen Dimension sowohl hohe als auch gleichmäßige Werte erzielt. Jede andere wettbewerbsfähige Plattform weist mindestens eine deutliche Spitze und eine Lücke auf: DeepEval bei der Antwortrelevanz nahe null, Braintrust ohne Tool- und Dialog-Scorer sowie Galileo und Maxim mit zu vielen Beanstandungen bei der Faktentreue. Soll eine Plattform einen vollständigen Agenten abdecken, ist die Ausgewogenheit die entscheidende Kennzahl.
Reproduzierbar · offene Daten
22-seitiger Benchmark mit Einkaufsleitfaden. Jede Wertung ist reproduzierbar.