Noveum.ai

Debuggen, validieren und die Korrektur bereitstellen

Die Closed-Loop-Evaluierungsschichtfür produktive KI-Agenten.

Wählen Sie aus mehr als 100 kalibrierten Scorern, die auf Stichproben Ihrer Produktions-Traces laufen. Reale Fehler werden bis zu ihrer Ursache verfolgt, validiert und als Pull Requests bereitgestellt. Jede Korrektur hebt das Qualitätsniveau.

Kostenloser Tarif · erster Trace in 15 Minuten

SOC 2 Typ II (in Bearbeitung) · DSGVO · On-Premise und BYO ClickHouse

agent.py
from noveum_trace.integrations.langchain import (
NoveumTraceCallbackHandler,
)
handler = NoveumTraceCallbackHandler()
agent.invoke({"input": question},
config={"callbacks": [handler]})

Noveum, automatisch

Heute 1.248 Agentenausführungen erfasst
NovaEval markierte hallucination_rate · 7,1 %
NovaPilot öffnete PR #312 · +11 % in der Simulation

SDK einbinden: Noveum erfasst Traces, evaluiert und liefert die Korrektur.

Open-Source-SDKPython · TypeScript · OpenTelemetry-orientiert
60M+erfasste Spans / Tag
SOC 2 Type IIIn Bearbeitung · DSGVO

Produktiv im Einsatz bei

DarGlobalMyOperatorund KI-Plattformteams in Telekommunikation, Immobilien und Finanzdienstleistungen

Funktioniert mit Ihrem Stack

OpenAIAnthropicLangChainLangGraphLiveKitPipecatCrewAIOpenTelemetry

Eine einheitliche Plattform

Eine Plattform für KI-Agentenevaluierung, vom Trace bis zur validierten Korrektur

Die meisten Engineering-Teams mit produktiven KI-Agenten erhalten nur die Warnung: „Ihr Agent versagt.“ Noveum findet den Fehler, validiert die Korrektur und stellt sie als Pull Request bereit.

Observability

NovaTrace

Ein Open-Source-SDK erfasst jeden LLM-Aufruf, Tool-Einsatz, Retrieval-Vorgang und Agentenschritt. Jeder Span enthält Tokens, Kosten und Latenz. Tiefe native Integrationen unterstützen LangChain, LangGraph, LiveKit, Pipecat und CrewAI.

  • Tiefe Framework-Integrationen
  • Threads und Multi-Agenten-Graphen
  • Ausfallsicherer Transport

6 Mio.+ Traces/Tag · OpenTelemetry-konform · Apache-2.0-SDK

app.noveum.ai: Trace Explorer
Der dreigeteilte Trace Explorer von Noveum

Kunden

Das sagen unsere Kunden.

DarGlobalVon Langfuse gewechselt
Spans und Traces direkt in der Plattform analysieren und Probleme dort erkennen zu können, hat uns viel Debugging-Zeit gespart. Zuvor gingen wir Protokolle manuell durch, kopierten Traces in Claude Code, analysierten Probleme und setzten anschließend Korrekturen um.
Wartungs- und Deployment-Aufwand nach dem Wechsel von Langfuse deutlich reduziert
KI-gestütztes Debugging direkt an Spans und Traces innerhalb der Plattform
KI-empfohlene Scorer auf Grundlage der tatsächlich erfassten Protokolle und Traces
CrewAI-Integration als individuelle Anforderung angefragt, schnell geliefert und eingebunden

AI Engineering-Team · DarGlobal

MyOperatorSprachagenten im großen Maßstab
Früher verbrachten wir Tage mit dem Debugging von Agentenfehlern. Heute erhalten wir verifizierte Korrekturen automatisch.

84→95%+

Erfolgsquote der Anrufe

200×

schnellere Iteration

4- bis 6×

Antwortqualität

10 min

Trace → verifizierte Korrektur

Lead AI Engineer bei MyOperator

Fallstudie lesen

Jeden Agenten korrigieren

Eine Plattform, die Chat-, Sprach- und Workflow-Agenten evaluiert und korrigiert

Chat-Agenten

Sparen Sie sich manuelle Datasets und die Auswahl von Scorern. Noveum verwandelt Ihre Produktions-Traces in sofort ausführbare Evaluierungen mit mehr als 100 kalibrierten Scorern.

Chatbots evaluieren

Sprachagenten

Transkripte zeigen nicht, was im Anruf schiefging. Testen Sie Sprachagenten in echten Anrufen, bewerten Sie Gespräche mit mehr als 30 Sprach-Scorern und validieren Sie jede Korrektur mit produktionsnaher Simulation.

Sprachagenten evaluieren

Workflow-Agenten

Mehrstufige Agenten versagen oft zwischen den einzelnen Schritten. Evaluieren Sie Tool-Aufrufe, Routing und Ergebnisse über den gesamten Workflow.

Workflow-Agenten evaluieren

Enterprise-tauglich

Ihre Agenten, Ihre Daten, Ihre Infrastruktur

Behalten Sie jeden Trace in Ihrer eigenen Umgebung. Stellen Sie Noveum On-Premise oder in Ihrer VPC bereit oder nutzen Sie Ihr eigenes ClickHouse. SSO, RBAC und Audit-Protokolle sind integriert.

SOC 2 Typ II (in Bearbeitung)DSGVOSSO / SAMLRBACAudit-ProtokollierungBYO ClickHouseOn-Premise

Lastgetestet mit 15.000 Spans/Sek. · mehr als 60 Mio. Spans/Tag im Produktivbetrieb

FAQ

Die wichtigsten Fragen von Enterprise-Teams.

Was ist Noveum?

Noveum ist eine Plattform zur Evaluierung produktiver Chat-, Sprach- und Workflow-Agenten. Sie erfasst jede Ausführung als Trace, bewertet sie mit mehr als 100 kalibrierten Scorern, simuliert Korrekturen und stellt validierte Lösungen als Pull Requests bereit.

Was unterscheidet NovaPilot?

Die meisten Tools markieren nur einen Fehler oder schlagen einen Prompt vor. NovaPilot erzeugt die Korrektur und validiert sie zweifach: per Backtest der fehlerhaften Aufrufe und durch erneute End-to-End-Simulation. Anschließend öffnet es einen Pull Request, den Ihr Team prüft und zusammenführt.

Kann ich Noveum On-Premise betreiben?

Ja. Stellen Sie Noveum vollständig On-Premise oder in Ihrer eigenen VPC bereit oder nutzen Sie Ihr eigenes ClickHouse. SOC 2 Typ II ist in Bearbeitung, ergänzt durch DSGVO, SSO/SAML, RBAC und Audit-Protokollierung.

Was verhindert die Bereitstellung einer schlechten Korrektur?

Jede mögliche Korrektur wird vor der Übergabe validiert. Genau die geänderten Aufrufe werden rückwirkend getestet und End-to-End neu simuliert. Schlechte Ergebnisse werden verworfen. Ein Mensch prüft den Pull Request und führt ihn zusammen, nichts wird eigenständig bereitgestellt.

Nächster Schritt

Schließen Sie Ihre Agenten an den Kreislauf an

Produktive KI-Agenten, denen Ihre Kunden vertrauen können.

Im Produktivbetrieb bewährt bei Enterprise- und wachstumsstarken Teams