Noveum.ai
PL

Der autonome Engineer

Der KI-Engineer, der verifizierte Korrekturen liefert.

NovaPilot analysiert jedes fehlgeschlagene Eval, isoliert die Ursache mit vier spezialisierten Analyseagenten und validiert jede mögliche Korrektur zweifach. Zuerst prüft ein Backtest genau die geänderten Aufrufe, anschließend simuliert ein Vorwärtsdurchlauf das gesamte Szenario. Erst dann öffnet NovaPilot einen Pull Request mit allen Belegen. Die abschließende Prüfung bleibt bei Ihnen.

4

spezialisierte Analyseagenten

10 min

vom Fehler zur verifizierten Korrektur

200×

schneller als manuelles Debugging

acme/support-agent

fix(agent): Rückerstattungsantworten auf Richtlinien stützen, Tool-Wiederholungen straffen #312

Von NovaPilot geöffnet · mit 412 Aufrufen rückwirkend getestet · End-to-End simuliert

Validierungsbericht

hallucination_rate7.1%0.4%FEHLER
tool_call_success81%98%FEHLER
goal_completion84%95%FEHLER
100+ Scorer auf geänderten Aufrufen erneut ausgeführt + Szenario neu simuliert: keine Regressionen
Wartet auf menschliche PrüfungKorrektur mergen

01 - Funktionen

Autonomie mit Belegen bei jedem Schritt.

Vier Analyseagenten

Die Analyseagenten für Prompt, Tool, Ablauf und allgemeine Fehler decken jeweils eine Fehlerklasse ab. Sie isolieren die tatsächlich fehlerhafte Variable statt nur das Symptom.

Filterung falsch positiver Ergebnisse

Bevor NovaPilot etwas korrigiert, wird geprüft, ob der Fehler tatsächlich besteht. Rauschen der Scorer wird herausgefiltert, statt zum Optimierungsziel zu werden.

Zweifach validiert

Ein Backtest wiederholt jeden von der Korrektur geänderten Aufruf mit gleichem Kontext und neuem Prompt. Alle 112 Scorer prüfen, ob sich die lokale Antwort verbessert hat. Das allein belegt jedoch nicht das Ergebnis des gesamten Durchlaufs, denn eine geänderte Entscheidung beeinflusst alle nachgelagerten Schritte. Deshalb führt eine Vorwärtssimulation den geänderten Agenten End-to-End durch das vollständige Szenario. Vor der Bereitstellung wird jede Aussage mit der passenden Methode belegt: die lokale Korrektur per Backtest, das Gesamtergebnis per Simulation.

Deployment als Pull Request

Die beste Korrektur landet als PR mit vollständigem Bericht in Ihrem Repository. Ihre Engineers prüfen, kommentieren und führen sie zusammen.

Kontinuierlich aktiv

Evals, Experimente, Fehlerberichte und mögliche Korrekturen laufen kontinuierlich. Die Arbeit an der Zuverlässigkeit pausiert nicht zwischen Vorfällen.

Scorer-Empfehlungen

NovaPilot empfiehlt anhand des tatsächlich beobachteten Datenverkehrs die passenden Scorer und erspart Ihnen die manuelle Einrichtung.

02 - Die Pipeline

In fünf Schritten vom Fehler zur zusammengeführten Korrektur.

Jeder Schritt erzeugt ein überprüfbares Artefakt: Bericht, Backtest, Simulation und PR. Autonomie mit Belegen statt Bauchgefühl.

01

Erkennen

Schlecht bewertete Traces fließen aus Produktions-Evals und NovaSynth-Durchläufen ein.

02

Diagnostizieren

Vier Analyseagenten isolieren die fehlerhafte Variable und verwerfen falsch positive Scorer-Ergebnisse.

03

Generieren

Mögliche Korrekturen zielen auf die konkrete Variable: Prompt, Tool-Schema, Ablauf oder Konfiguration.

04

Validieren

Jeder geänderte Aufruf wird bei gleichem Kontext und neuem Prompt per Backtest geprüft. Anschließend validiert eine Vorwärtssimulation des vollständigen Szenarios das End-to-End-Ergebnis. Verschlechtert sich der lokale Aufruf oder das Ergebnis des gesamten Durchlaufs, wird die Korrektur verworfen.

05

PR öffnen

Die beste Korrektur wird mit allen Belegen in Ihrem Repository bereitgestellt und wartet auf Ihre Prüfung.

Von NovaPilot erstellter Bericht zur Agentenkorrektur
NovaPilot · generierte Korrektur mit Belegen aus Backtest und Simulation · Live-Produkt

03 - Technische Details

Was jeder Pull Request enthält.

Vier spezialisierte Analyseagenten, gezielte Korrekturen für jeweils eine Variable, zweifache Validierung mit allen 112 Scorern, Konfidenzbewertung und ein vollständiger Bericht im PR.

Analyseagenten

Vier spezialisierte Analyseagenten für Prompt, Tool, Ablauf und allgemeine Fehler isolieren jeweils eine Fehlerklasse. Sie ermitteln die tatsächlich fehlerhafte Variable und verwerfen falsch positive Scorer-Ergebnisse.

Mögliche Korrekturen

Korrekturen zielen auf die konkrete fehlerhafte Variable, etwa einen Prompt, ein Tool-Schema, einen Ablauf oder eine Konfigurationsänderung, statt alles pauschal umzuschreiben.

Backtest-Validierung

Für jede mögliche Korrektur werden genau die geänderten Aufrufe bei gleichem Kontext erneut ausgeführt. Alle 112 Scorer bewerten das Ergebnis neu und belegen, dass der lokale Fehler behoben ist.

Vorwärtssimulation

Eine Vorwärtssimulation des vollständigen Szenarios führt den geänderten Agenten End-to-End aus. So wird das Gesamtergebnis validiert, nicht nur ein einzelner Aufruf. Verschlechtert sich eines von beiden, wird die Korrektur verworfen.

Konfidenz und Bericht

Jede Empfehlung enthält einen Konfidenz-Score. Der Bericht umfasst eine Management-Zusammenfassung, konkrete Erkenntnisse, Fehlermuster, eine Scorer-Aufschlüsselung und die zugrunde liegenden Belege.

Bereitstellung als Pull Request

Die beste Korrektur öffnet über BullMQ einen geplanten Pull Request mit allen Belegen. Ihre Engineers prüfen, kommentieren und führen ihn zusammen. Die abschließende Kontrolle bleibt bei Ihnen.

Der Kreislauf

Teil eines geschlossenen Kreislaufs.

NovaPilot schließt den Kreislauf. Es verarbeitet alle vorgelagerten Signale aus Traces, Scores, Simulationen und blockierten Ausgaben und liefert zusammengeführte Verbesserungen zurück.

Nächster Schritt

Schließen Sie Ihre Agenten an den Kreislauf an

Produktive KI-Agenten, denen Ihre Kunden vertrauen können.

Im Produktivbetrieb bewährt bei Enterprise- und wachstumsstarken Teams