Vier Analyseagenten
Die Analyseagenten für Prompt, Tool, Ablauf und allgemeine Fehler decken jeweils eine Fehlerklasse ab. Sie isolieren die tatsächlich fehlerhafte Variable statt nur das Symptom.
Der autonome Engineer
NovaPilot analysiert jedes fehlgeschlagene Eval, isoliert die Ursache mit vier spezialisierten Analyseagenten und validiert jede mögliche Korrektur zweifach. Zuerst prüft ein Backtest genau die geänderten Aufrufe, anschließend simuliert ein Vorwärtsdurchlauf das gesamte Szenario. Erst dann öffnet NovaPilot einen Pull Request mit allen Belegen. Die abschließende Prüfung bleibt bei Ihnen.
4
spezialisierte Analyseagenten
10 min
vom Fehler zur verifizierten Korrektur
200×
schneller als manuelles Debugging
fix(agent): Rückerstattungsantworten auf Richtlinien stützen, Tool-Wiederholungen straffen #312
Von NovaPilot geöffnet · mit 412 Aufrufen rückwirkend getestet · End-to-End simuliert
Validierungsbericht
01 - Funktionen
Die Analyseagenten für Prompt, Tool, Ablauf und allgemeine Fehler decken jeweils eine Fehlerklasse ab. Sie isolieren die tatsächlich fehlerhafte Variable statt nur das Symptom.
Bevor NovaPilot etwas korrigiert, wird geprüft, ob der Fehler tatsächlich besteht. Rauschen der Scorer wird herausgefiltert, statt zum Optimierungsziel zu werden.
Ein Backtest wiederholt jeden von der Korrektur geänderten Aufruf mit gleichem Kontext und neuem Prompt. Alle 112 Scorer prüfen, ob sich die lokale Antwort verbessert hat. Das allein belegt jedoch nicht das Ergebnis des gesamten Durchlaufs, denn eine geänderte Entscheidung beeinflusst alle nachgelagerten Schritte. Deshalb führt eine Vorwärtssimulation den geänderten Agenten End-to-End durch das vollständige Szenario. Vor der Bereitstellung wird jede Aussage mit der passenden Methode belegt: die lokale Korrektur per Backtest, das Gesamtergebnis per Simulation.
Die beste Korrektur landet als PR mit vollständigem Bericht in Ihrem Repository. Ihre Engineers prüfen, kommentieren und führen sie zusammen.
Evals, Experimente, Fehlerberichte und mögliche Korrekturen laufen kontinuierlich. Die Arbeit an der Zuverlässigkeit pausiert nicht zwischen Vorfällen.
NovaPilot empfiehlt anhand des tatsächlich beobachteten Datenverkehrs die passenden Scorer und erspart Ihnen die manuelle Einrichtung.
02 - Die Pipeline
Jeder Schritt erzeugt ein überprüfbares Artefakt: Bericht, Backtest, Simulation und PR. Autonomie mit Belegen statt Bauchgefühl.
01
Erkennen
Schlecht bewertete Traces fließen aus Produktions-Evals und NovaSynth-Durchläufen ein.
02
Diagnostizieren
Vier Analyseagenten isolieren die fehlerhafte Variable und verwerfen falsch positive Scorer-Ergebnisse.
03
Generieren
Mögliche Korrekturen zielen auf die konkrete Variable: Prompt, Tool-Schema, Ablauf oder Konfiguration.
04
Validieren
Jeder geänderte Aufruf wird bei gleichem Kontext und neuem Prompt per Backtest geprüft. Anschließend validiert eine Vorwärtssimulation des vollständigen Szenarios das End-to-End-Ergebnis. Verschlechtert sich der lokale Aufruf oder das Ergebnis des gesamten Durchlaufs, wird die Korrektur verworfen.
05
PR öffnen
Die beste Korrektur wird mit allen Belegen in Ihrem Repository bereitgestellt und wartet auf Ihre Prüfung.

03 - Technische Details
Vier spezialisierte Analyseagenten, gezielte Korrekturen für jeweils eine Variable, zweifache Validierung mit allen 112 Scorern, Konfidenzbewertung und ein vollständiger Bericht im PR.
Analyseagenten
Vier spezialisierte Analyseagenten für Prompt, Tool, Ablauf und allgemeine Fehler isolieren jeweils eine Fehlerklasse. Sie ermitteln die tatsächlich fehlerhafte Variable und verwerfen falsch positive Scorer-Ergebnisse.
Mögliche Korrekturen
Korrekturen zielen auf die konkrete fehlerhafte Variable, etwa einen Prompt, ein Tool-Schema, einen Ablauf oder eine Konfigurationsänderung, statt alles pauschal umzuschreiben.
Backtest-Validierung
Für jede mögliche Korrektur werden genau die geänderten Aufrufe bei gleichem Kontext erneut ausgeführt. Alle 112 Scorer bewerten das Ergebnis neu und belegen, dass der lokale Fehler behoben ist.
Vorwärtssimulation
Eine Vorwärtssimulation des vollständigen Szenarios führt den geänderten Agenten End-to-End aus. So wird das Gesamtergebnis validiert, nicht nur ein einzelner Aufruf. Verschlechtert sich eines von beiden, wird die Korrektur verworfen.
Konfidenz und Bericht
Jede Empfehlung enthält einen Konfidenz-Score. Der Bericht umfasst eine Management-Zusammenfassung, konkrete Erkenntnisse, Fehlermuster, eine Scorer-Aufschlüsselung und die zugrunde liegenden Belege.
Bereitstellung als Pull Request
Die beste Korrektur öffnet über BullMQ einen geplanten Pull Request mit allen Belegen. Ihre Engineers prüfen, kommentieren und führen ihn zusammen. Die abschließende Kontrolle bleibt bei Ihnen.
Der Kreislauf
NovaPilot schließt den Kreislauf. Es verarbeitet alle vorgelagerten Signale aus Traces, Scores, Simulationen und blockierten Ausgaben und liefert zusammengeführte Verbesserungen zurück.
Nächster Schritt
Produktive KI-Agenten, denen Ihre Kunden vertrauen können.
Im Produktivbetrieb bewährt bei Enterprise- und wachstumsstarken Teams