EntwicklungVollzeit
Senior AI Engineer
Remote (Indien)
Vollzeit
₹24-50 LPA + Unternehmensanteile
Remote
Stellenbeschreibung
Noveum.ai ist die Plattform für Tracing, Evaluierung und Observability von KI-Agenten. Tausende Entwickler nutzen sie, um ihre LLM-, RAG- und Multi-Agenten-Systeme zu überwachen, zu debuggen und zu optimieren. Wir suchen einen erfahrenen Senior AI Engineer mit mehr als 2 bis 3 Jahren Berufserfahrung, der umfassend KI-Agenten entwickelt, KI-Modelle produktiv betrieben und deren Verhalten gründlich analysiert und evaluiert hat. Sie arbeiten an führender KI-Forschung zu Agentenevaluierung, LLM-as-Judge und autonomer Optimierung und überführen sie in Produkte, auf die Entwickler täglich vertrauen. Für diese Senior-Position gelten bewusst hohe Anforderungen. Bitte bewerben Sie sich nur, wenn Sie die folgenden Voraussetzungen erfüllen.
Hauptaufgaben
- Architect, build, and ship agentic AI features end to end
- Design evaluation pipelines and LLM-as-judge systems that define what 'correct' means for agents
- Drive cutting-edge AI research on agent reliability, evaluation, and autonomous optimization
- Deploy, monitor, and tune models in production for reliability, latency, and cost
- Mine production traces to diagnose failures and systematically improve agent behavior
- Set technical direction and raise the bar for AI engineering across the team
- Agentenbasierte KI-Funktionen durchgängig konzipieren, entwickeln und bereitstellen
- Evaluierungspipelines und LLM-as-Judge-Systeme entwickeln, die definieren, was für Agenten als korrekt gilt
- Führende KI-Forschung zu Agentenzuverlässigkeit, Evaluierung und autonomer Optimierung vorantreiben
- Modelle produktiv bereitstellen, überwachen und hinsichtlich Zuverlässigkeit, Latenz und Kosten optimieren
- Produktions-Traces analysieren, um Fehler zu diagnostizieren und das Agentenverhalten systematisch zu verbessern
- Die technische Richtung vorgeben und das Niveau des KI-Engineerings im gesamten Team steigern
Anforderungen
- 2-3+ years building and shipping production AI/ML systems
- Built AI agents extensively: LLM tool-use, RAG, and multi-agent
- Deployed and operated AI models in production at real scale
- Rigorous evaluation & analysis: evals, LLM-as-judge, observability
- Expert-level Python (TypeScript a plus)
- Deep generative AI API & prompt-engineering experience (OpenAI, Anthropic, etc.)
- Mehr als 2 bis 3 Jahre Erfahrung mit der Entwicklung und Bereitstellung produktiver KI/ML-Systeme
- Umfangreiche Entwicklung von KI-Agenten: LLM-Tool-Nutzung, RAG und Multi-Agent
- Bereitstellung und Betrieb von KI-Modellen in der Produktion im realen Maßstab
- Fundierte Evaluierung und Analyse: Evals, LLM-as-Judge und Observability
- Python auf Expertenniveau (TypeScript von Vorteil)
- Umfangreiche generative KI-API- und Prompt-Engineering-Erfahrung (OpenAI, Anthropic usw.)
Bevorzugte Qualifikationen
- Published research, open-source AI tools, or other public work in AI/ML
- Experience building evals, observability, or tracing infrastructure
- Worked with agent frameworks and orchestration at scale
- Background in NLP, RL, or LLM fine-tuning / post-training
- Took AI systems from prototype to reliable production yourself
- Veröffentlichte Forschung, Open-Source-KI-Tools oder andere öffentliche Arbeiten im Bereich KI/ML
- Erfahrung mit dem Aufbau von Evaluierungs-, Observability- oder Tracing-Infrastrukturen
- Erfahrung mit Agent-Frameworks und Orchestrierung im großen Maßstab
- Erfahrung mit NLP, RL oder LLM-Fine-Tuning und Post-Training
- KI-Systeme selbst vom Prototyp zur zuverlässigen Produktion gebracht