Senior AI/ML Monitoring Engineer – Grafana / Prometheus / Kubernetes / LLM
Senior AI/ML Monitoring Engineer – Grafana / Prometheus / Kubernetes / LLM (m/w/d)
Für unseren Kunden suchen wir einen Senior AI/ML Monitoring Engineer – Grafana / Prometheus / Kubernetes / LLM (m/w/d).
**Start:** 01.09.2026 / ggf. früher möglich
**Laufzeit:** zunächst bis Ende 2026 mit Option auf Verlängerung
**Ort:** überwiegend Remote, bei Bedarf vereinzelt vor Ort
**Remote:** Deutschland bevorzugt, mindestens EU-Raum
**Sprache:** Deutsch
**Branche:** Public, Erfahrung wünschenswert aber kein Muss.
---
Projektbeschreibung
Im Rahmen einer umfangreichen KI-Plattform suchen wir einen erfahrenen Senior AI/ML Monitoring Engineer für den Aufbau und die Weiterentwicklung einer zentralen Monitoring- und Observability-Lösung für unterschiedliche KI- und Machine-Learning-Anwendungen.
Im Mittelpunkt des Projektes steht die Konzeption und Umsetzung eines übergreifenden Monitoring-Dashboards für produktive KI-Anwendungen und ML-Services.
Gesucht wird daher kein klassischer reiner Dashboard-Entwickler, sondern ein technisch sehr erfahrener Spezialist mit tiefem Verständnis von Machine Learning, LLMs und modernen KI-Plattformen, der dieses Know-how in den Bereichen Monitoring, Observability, Logging und Alerting einsetzen kann.
---
Aufgaben
- Konzeption und Entwicklung eines zentralen Monitoring-Dashboards für unterschiedliche KI- und Machine-Learning-Anwendungen
- Erstellung und Weiterentwicklung komplexer Grafana Dashboards
- Konzeption und Umsetzung geeigneter Monitoring-, Alerting- und Observability-Konzepte für KI-/ML-Anwendungen
- Integration unterschiedlicher Metriken, Logs und technischer Zustandsinformationen in eine zentrale Monitoring-Lösung
- Aufbau und Weiterentwicklung von Monitoring-Lösungen mit Prometheus und Grafana
- Integration von Logging-Lösungen auf Basis des Elastic Stack
- Monitoring von containerisierten Anwendungen und Services innerhalb von Kubernetes-Umgebungen
- Überwachung von ML-Pipelines, KI-Modellen, LLM-Anwendungen und agentenbasierten Systemen
- Definition geeigneter Qualitäts- und Performance-Metriken für produktive KI-Anwendungen
- Analyse von Fehlern, Performanceproblemen und Auffälligkeiten innerhalb produktiver KI-/ML-Systeme
- Unterstützung bei Deployment- und Produktivsetzungsprozessen von KI- und ML-Anwendungen
- Weiterentwicklung bestehender Monitoring- und Qualitätskonzepte aufgrund neuer Anwendungen, Modelle oder veränderter Datenlagen
- Zusammenarbeit mit Data Scientists, ML Engineers, Plattformteams und weiteren technischen Stakeholdern
---
Anforderungen
**Must-Have:**
- Sehr umfangreiche praktische Erfahrung mit Grafana und der Entwicklung komplexer Grafana Dashboards
- Sehr gute Kenntnisse in Prometheus sowie Monitoring und Alerting
- Tiefgehende praktische Erfahrung im Bereich Observability und Monitoring produktiver IT-/KI-Systeme
- Sehr gute Kenntnisse in Kubernetes und Docker
- Erfahrung mit Elastic Stack / zentralisierten Logging-Lösungen
- Sehr gute Kenntnisse in Python
- Tiefes Verständnis von Machine Learning und dem vollständigen ML-Lifecycle
- Praktische Erfahrung mit KI-/ML-Plattformen und entsprechenden Architekturen
- Mindestens 5 Jahre praktische Erfahrung mit On-Premises-KI-Plattformen auf Basis von Open-Source-Komponenten
- Praktische Erfahrung mit Large Language Models (LLMs) und Generative AI
- Erfahrung mit Agentic AI und dem Monitoring bzw. Testing von KI-Agenten
- Kenntnisse in MCP (Model Context Protocol), Embeddings und Vector-Datenbanken
- Erfahrung mit Backend-Systemen und REST-Schnittstellen
- Kenntnisse in Kafka sowie Batch- und Streaming-Architekturen
- Erfahrung mit Deployment- und CI/CD-Prozessen für KI-/ML-Anwendungen
- Verständnis sicherheitsrelevanter Anforderungen innerhalb komplexer KI-Plattformarchitekturen
- Erfahrung innerhalb großer und komplexer IT-, Daten- oder DWH-Landschaften
- Sehr gute Deutschkenntnisse
- Fähigkeit, sich sehr schnell und selbstständig in komplexe fachliche und technische Anforderungen einzuarbeiten
---
Rahmenbedingungen
- Für das Projekt wird eine 100-prozentige Verfügbarkeit vorausgesetzt.
- Aufgrund der Projekt- und Datenschutzanforderungen wird eine Leistungserbringung aus Deutschland bevorzugt. Eine Remote-Leistungserbringung muss mindestens aus dem EU-Raum erfolgen. Near- und Offshore-Konstellationen sind ausgeschlossen.
- Voraussetzung für die Beauftragung ist eine bereits vorhandene erweiterte Sicherheitsüberprüfung (Ü2) oder die Bereitschaft, sich einer entsprechenden Sicherheitsüberprüfung zu unterziehen.
---
Bewerbung
Wir freuen uns auf Ihre Bewerbung mit aktuellem CV (in deutsch) und Angabe Ihres Stundensatzes.
Bewerbungen & Rückfragen immer gerne über Freelancermap oder per E-Mail an ***@***.io
Euer QUINCEY Team