Projekt | Bayern | 100% Remote

Senior AI/ML Monitoring Engineer – Grafana / Prometheus / Kubernetes / LLM

Senior AI/ML Monitoring Engineer – Grafana / Prometheus / Kubernetes / LLM (m/w/d)

Für unseren Kunden suchen wir einen Senior AI/ML Monitoring Engineer – Grafana / Prometheus / Kubernetes / LLM (m/w/d).

**Start:** 01.09.2026 / ggf. früher möglich

**Laufzeit:** zunächst bis Ende 2026 mit Option auf Verlängerung

**Ort:** überwiegend Remote, bei Bedarf vereinzelt vor Ort

**Remote:** Deutschland bevorzugt, mindestens EU-Raum

**Sprache:** Deutsch

**Branche:** Public, Erfahrung wünschenswert aber kein Muss.

---

Projektbeschreibung

Im Rahmen einer umfangreichen KI-Plattform suchen wir einen erfahrenen Senior AI/ML Monitoring Engineer für den Aufbau und die Weiterentwicklung einer zentralen Monitoring- und Observability-Lösung für unterschiedliche KI- und Machine-Learning-Anwendungen.

Im Mittelpunkt des Projektes steht die Konzeption und Umsetzung eines übergreifenden Monitoring-Dashboards für produktive KI-Anwendungen und ML-Services.

Gesucht wird daher kein klassischer reiner Dashboard-Entwickler, sondern ein technisch sehr erfahrener Spezialist mit tiefem Verständnis von Machine Learning, LLMs und modernen KI-Plattformen, der dieses Know-how in den Bereichen Monitoring, Observability, Logging und Alerting einsetzen kann.

---

Aufgaben

  • Konzeption und Entwicklung eines zentralen Monitoring-Dashboards für unterschiedliche KI- und Machine-Learning-Anwendungen
  • Erstellung und Weiterentwicklung komplexer Grafana Dashboards
  • Konzeption und Umsetzung geeigneter Monitoring-, Alerting- und Observability-Konzepte für KI-/ML-Anwendungen
  • Integration unterschiedlicher Metriken, Logs und technischer Zustandsinformationen in eine zentrale Monitoring-Lösung
  • Aufbau und Weiterentwicklung von Monitoring-Lösungen mit Prometheus und Grafana
  • Integration von Logging-Lösungen auf Basis des Elastic Stack
  • Monitoring von containerisierten Anwendungen und Services innerhalb von Kubernetes-Umgebungen
  • Überwachung von ML-Pipelines, KI-Modellen, LLM-Anwendungen und agentenbasierten Systemen
  • Definition geeigneter Qualitäts- und Performance-Metriken für produktive KI-Anwendungen
  • Analyse von Fehlern, Performanceproblemen und Auffälligkeiten innerhalb produktiver KI-/ML-Systeme
  • Unterstützung bei Deployment- und Produktivsetzungsprozessen von KI- und ML-Anwendungen
  • Weiterentwicklung bestehender Monitoring- und Qualitätskonzepte aufgrund neuer Anwendungen, Modelle oder veränderter Datenlagen
  • Zusammenarbeit mit Data Scientists, ML Engineers, Plattformteams und weiteren technischen Stakeholdern

---

Anforderungen

**Must-Have:**

  • Sehr umfangreiche praktische Erfahrung mit Grafana und der Entwicklung komplexer Grafana Dashboards
  • Sehr gute Kenntnisse in Prometheus sowie Monitoring und Alerting
  • Tiefgehende praktische Erfahrung im Bereich Observability und Monitoring produktiver IT-/KI-Systeme
  • Sehr gute Kenntnisse in Kubernetes und Docker
  • Erfahrung mit Elastic Stack / zentralisierten Logging-Lösungen
  • Sehr gute Kenntnisse in Python
  • Tiefes Verständnis von Machine Learning und dem vollständigen ML-Lifecycle
  • Praktische Erfahrung mit KI-/ML-Plattformen und entsprechenden Architekturen
  • Mindestens 5 Jahre praktische Erfahrung mit On-Premises-KI-Plattformen auf Basis von Open-Source-Komponenten
  • Praktische Erfahrung mit Large Language Models (LLMs) und Generative AI
  • Erfahrung mit Agentic AI und dem Monitoring bzw. Testing von KI-Agenten
  • Kenntnisse in MCP (Model Context Protocol), Embeddings und Vector-Datenbanken
  • Erfahrung mit Backend-Systemen und REST-Schnittstellen
  • Kenntnisse in Kafka sowie Batch- und Streaming-Architekturen
  • Erfahrung mit Deployment- und CI/CD-Prozessen für KI-/ML-Anwendungen
  • Verständnis sicherheitsrelevanter Anforderungen innerhalb komplexer KI-Plattformarchitekturen
  • Erfahrung innerhalb großer und komplexer IT-, Daten- oder DWH-Landschaften
  • Sehr gute Deutschkenntnisse
  • Fähigkeit, sich sehr schnell und selbstständig in komplexe fachliche und technische Anforderungen einzuarbeiten

---

Rahmenbedingungen

  • Für das Projekt wird eine 100-prozentige Verfügbarkeit vorausgesetzt.
  • Aufgrund der Projekt- und Datenschutzanforderungen wird eine Leistungserbringung aus Deutschland bevorzugt. Eine Remote-Leistungserbringung muss mindestens aus dem EU-Raum erfolgen. Near- und Offshore-Konstellationen sind ausgeschlossen.
  • Voraussetzung für die Beauftragung ist eine bereits vorhandene erweiterte Sicherheitsüberprüfung (Ü2) oder die Bereitschaft, sich einer entsprechenden Sicherheitsüberprüfung zu unterziehen.

---

Bewerbung

Wir freuen uns auf Ihre Bewerbung mit aktuellem CV (in deutsch) und Angabe Ihres Stundensatzes.

Bewerbungen & Rückfragen immer gerne über Freelancermap oder per E-Mail an ***@***.io

Euer QUINCEY Team

Gültig bis
13.02.2027