Projekt | Remote | 100% Remote

AI Platform Operations Engineer (m/w/d)

AI Platform Operations Engineer (m/w/d)

Aktuell sind wir auf der Suche nach einem Infrastructure Engineer für den Betrieb einer On-Premise KI Plattform.

Beim Aufbau und Betrieb einer vollständig On-Premise betriebenen KI-Plattform suchen wir einen erfahrenen Experten im Bereich AI Platform Operations. Der Fokus liegt auf dem zuverlässigen Betrieb der KI-Infrastruktur, der Verwaltung des Inferenz-Stacks sowie der Kapazitätsplanung für GPU-basierte Workloads.

Zu Ihren Aufgaben gehören:

  • Eigenverantwortlicher Betrieb und Überwachung der KI-Inferenzplattform einschließlich Model Orchestrator
  • Dynamisches Laden, Entladen und Verwalten von KI-Modellen unter Berücksichtigung von GPU- und VRAM-Ressourcen
  • Monitoring, Analyse und Optimierung der GPU-Auslastung sowie der Systemperformance
  • Planung und Durchführung temporärer Benchmark- und Lasttest-Szenarien mit zusätzlichen Modellen und erhöhtem VRAM-Bedarf
  • Verwaltung und Pflege lokaler KI-Modelle (GGUF) sowie der zugehörigen Inferenzumgebung
  • Betrieb und Wartung des KI-Technologie-Stacks, insbesondere llama.cpp, whisper.cpp, OpenAI-kompatibler APIs und LangGraph
  • Administration und Betrieb der Vektordatenbank Qdrant im Kontext von Retrieval-Augmented Generation (RAG)
  • Kapazitätsplanung und Skalierungsmanagement für den Ausbau der GPU-Infrastruktur
  • Optimierung von Queue-, Batch- und Scheduling-Prozessen zur effizienten Ressourcennutzung
  • Steuerung und Integration von Hersteller-Releases und Container-Images
  • Überwachung und Absicherung der definierten Netzwerkverbindungen für Lizenzierung, Modelldownloads und freigegebene externe Dienste
  • Sicherstellung des Betriebsprinzips „vollständig On-Premise“ ohne Nutzung von Cloud-KI-Diensten

**Anforderungen:**

  • Mehrjährige Erfahrung im Betrieb von Linux-Servern in produktiven Umgebungen
  • Fundierte Erfahrung mit Docker und containerisierten Anwendungen
  • Praktische Erfahrung im Betrieb von GPU-basierten KI- oder Machine-Learning-Plattformen
  • Kenntnisse im Performance-Monitoring sowie in der Analyse von Ressourcenengpässen (insbesondere GPU und VRAM)
  • Erfahrung im Betrieb und in der Administration von KI-Inferenzumgebungen

**Zusätzliche Informationen:**

Konnten wir Ihr Interesse wecken? Dann freuen wir uns auf die Zusendung Ihres aussagekräftigen Expertenprofils unter Angabe Ihrer Stundensatzvorstellung.

Projekt-Nr.: 107219

Stellentyp: freiberuflich

Einsatzort: Remote

Start: asap

Dauer: 6 Monate

Gültig bis
27.09.2026